用豆包工作研究 Jev:从模型判断到软件决策

Dongxi 东锡 NLP · @dongxi_nlp · X·2026-09-23 12:27·1小时前
AI 导读

作者用豆包工作的计划模式、目标模式和任务队列完成对 Jev 的研究,产出五主题知识库、24 项声明核查记录和可点回证据的研究观察站。Jev 由 TypeSafe 发布,厂商报告 193.6 倍速度和 444.6 倍成本优势;独立早期测试中 24 份挪威语文档中位延迟 0.32 秒,加入限定词后 ECE 从 0.040 升至 0.116。

Dongxi 东锡 NLP@dongxi_nlp
38AI 编辑部评分,满分 100

用豆包工作研究 Jev:从模型判断到软件决策

2026-09-23 12:27· 1小时前
AI 导读

作者用豆包工作的计划模式、目标模式和任务队列完成对 Jev 的研究,产出五主题知识库、24 项声明核查记录和可点回证据的研究观察站。Jev 由 TypeSafe 发布,厂商报告 193.6 倍速度和 444.6 倍成本优势;独立早期测试中 24 份挪威语文档中位延迟 0.32 秒,加入限定词后 ECE 从 0.040 升至 0.116。

https://x.com/i/article/2102477678268022784

用豆包工作研究 Jev:从模型判断到软件决策

40 份已有研究文件被整理成五主题知识库、24 项声明核查记录,以及一个能从结论点回证据的研究观察站,这是豆包工作帮助我研究 Jev 过程中的产物。

客户发来一封邮件,系统需要判断:交给哪个部门,要不要升级处理,紧急程度有多高。邮件可以很长,软件需要的答案却很短。

以这封邮件为例,如果让 Jev 来做判断,我会把邮件内容和问题一起交给它:用 Choice 选择处理部门,用 Noul 估计是否需要升级处理,用 Score 按有序标准评估紧急程度。程序拿到返回值,就可以决定下一步动作。

我想弄清三个问题:

Jev判断是否可靠,速度优势从哪里来,返回的概率能不能用。

于是,我把已有的 Jev 材料交给 豆包工作,继续做研究。豆包工作这轮新增了 “计划模式”和“目标模式”,同时上线 任务队列、.md 文件在线编辑。这几项功能,正好用来组织查证、修改文档和推进长任务。

三个入口:判断的可靠性、运行效率、概率是否可信。72 条纳入来源来自已有材料,本轮继续重访与深读。

已有材料里混着厂商文档、论文、独立报告和分析笔记。先查什么、哪些结论需要重看,都需要排出顺序。

豆包工作的 “计划模式” 先做只读调研,生成一份 Markdown 实施计划。你可以修改、批准或要求重新生成,确认后再执行。这次计划写清了阅读优先级、知识库结构、核查字段和验收要求,批准前没有改动原始输入文件。

豆包工作 · 计划模式。先盘点材料,再安排查证顺序。图中是计划阶段的目标。

审阅时,我们收紧了三条要求:

阅读深度如实记录,功能相似与内部机制分开,无法核实的地方保留缺口。

这些意见通过 .md 文件在线编辑 写进计划。豆包工作支持直接查看、修改生成的 Markdown,再让 AI 继续调整或按文档执行。保存后,执行任务重新读取了修订内容,后面的查证就有了明确依据。

豆包工作 · .md 文件在线编辑。图中是计划的阅读界面;审阅修订已保存,执行任务随后重新读取。

先把 Jev 放进已有研究里。

理解 Jev,可以先看几条相关研究路线:分类模型研究如何把文本映射到标签,结构化输出研究如何约束答案形状,校准研究概率与实际结果是否相符,路由与服务系统研究如何把判断接入工作流。它们为理解 Jev 提供了不同的切入点。

例如,GLiClass 联合编码文本与类别描述,可以根据给定的标签进行分类。这是 Jev 值得比较的一条路线。两者功能接近,仍不足以推断 Jev 的内部实现。

颜色区分研究方向,虚线表示功能对照。中心位置只表示研究对象,图中没有推断 Jev 的架构或学术引用关系。

豆包工作据此展开了五个主题:分类与决策、结构化输出、概率与校准、并行推理与服务效率、路由与验证工作流,用来梳理可比方法、评测依据和可能的机制解释。每页都有概念解释、代表研究、与 Jev 的联系、证据局限和后续问题。Jev 未公开的实现细节,仍保留为待验证问题。

读到一篇论文,可以知道它提供的是对照模型、评测方法,还是某个结论的适用条件。材料之间开始有了联系。

格式正确,还需要判断正确。

以客服分流为例:假设把 Jev 的 Choice 选项设为“退款”“物流”“账单”,输出受限于这三个选项,仍可能选错部门。这个例子说明,格式合规和业务判断正确需要分别检验。

Jev 的发布方 TypeSafe 在发布说明中解释,图里的 0% 类型错误来自输出结构的保证。这个数字描述的是格式约束,不能据此推断业务判断没有错误。

JSONSchemaBench 把结构覆盖、输出合规和内容质量分别评估。Jev 自己的局限文档,也记录了字面理解、计数、长状态和对抗输入等问题。

Jev 的工程价值很明确:让程序直接接住受约束的判断。判断在真实任务里有多可靠,还要单独测量。

豆包工作把这些区别写进了 24 项核查记录。每项保留原表述、来源、支持与反面材料、适用条件,以及下一步实验。没有证据的地方,也明确记下来。

查证由多个 子代理(subagent) 分工推进:厂商页面重访、独立报告追查、学术阅读和引用关系核对。各自的记录再汇入声明表与知识库。

界面能看到问题拆解、查阅动作和阶段摘要,文件里能找到对应证据。阅读深度有分歧,就回到记录核对。最终保留了 10 篇方法或结果层面的学术阅读、2 篇摘要层面阅读,官方文档单列。

豆包工作 · 研究执行中。左侧是查证和修订记录,右侧是进度及 A/B/C/D 子代理分工。

概率有用,但要知道它在描述什么。

以 Jev 返回的概率为例:如果一批同类事件都被赋予约 0.8 的概率,校准良好意味着其中约 80% 实际成立。这种频率关系需要用数据检验,不能仅凭接口返回概率就认定成立。

Guo 等人的研究系统讨论了神经网络的校准。Ovadia 等人进一步说明,数据分布变化后,原有校准表现可能失效。

一个 Jev 独立早期测试很值得看:24 份挪威语文档,中位延迟 0.32 秒;问题加长并加入限定词后,ECE 从 0.040 升到 0.116。参照标签由模型生成,不能把这些数值当作经过人工确认的总体准确性。

同一份早期报告:24 份文档、单语言、单版本。参照标签由模型生成,对照服务涉及多个 provider。

概率可以帮助程序选择接受、暂缓或升级处理,但阈值需要用自己的数据验证:接受多少样本,接受部分的错误率是多少,剩余样本交给人工或更强模型后,总成本怎样变化。

还要区分概率与 confidence:Jev 的 Choice 和 Score 根据概率分布的集中程度计算 confidence,它不能直接当作答案正确的概率。豆包工作的知识库把这些区别与校准、选择性预测和工作流路由放在一起,方便沿着同一个判断继续查下去。

速度优势,要放回比较条件里。

TypeSafe 报告的 193.6 倍速度和 444.6 倍成本优势,来自厂商的工作流评估;发布说明也将其描述为实际收益中偏高的一端。读这些数字,需要一起看任务、输出要求、参考答案和对照模型。

一次 API 调用,不能告诉我们内部执行了几次模型计算。共享输入、小模型、缓存复用和服务调度,都可能影响延迟。知识库把这些解释列为机制假设,保留需要进一步区分的问题。

下一步评测也由此清楚了:让 Jev、通用模型、分类模型和重排序模型面对相同输入,分别匹配完整输出接口与最终软件动作,把失败、重试、人工升级计入记录,同时比较判断质量、校准、延迟与总成本。

后续评测方案,尚未执行。小模型与规则系统是不同的对照分支。

让研究按目标继续推进。

查证之后,还要把结果整理成能用的文档和网站。豆包工作的 “目标模式” 允许先写清多项验收要求,再逐项校验,对未达标的项目继续调整。界面持续显示“进行中的目标”,方便查看当前任务。

这次目标包括:五主题文档齐全,24 项声明都有记录,证据链可点击,站点与来源台账一致,桌面和窄屏页面正常使用。

这类研究要查文献、核对声明、整理知识库,还要搭建和验收站点,执行时间较长。这次任务因使用额度耗尽而中断。我使用重置恢复额度后,豆包工作在同一个任务里重新读取已有知识库、核查表和站点,接着修订与验收。已有成果可以继续使用,长线研究得以顺利推进。

任务队列 用来安排后续工作。当前任务运行时,新指令可以先排队,完成后自动依次执行,也可以选择立即发送。需要影响当前工作的修订,则通过引导消息送入正在运行的任务。配合 .md 文件在线编辑,研究者可以边审阅、边调整后续安排。

豆包工作还支持跟随系统或单独设置深色模式,阅读与核查时可以保持自己习惯的外观。

豆包工作 · 目标模式与任务队列。此时进度为 4/6,下方是未再次提交的目标编辑草稿;两条无关任务正文已遮挡。

最终,观察站通过了 62 项浏览器走查,41 项输入基线的哈希核对一致。文档、核查记录和网站已经交付。本轮没有运行 Jev API 实验,各项科学判断仍保留对应的证据范围。

对 Jev,接下来值得做的是用真实任务检验概率决策接口,测清可靠性、校准和端到端成本。

这次用豆包工作,最实用的体验是研究可以连续推进:先审阅计划,再分工查证;文档可以直接改,中断后可以接着做,交付前按目标检查。

打开观察站中的一个问题,就能找到当前判断、依据和下一步实验。下一轮研究,可以从这里继续。新功能“目标模式”,“计划模式”和“任务队列” 让豆包工作可以胜任非常复杂,长周期,多线任务的工作,推荐大家使用。

9 月,豆包继续向所有用户赠送一个月订阅权益。下载或升级至最新版豆包工作电脑端或豆包电脑端,即可领取。已经领取 8 月权益的用户,可在原订阅到期后继续享受新一个月的福利。

来源:Dongxi 东锡 NLP· x.com