# 用豆包工作研究 Jev：从模型判断到软件决策

- 来源：Dongxi 东锡 NLP (@dongxi_nlp)
- 发布时间：2026-09-23 12:27
- AIHOT 分数：38
- AIHOT 链接：https://aihot.news/items/cmudm693b0g1xrogg6sqibgzb
- 原文链接：https://x.com/dongxi_nlp/status/2102615749663531012

## AI 摘要

作者用豆包工作的计划模式、目标模式和任务队列完成对 Jev 的研究，产出五主题知识库、24 项声明核查记录和可点回证据的研究观察站。Jev 由 TypeSafe 发布，厂商报告 193.6 倍速度和 444.6 倍成本优势；独立早期测试中 24 份挪威语文档中位延迟 0.32 秒，加入限定词后 ECE 从 0.040 升至 0.116。

## 正文

https://x.com/i/article/2102477678268022784

用豆包工作研究 Jev：从模型判断到软件决策

40 份已有研究文件被整理成五主题知识库、24 项声明核查记录，以及一个能从结论点回证据的研究观察站，这是豆包工作帮助我研究 Jev 过程中的产物。

客户发来一封邮件，系统需要判断：交给哪个部门，要不要升级处理，紧急程度有多高。邮件可以很长，软件需要的答案却很短。

以这封邮件为例，如果让 Jev 来做判断，我会把邮件内容和问题一起交给它：用 Choice 选择处理部门，用 Noul 估计是否需要升级处理，用 Score 按有序标准评估紧急程度。程序拿到返回值，就可以决定下一步动作。

我想弄清三个问题：

Jev判断是否可靠，速度优势从哪里来，返回的概率能不能用。

于是，我把已有的 Jev 材料交给 豆包工作，继续做研究。豆包工作这轮新增了 “计划模式”和“目标模式”，同时上线 任务队列、.md 文件在线编辑。这几项功能，正好用来组织查证、修改文档和推进长任务。

三个入口：判断的可靠性、运行效率、概率是否可信。72 条纳入来源来自已有材料，本轮继续重访与深读。

已有材料里混着厂商文档、论文、独立报告和分析笔记。先查什么、哪些结论需要重看，都需要排出顺序。

豆包工作的 “计划模式” 先做只读调研，生成一份 Markdown 实施计划。你可以修改、批准或要求重新生成，确认后再执行。这次计划写清了阅读优先级、知识库结构、核查字段和验收要求，批准前没有改动原始输入文件。

豆包工作 · 计划模式。先盘点材料，再安排查证顺序。图中是计划阶段的目标。

审阅时，我们收紧了三条要求：

阅读深度如实记录，功能相似与内部机制分开，无法核实的地方保留缺口。

这些意见通过 .md 文件在线编辑 写进计划。豆包工作支持直接查看、修改生成的 Markdown，再让 AI 继续调整或按文档执行。保存后，执行任务重新读取了修订内容，后面的查证就有了明确依据。

豆包工作 · .md 文件在线编辑。图中是计划的阅读界面；审阅修订已保存，执行任务随后重新读取。

先把 Jev 放进已有研究里。

理解 Jev，可以先看几条相关研究路线：分类模型研究如何把文本映射到标签，结构化输出研究如何约束答案形状，校准研究概率与实际结果是否相符，路由与服务系统研究如何把判断接入工作流。它们为理解 Jev 提供了不同的切入点。

例如，GLiClass 联合编码文本与类别描述，可以根据给定的标签进行分类。这是 Jev 值得比较的一条路线。两者功能接近，仍不足以推断 Jev 的内部实现。

颜色区分研究方向，虚线表示功能对照。中心位置只表示研究对象，图中没有推断 Jev 的架构或学术引用关系。

豆包工作据此展开了五个主题：分类与决策、结构化输出、概率与校准、并行推理与服务效率、路由与验证工作流，用来梳理可比方法、评测依据和可能的机制解释。每页都有概念解释、代表研究、与 Jev 的联系、证据局限和后续问题。Jev 未公开的实现细节，仍保留为待验证问题。

读到一篇论文，可以知道它提供的是对照模型、评测方法，还是某个结论的适用条件。材料之间开始有了联系。

格式正确，还需要判断正确。

以客服分流为例：假设把 Jev 的 Choice 选项设为“退款”“物流”“账单”，输出受限于这三个选项，仍可能选错部门。这个例子说明，格式合规和业务判断正确需要分别检验。

Jev 的发布方 TypeSafe 在发布说明中解释，图里的 0% 类型错误来自输出结构的保证。这个数字描述的是格式约束，不能据此推断业务判断没有错误。

JSONSchemaBench 把结构覆盖、输出合规和内容质量分别评估。Jev 自己的局限文档，也记录了字面理解、计数、长状态和对抗输入等问题。

Jev 的工程价值很明确：让程序直接接住受约束的判断。判断在真实任务里有多可靠，还要单独测量。

豆包工作把这些区别写进了 24 项核查记录。每项保留原表述、来源、支持与反面材料、适用条件，以及下一步实验。没有证据的地方，也明确记下来。

查证由多个 子代理（subagent） 分工推进：厂商页面重访、独立报告追查、学术阅读和引用关系核对。各自的记录再汇入声明表与知识库。

界面能看到问题拆解、查阅动作和阶段摘要，文件里能找到对应证据。阅读深度有分歧，就回到记录核对。最终保留了 10 篇方法或结果层面的学术阅读、2 篇摘要层面阅读，官方文档单列。

豆包工作 · 研究执行中。左侧是查证和修订记录，右侧是进度及 A／B／C／D 子代理分工。

概率有用，但要知道它在描述什么。

以 Jev 返回的概率为例：如果一批同类事件都被赋予约 0.8 的概率，校准良好意味着其中约 80% 实际成立。这种频率关系需要用数据检验，不能仅凭接口返回概率就认定成立。

Guo 等人的研究系统讨论了神经网络的校准。Ovadia 等人进一步说明，数据分布变化后，原有校准表现可能失效。

一个 Jev 独立早期测试很值得看：24 份挪威语文档，中位延迟 0.32 秒；问题加长并加入限定词后，ECE 从 0.040 升到 0.116。参照标签由模型生成，不能把这些数值当作经过人工确认的总体准确性。

同一份早期报告：24 份文档、单语言、单版本。参照标签由模型生成，对照服务涉及多个 provider。

概率可以帮助程序选择接受、暂缓或升级处理，但阈值需要用自己的数据验证：接受多少样本，接受部分的错误率是多少，剩余样本交给人工或更强模型后，总成本怎样变化。

还要区分概率与 confidence：Jev 的 Choice 和 Score 根据概率分布的集中程度计算 confidence，它不能直接当作答案正确的概率。豆包工作的知识库把这些区别与校准、选择性预测和工作流路由放在一起，方便沿着同一个判断继续查下去。

速度优势，要放回比较条件里。

TypeSafe 报告的 193.6 倍速度和 444.6 倍成本优势，来自厂商的工作流评估；发布说明也将其描述为实际收益中偏高的一端。读这些数字，需要一起看任务、输出要求、参考答案和对照模型。

一次 API 调用，不能告诉我们内部执行了几次模型计算。共享输入、小模型、缓存复用和服务调度，都可能影响延迟。知识库把这些解释列为机制假设，保留需要进一步区分的问题。

下一步评测也由此清楚了：让 Jev、通用模型、分类模型和重排序模型面对相同输入，分别匹配完整输出接口与最终软件动作，把失败、重试、人工升级计入记录，同时比较判断质量、校准、延迟与总成本。

后续评测方案，尚未执行。小模型与规则系统是不同的对照分支。

让研究按目标继续推进。

查证之后，还要把结果整理成能用的文档和网站。豆包工作的 “目标模式” 允许先写清多项验收要求，再逐项校验，对未达标的项目继续调整。界面持续显示“进行中的目标”，方便查看当前任务。

这次目标包括：五主题文档齐全，24 项声明都有记录，证据链可点击，站点与来源台账一致，桌面和窄屏页面正常使用。

这类研究要查文献、核对声明、整理知识库，还要搭建和验收站点，执行时间较长。这次任务因使用额度耗尽而中断。我使用重置恢复额度后，豆包工作在同一个任务里重新读取已有知识库、核查表和站点，接着修订与验收。已有成果可以继续使用，长线研究得以顺利推进。

任务队列 用来安排后续工作。当前任务运行时，新指令可以先排队，完成后自动依次执行，也可以选择立即发送。需要影响当前工作的修订，则通过引导消息送入正在运行的任务。配合 .md 文件在线编辑，研究者可以边审阅、边调整后续安排。

豆包工作还支持跟随系统或单独设置深色模式，阅读与核查时可以保持自己习惯的外观。

豆包工作 · 目标模式与任务队列。此时进度为 4/6，下方是未再次提交的目标编辑草稿；两条无关任务正文已遮挡。

最终，观察站通过了 62 项浏览器走查，41 项输入基线的哈希核对一致。文档、核查记录和网站已经交付。本轮没有运行 Jev API 实验，各项科学判断仍保留对应的证据范围。

对 Jev，接下来值得做的是用真实任务检验概率决策接口，测清可靠性、校准和端到端成本。

这次用豆包工作，最实用的体验是研究可以连续推进：先审阅计划，再分工查证；文档可以直接改，中断后可以接着做，交付前按目标检查。

打开观察站中的一个问题，就能找到当前判断、依据和下一步实验。下一轮研究，可以从这里继续。新功能“目标模式”，“计划模式”和“任务队列” 让豆包工作可以胜任非常复杂，长周期，多线任务的工作，推荐大家使用。

9 月，豆包继续向所有用户赠送一个月订阅权益。下载或升级至最新版豆包工作电脑端或豆包电脑端，即可领取。已经领取 8 月权益的用户，可在原订阅到期后继续享受新一个月的福利。
