# 上海人工智能实验室发布 Atria Dawn Preview，744B 纯文本模型主打可验证交付

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-09-15 11:41
- AIHOT 分数：64
- AIHOT 链接：https://aihot.news/items/cmu25kui004mbro9vnhc10une
- 原文链接：https://x.com/AYi_AInotes/status/2099705084590293304

## AI 摘要

上海人工智能实验室发布 Atria Dawn Preview，一个 744B MoE 纯文本模型，宣称代码和权重按 MIT 协议开源但权重和本地部署尚未就绪，实测先走 API。

## 正文

卧槽兄弟们，一只踩着自行车往前蹬的白鹈鹕，
一枚自己揪出装配错误的长征七号，
一架能剖开看起落架的战斗机，
还有一个能把你玩爽的火灾逃生训练场。
这四个八竿子打不着的东西，
竟然全是由同一个纯文本大模型交出来的！！

它是上海人工智能实验室刚放出的 Atria Dawn Preview，发现官方号这两天刚在 X 上低调露头@AtriaASI。

我把自己上机实测跑的单文件网页，
和官方三个硬核回放剪在了一条视频里，
看完直接推翻了我对代码 Agent 的认知，
喵的这代差拉得真的太狠了！

先说我自己亲手跑的这只鹈鹕骑车：
就丢给它一句话需求、没给任何素材，
它直接甩回来一个单文件网页。

零外部图片、零外部依赖库，双击丢进浏览器直接开骑！
手搓的简易 IK 逆向运动学让蹼足跟着曲柄自然弯伸，
喉囊里的小鱼还顺着重力晃，按空格能停，
系统切到减少动态效果它还老老实实给了静止回退态，

这种前端老手都未必记得写的无障碍细节，
它一次成型全带上了。

后面三个是官方对过的回放和实机成品，
不是我从零跑出来的，但正因为是官方素材，
才更看得出它真正的野心：
1️⃣ 长征七号 CAD（自己抓组装错误）：
不是画个像火箭的外壳，而是先上网查结构，再参数化出一整棵 STEP 装配树，一级二级、贮箱、尾裙全能拆开。最绝的是它自己抓出一个组装错误：一个公共函数在闭合型面时把半径当成了高度，十台发动机凭空多出六万多立方毫米的假碰撞！这种错拓扑合法、布尔也闭合，普通检查直接放行，它硬是靠喉口位置一点点比对把坑挖出来，修完再验：147 处检查，失败为零；

2️⃣ 现代战斗机 CAD（科研式协同改稿）：
按九个子系统铺开零件清单，标清哪些自己建模、哪些是外购件，把十一个零件批量生成再逐个校验。中途人打断它，指出上一版把后起落架舱门弄丢了，它就倒回去改铰链、调开门角度，确认 66 处装配互不干涉，再藏掉机身露出起落架、切线框拉起飞仿真。这不是一锤子抽卡，是被人打断了还接得住、改得动；

3️⃣ 火灾逃生 3D（能被你玩砸的单文件）：
单文件就能打开的第一人称训练场。七楼夜间失火，查门温、打湿毛巾、低姿过走廊、关燃气、到阳台用缓降器。湿毛巾得先开水龙头打湿且只能顶一阵，靠火太近热辐射真扣血，走错一步结算时一条条复盘扣分再给安全评级。它厉害的不是会做游戏，是交出来的东西能被你亲手玩砸。

四个东西看着跨了动画、工业建模和交互，底层其实是同一套逻辑:
模型在脑子里推理，Harness 像项目经理一样盯死任务状态和失败重试，真实环境充当那个不留情面的考场。
代码语法对根本不算完，文件在不在、几何对不对、事件监听通不通，全在环境里验过、拿到外部绿灯，它才交差。

而且这不是靠几个 Demo 唬人，
官方跑分图里看得明明白白：
最考验 Agent 自主干活的 AutomationBench 它冲到 53.8 表内最高，
网安 CyberGym 拿下 86.5 登顶；

但转头看右下角纯软件工程的 SWE-Bench Pro，
它只有 59.6，明显落后 Claude Opus 5 的 74.7，
甚至在机器学习跑分 MLE-Bench 上也被一线闭源压着半头。

看懂这个落差，反而彻底把它的真实定位说透了：
它赌的从来不是谁裸写算法题更溜，
而是谁能端到端把一件复杂任务办成、
还能在真实环境里自己验证交差。

更反差的是团队背景：
底座在 744B 的 MoE 上训练，
代码和权重宣称按 MIT 协议开源，
而研发主力约三分之二是上海人工智能实验室联合复旦、中科院软件所、人大、中科院自动化所、华东师大和哈工大等中国知名高校的的在校学生，复旦副教授桂韬带队，一群还在读书的人在做给科研工作者用的智能体。

当然，几盆冷水必须提前浇透：
→CAD 回放不等于工业适航认证，火灾网页不等于消防权威资质，单次受限 Demo 更不等于你随手一句就能造出火箭，
→它是纯文本模型，画面全是代码算出来的 ，
虽然开源协议挂上了，
但目前权重文件和本地部署还没就绪，
别急着本地折腾，实测先走 API。

但抛开这几个炸裂的画面，
真正让我感受到那种无声压迫感的，
是它挑明的这件事：
大模型靠字迹工整、吐一段漂亮代码骗及格分的时代，
正在彻底过去，
下一道分水岭不是谁说话更像人，
而是谁交出来的东西，
真的能打开、能检查、能改、能被外部环境验证。

四个交付物里我自己最喜欢那只鹈鹕，
被火箭自己抓 bug 惊到的，评论区举个手hh。

### 引用推文

> AYi：holy shit，当全网都在用聊天框把 Agent 当玩具玩， 国内实验室已经把自主闭环推到恐怖的境地了， 96 个研发人员里 65 个是在校学生，学生组长占了 70%， 就是这样一支年轻团队，反手甩出了一个 744B 的 MIT 开源 Agent 怪物。 本以为又是哪个团队在吹牛逼，点开代码库给我看愣了： 744B...
