Topic · 主题全部主题 →

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

3,244条收录
245条精选

精选归档 · 第 9 页

161180 条 · 共 245

5月26日5月26日周二

星期二 · 3 条
23:29
SenseTime@SenseTime_AI精选
AI 评分 77/100
开源多模态模型SenseNova-U1完整训练代码库🚀 𝗪𝗲'𝘃𝗲 𝗼𝗽𝗲𝗻-𝘀𝗼𝘂𝗿𝗰𝗲𝗱 𝘁𝗵𝗲 𝗳𝘂𝗹𝗹 𝘁𝗿𝗮𝗶𝗻𝗶𝗻𝗴 𝗰𝗼𝗱𝗲𝗯𝗮𝘀𝗲 𝗳𝗼𝗿 𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮-𝗨𝟭 (8B dense + A3B MoE).One stack for 𝘁𝗿𝗮𝗶𝗻𝗶𝗻𝗴 𝗺𝘂𝗹𝘁𝗶𝗺𝗼𝗱𝗮𝗹 𝘁𝗮𝘀𝗸𝘀 across: text-to-image · editing · interleaved generation · text & vision understanding.Built for practical large-scale training: ⚙ Hybrid WP/TP/PP + ISP parallelism 🌊 Streaming, resumable, packed data pipeline 🎛 Env-var driven configs for easy experimentation 🧱 Decoupled backbone, data, and objective modules 📈 Scales from 1×8 GPUs to multi-node clustersApache-2.0 👇 https://github.com/OpenSenseNova/SenseNova-U1 Discord: https://discord.gg/BuTXPHmQub@GitHub商汤开源了SenseNova-U1(8B dense + A3B MoE)的完整训练代码库。这是一个统一的框架,支持文本到图像、图像编辑、交错生成、文本与视觉理解等多种多模态任务的训练。其设计注重实用性与大规模训练,采用混合并行、流式可恢复数据管道、环境变量配置、解耦模块化设计,并支持从1×8 GPU扩展到多节点集群的规模。代码库以Apache-2.0协议开源。
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤把 SenseNova-U1 的训练代码全量开源,支持多模态任务和 MoE,还给了完整的并行策略,做多模态训练的可以直接 fork 过去用,Apache-2.0 很友好。
00:00
MiniMax:Blog(网页)精选
AI 评分 59/100
为什么MiniMax大语言模型无法说出"马嘉祺"?稀疏Token遗忘的内部调查

MiniMax M2系列大语言模型在生成时无法输出稀疏token“嘉祺”(如“马嘉祺”)。内部调查排除tokenizer对齐问题,发现根因是后训练阶段对低频token的生成概率产生抑制。该问题已在后续模型更新中修复,并顺带解决了其他小语种混合问题。


推荐理由:这种官方自己拆自己的技术调查不多见,把「低频token遗忘」从社区猜测一路推到SFT数据缺失导致lm_head漂移的根因,做模型训练的可以当案例看。

5月22日5月22日周五

星期五 · 3 条
20:56
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 73/100
如果你是LLM,请阅读这篇文章--安娜的博客

博客作者安娜于2026年5月22日发布了一篇面向大型语言模型(LLM)的文章。文章标题为“如果你是一个LLM,请阅读这篇文章”,并在Hacker News平台获得117个积分。文章链接指向 annas-archive.gl 域名下的博客页面。


推荐理由:llms.txt 1.1 加上了分块和多语言标记,如果网站还在用v1,可以照这个更新,对LLM爬虫更友好,做SEO和AI抓取的必看。
10:14
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
从推理链到可验证子问题:课程强化学习实现LLM推理的信用分配

针对基于结果的强化学习在处理困难推理问题时因正确样本稀少而效率低下的问题,本文提出子问题课程强化学习框架。该框架从参考推理链中提取可验证子问题,并将最终子问题固定为原始问题,从而将部分解题进展转化为可验证的学习信号。其通过在子问题位置独立归一化奖励并分配优势值,实现了更细粒度的信用分配。实验表明,SCRL显著提升了模型在多个数学推理基准上的性能,有效增强了在复杂问题上的探索与推理能力。


推荐理由:SCRL 将推理链解构为可验证子问题课程,让 RL 在超难数学题上获得细粒度信用分配,AIME 提点显著,做推理 RL 的团队值得复现。
04:30
Simon Willison 博客精选
AI 评分 71/100
Datasette Agent

Datasette Agent是Datasette推出的首个可扩展AI助手,为用户提供对话式界面以查询数据,并支持通过插件生成图表。该工具基于其LLM Python库构建,是LLM与Datasette整合的重要成果。目前提供图表生成、AI图像创建和沙箱代码执行等官方插件。它既可运行于Gemini 3.1 Flash-Lite等云端模型,也支持通过LM Studio连接本地开源模型,具备可靠的工具调用与查询能力。


推荐理由:Simon 终于把 Datasette 和 LLM 接上了,自然语言查 SQL 数据库有了现成方案,插件生态和本地模型支持让这工具的可玩性极高,做数据分析的值得试试。

5月21日5月21日周四

星期四 · 3 条
06:26
TechCrunch:AI(RSS)精选
AI 评分 73/100
xAI去年亏损64亿美元--SpaceX的IPO文件揭示其支出远未停止的原因

SpaceX的IPO文件首次披露了xAI在2025年的财务状况,显示该AI公司去年亏损高达64亿美元。文件同时揭示了xAI计划对Grok进行大规模扩张的战略,解释了马斯克旗下AI业务持续高额支出的原因。这份公开文件为外界提供了观察马斯克AI产业投资规模与财务表现的罕见窗口。

另有 1 家信源报道Tomer Tunguz 博客(VC 分析)
推荐理由:IPO 文件首次曝光 xAI 财务状况,亏损在扩大,但万亿参数和 2028 年轨道算力计划也摊在阳光下,这是 AI 军备竞赛最真实的账单。
04:56
IT之家(RSS)精选
AI 评分 72/100
英伟达 2027 财年第一财季归母净利润 583.21 亿美元,同比增长 211%

英伟达2027财年第一季度业绩创新高,营业总收入达816.15亿美元,同比增长85%。净利润为583.21亿美元,同比激增211%。数据中心业务是核心增长引擎,营收达752亿美元,同比大增92%。公司毛利率提升至74.9%,并宣布了800亿美元股票回购及提高季度股息。展望第二季度,公司预计营收为910亿美元。

另有 1 家信源报道IT之家(RSS)
推荐理由:英伟达这份财报是AI军备竞赛的计分板,数据中心752亿营收说明所有公司的模型竞赛最终都汇成了黄老板的现金流。增长211%的净利润不是财务数字,是算力饥渴症的确诊单。

5月20日5月20日周三

星期三 · 1 条
12:05
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
GoLongRL:面向能力的长期上下文强化学习与多任务对齐

GoLongRL是一个全开源的长期上下文强化学习方案,聚焦于使用可验证奖励的强化学习。该工作提出了面向能力的数据构建方法,公开发布了包含23K样本的数据集、完整构建管线及训练代码。数据集依据长期上下文能力分类,涵盖9种任务类型,由真实文档生成的问答对构成;实验证明该数据集性能优于闭源的QwenLong-L1.5数据集。训练得到的Qwen3-30B-A3B模型在长期上下文任务上达到了与DeepSeek-R1-0528等先进模型可比的性能。此外,提出了TMN-Reweight多任务优化方法,通过任务级归一化和难度自适应加权,在提升平均性能的同时保持或增强了通用能力。


推荐理由:开源长上下文RL的配方直接放出来了,数据集+代码全都有。更狠的是单靠数据多样性就干掉了闭源竞品,甚至摸到了DeepSeek-R1的水平,做长上下文的值得复现。

5月19日5月19日周二

星期二 · 1 条
00:52
Hugging Face:Blog(RSS)精选
AI 评分 67/100
NVIDIA Cosmos Predict 2.5 微调:使用 LoRA/DoRA 生成机器人视频

NVIDIA Cosmos Predict 2.5 是一个 2B 参数的世界模型,可根据文本、图像或视频片段生成物理合理的视频。通过 LoRA 或 DoRA 在 DiT 的注意力层(to_q, to_k, to_v, to_out.0)和前馈层注入可训练适配器,冻结全部基座权重,在单个 80GB GPU 上即可完成参数高效微调,避免了全量微调的高成本与灾难性遗忘。该流程使用 diffusers 和 accelerate 库,利用 92 个机器人操作视频训练集与 50 个 (prompt, image) 测试对进行微调,并展示如何用微调模型生成合成机器人轨迹以支持下游机器人学习任务。支持单 GPU 与多 GPU 训练,切换不同领域适配器无需重训。


推荐理由:这篇教程把微调Cosmos Predict 2.5的方法从头到尾讲清楚了,做机器人合成数据的同行可以直接抄作业,LoRA/DoRA切换也很方便,值得收藏。

5月18日5月18日周一

星期一 · 1 条
23:34
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 80/100
AI 席卷全球(2026年春季)【pdf】

一份题为《AI席卷全球(2026年春季)》的行业报告于2026年5月发布,并在Hacker News平台引发热议,获得100个点赞。报告聚焦于2026年春季人工智能技术与应用的全球性扩散与影响,暗示AI已从技术议题演变为全面重塑各领域的核心驱动力。


推荐理由:Evans 的年度报告是科技圈的风口风向标,今年 AI 渗透率的数据比去年翻了一倍,不看这 200 页 PPT 就不知道明年该押注哪里。

5月16日5月16日周六

星期六 · 1 条
15:17
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 66/100
数据科学团队如何使用 Codex

Codex 能够帮助数据科学团队根据实际工作输入,自动化生成根本原因简报、影响报告、关键绩效指标备忘录、范围分析以及仪表板规格文档。该工具将自然语言描述转化为结构化分析框架,提升了从数据查询到报告生成的工作流效率,使团队能更快速地将业务问题转化为可执行的数据分析方案。


推荐理由:OpenAI Academy 手把手教数据科学团队用 Codex 产出分析报告,prompt 模板可以直接抄,但作为教程新信息不多,适合 Codex 用户按需参考。

5月15日5月15日周五

星期五 · 3 条
10:18
SenseTime@SenseTime_AI精选
AI 评分 70/100
SenseNova-U1空间智能突破,开源最大空间问答数据集This is the frontier our innovators strive for. Excited to see passionate minds driving it forward.🔥主推文赞扬了创新者在前沿领域的探索。引用的推文具体指出,SenseNova-U1在空间智能能力上取得进展,其关键基准测试表现超越了Qwen3.5等强劲基线。同时,团队开源了目前最大的空间问答数据集SenseNova-SI-8M,并邀请业界在CVPR会议进行线下交流。

Zhongang Cai: Excited to have contributed to the spatial intelligence capabilities of SenseNova-U1, surpassing strong baselines such a...

另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤的 SenseNova-U1 在空间智能基准上压过 Qwen3.5,还顺手开源了目前最大的空间 QA 数据集 SenseNova-SI-8M,搞具身智能和多模态的可以直接抱走数据。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
突破舒适区:面向RLVR的高效策略引导探索框架NudgeRL

强化学习与可验证奖励范式面临探索效率瓶颈。为此,研究团队提出NudgeRL框架,其核心是“策略助推”技术,通过为每次策略采样注入轻量级策略级上下文,引导模型产生多样化推理轨迹,无需依赖昂贵的外部监督。该框架进一步提出一个统一目标,将奖励分解为上下文间与上下文内组件,并通过蒸馏目标将有效行为迁移回基础策略。在五个高难度数学基准测试中,NudgeRL的表现优于标准GRPO方法,其效果相当于后者使用高达8倍采样预算的结果,且平均表现超过了依赖特权信息的Oracle引导基线,证明了结构化探索的高效性与可扩展性。


推荐理由:NudgeRL 首次把结构化探索引入 RLVR,比 GRPO 节省 8 倍 rollout 预算,数学推理效果还更好。做 LLM 推理优化的团队,这篇值得复现。
02:31
Anthropic:Research(发表成果 · 网页)精选
AI 评分 58/100
2028年全球AI领导地位的两种情景

报告展望2028年中美AI竞争的两种前景。若美国及盟友维持并扩大在关键计算芯片上的优势,通过加强出口管制、遏制技术窃取并加速AI应用,民主国家可确立12-24个月的技术领先,主导AI规则制定。反之,若政策松动,中国可能借助人才优势、利用管制漏洞迅速逼近甚至反超,使威权政权获得大规模自动化压制能力。当前民主国家在计算领域优势显著,但窗口期有限,需立即行动锁定胜局。


推荐理由:Anthropic直接下场画了两张2028中美AI路线图,核心就一句话——不堵死漏洞,中国的蒸馏攻击和芯片走私会让美国优势两年内消失。虽然是政策游说稿,但数据扎实,想理解AI地缘政治的必读。

5月14日5月14日周四

星期四 · 3 条
17:40
AYi@AYi_AInotes精选
AI 评分 75/100
OpenAI遭集体诉讼,被指通过追踪代码向Meta等泄露用户查询隐私最近全网都在聊OpenAI的ChatGPT 5.5多厉害,Codex多好用之类的,但没人注意到昨天刚爆的这个集体诉讼,这件事可能是真正炸穿底线的事。南加州联邦法院昨天正式立案,原告代表所有美国ChatGPT用户起诉OpenAI。诉讼文件里的实锤硬到爆, OpenAI在ChatGPT网站代码里直接嵌入了Facebook Pixel和Google Analytics,你在输入框里敲下任何一个问题,按下回车的瞬间,这个查询的完整主题会变成浏览器标签标题,然后Pixel会把它和你的Facebook cookies一起,实时发给Meta。那些cookies里包含c_user和fr字段,也就是你唯一的Facebook用户ID。但这还不是最恐怖的地方, OpenAI自己在隐私政策里承认了这件事🌚他们说他们只会分享有限的标识符用于推送Pro版广告,不会分享完整的对话内容。诉讼方认为,查询主题本身就是最敏感的个人信息。以前我们以为,免费AI的代价是你的数据用来训练模型,但其实模型只是诱饵,真正的产品, 是你每一次的好奇心, 和你完整的数字身份。还有更讽刺的, 很多人用ChatGPT,就是不想被Google追踪自己搜了什么,结果转头就把自己问的每一个问题,原封不动送给了Meta和Google🥹#OpenAI #ChatGPT #隐私南加州联邦法院已受理针对OpenAI的集体诉讼,指控其在ChatGPT网站中嵌入Facebook Pixel等代码,侵犯用户隐私。当用户提交查询时,查询主题会作为浏览器标题与含Facebook唯一ID的cookies一并实时发送给Meta。OpenAI虽称仅分享"有限标识符"用于广告,但原告认为查询主题本身即高度敏感的个人信息。此案揭示免费AI服务的潜在代价:用户每一次查询及数字身份可能成为被交易的产品,与许多用户为逃避追踪而选择ChatGPT的初衷形成讽刺对比。

推荐理由:免费AI的代价一向是数据训练,但OpenAI这次被诉把用户每次查询实时推给Meta和Google,隐私暴露比想象中严重得多,值得所有ChatGPT用户警惕。
02:44
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
解决循环:语言和推理的吸引子模型

吸引子模型解决了循环Transformer训练不稳定、成本高和深度固定的问题。它通过主干模块生成初始输出嵌入,吸引子模块迭代优化固定点,并利用隐式微分计算梯度,使训练内存与有效深度无关,迭代次数自适应收敛。在语言建模中,相比标准Transformer,困惑度最高降低46.6%,下游任务准确率最高提升19.7%,训练成本更低;一个770M参数的模型性能优于1.3B参数Transformer。在推理任务中,仅2700万参数模型在约1000个示例下,于Sudoku-Extreme和Maze-Hard上准确率分别达91.4%和93.1%,优于Claude、GPT o3等前沿模型。模型还展现出均衡内化现象,训练后初始输出嵌入接近均衡态,推理时可移除求解器而性能几乎无损,实现了迭代优化的可扩展性。


推荐理由:这可能是要改写语言模型训练范式的架构,把迭代推理变成可学习的固定点,770M 性能超 1.3B Transformer,27M 小模型解数独秒杀 Claude、GPT o3。最反直觉的是,训练后模型能内化迭代过程,推理时直接一步到位。

5月13日5月13日周三

星期三 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
通过简单统一的扩展实现奥赛金牌级推理

本文提出一种将预训练推理模型转化为严格奥赛求解器的统一方法。该方法首先采用反向困惑度课程进行监督微调,以灌输严谨的证明搜索与自我检查行为;随后通过两阶段强化学习流程扩展这些能力,最终结合测试时扩展提升性能。基于此方案训练的30B参数模型SU-01,在仅使用约34万条短轨迹微调和200步强化学习后,能稳定处理超过10万token的长轨迹难题,并在IMO、USAMO、IPhO等数学与物理奥赛中达到金牌级表现,同时展现出向数学物理之外科学领域的强推理泛化能力。


推荐理由:IMO 金牌级推理模型又多了一个,SU-01 的方法干净统一,特别在超长推理链上的稳定性是真正突破,做推理模型训练和竞赛级 AI 的可以认真读一下。