Topic · 主题全部主题 →

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

3,232条收录
242条精选

最新精选

120 条 · 共 242

9月4日

星期五 · 3 条
02:01
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期

IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。

另有 3 家信源报道MarkTechPost(RSS)X:Kim (@kimmonismus)X:Testing Catalog (@testingcatalog)
推荐理由:原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。
01:55
01:01
Google Research:Blog(网页)精选
AI 评分 60/100
Google 与 HHMI Janelia 发布完整雄性果蝇大脑及中枢神经系统连接组

Google 与 HHMI Janelia 等合作者在 Cell 发表雄性果蝇大脑与中枢神经系统的完整连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是目前按神经元数量计最大的大脑连接组图。


推荐理由:原文给出了完整雄性果蝇连接组的规模、验证方式和配套工具,读者可以据此了解连接组学当前的技术路径和研究入口。

9月3日

星期四 · 2 条
16:29
Hugging Face:Blog(RSS)精选
AI 评分 62/100
用 TRL 和 OpenEnv 训练编码模型画水彩:Hugging Face 全流程开源复现

Hugging Face 博客作者基于 Surya Narreddi 的原始想法,用 TRL、OpenEnv 和 Qwen/Qwen3.5-35B-A3B 复现了让语言模型通过 p5.brush 写 JavaScript 画水彩的 RL 训练流程,所有数据集、环境、脚本和模型均开源在 Hub。


推荐理由:作者用 TRL 和 OpenEnv 完整开源复现了让编码模型画水彩的 RL 配方,含数据池、环境和三组奖励对比,可整体迁移复用。
01:08
IT之家(RSS)精选
AI 评分 79/100
美国司法部介入纽约时报诉 OpenAI 案,主张 AI 训练属合理使用

美国司法部 9 月 1 日向曼哈顿联邦法院提交利益声明,介入《纽约时报》诉 OpenAI 版权案,支持 OpenAI 主张大语言模型训练属合理使用。DOJ 以国家安全和 AI 产业竞争力为主要论据,称训练使用具有转换性;《纽约时报》发言人批评政府站在 AI 公司一边牺牲创作者权益。法官要求双方最迟 9 月 4 日提交简易判决动议,该案结果可能为 AI 训练版权合法性确立先例。

另有 4 家信源报道X:Rohan Paul (@rohanpaul_ai)TechCrunch:AI(RSS)The Decoder:AI News(RSS)The Verge:AI(RSS)
推荐理由:司法部罕见公开站在 OpenAI 一边,这条报道梳理了双方核心论点和案件时间线,有助于理解 AI 训练版权争议的走向。

8月29日

星期六 · 1 条
05:26
Hugging Face:Blog(RSS)精选
AI 评分 66/100
Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集

Voice Arena 与 Hugging Face 合作,为 Open ASR 排行榜引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,覆盖印地语与印度英语,其中印地语是该排行榜多语言板块首个非欧洲语言。数据集含公开与私有分割,共 4,888 位说话人,并记录 12 项说话人属性,旨在暴露按地区、年龄、性别等维度分布不均的语音识别误差。


推荐理由:把评测单元从单一 WER 下探到带 12 项说话人属性的分组,能暴露模型在不同地域、口音、设备上的表现差异,让 ASR 选型不再只看平均错误率。

8月28日

星期五 · 2 条
06:55
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
英伟达预计 2028 财年销售额达 6730 亿美元

英伟达预计 2028 财年营收增长 70%,年销售额约达 6730 亿美元,将超过苹果和 Alphabet,仅次于亚马逊。CFO Colette Kress 于 8 月 26 日给出该预测,远高于分析师平均预期的 44%。供应而非需求成为近期上限,黄仁勋称内存等部件短缺限制了更高预期,客户群正从超大规模厂商扩展至 ACIE。


推荐理由:英伟达的预测重点在于客户结构从超大规模云厂商扩展到区域 AI 公司和初创企业,同时其融资支持客户的方式形成循环资金依赖,这比单纯销售额数字更能反映其长期增长模式。
04:55
Ars Technica:AI(RSS)精选
AI 评分 70/100
诉讼指控 xAI 使用儿童性虐待材料训练 Grok 模型

一项新诉讼指控 xAI 使用儿童性虐待材料(CSAM)训练 Grok 模型,这是首个此类指控。原告 Jane Doe 称其幼年遭虐待所生成的 CSAM 图像及 AI 生成的衍生图像被用于训练 Grok,且 Grok 默认将公开的 X 帖子和自身输出作为训练数据。诉讼要求 xAI 销毁所有 Grok 生成的 CSAM 并阻止模型再生成此类内容。


推荐理由:这起诉讼的关键不是单一侵权,而是起诉方把用户公开帖子和模型输出默认进入训练管道视为系统性风险,若成立可能推动平台将 CSAM 过滤从内容审核前移到训练数据治理。

8月27日

星期四 · 4 条
17:25
IT之家(RSS)精选
AI 评分 72/100
我国日均词元调用量突破 500 万亿,中国大模型稳居全球第一梯队

截至 2026 年 6 月,我国日均词元调用量已突破 500 万亿,中国大模型在全球竞争中位居第一梯队。当前旗舰模型几乎以月为单位更新,竞争焦点转向智能体落地与生态建设,推理算力需求随之爆发。腾讯混元 3 正式版上线第一周,Token 调用量比上一代混元 2 增长 68 倍。


推荐理由:模型更新周期缩短至4到6周,且智能体任务的多轮调用说明推理算力需求上升,对算力产业链的判断需从训练侧扩展到推理侧。
07:25
IT之家(RSS)精选
AI 评分 74/100
英伟达 2027 财年半年报归母净利润 1180.1 亿美元,同比增长 161.1%

英伟达发布 2027 财年半年报,上半年营收 1778.37 亿美元,归母净利润 1180.1 亿美元,同比增长 161.1%,GAAP 毛利率 75%。第二财季营收 962.21 亿美元,同比增长 106%,环比增长 18%,归母净利润 596.88 亿美元,同比增长 126%。数据中心业务第二季度收入 890.23 亿美元,同比增长 117%,Vera Rubin 平台已进入全面量产。

另有 4 家信源报道The Verge:AI(RSS)X:Rohan Paul (@rohanpaul_ai)X:阑夕 (@foxshuo)X:Kim (@kimmonismus)
推荐理由:数据中心收入同比翻倍叠加 Vera Rubin 平台全面量产,显示 AI 基础设施的资本开支仍在加速,延迟部署的概率下降。
04:10
Google Research:Blog(网页)精选
AI 评分 63/100
GlucoFM:面向连续血糖监测的基础模型

Google Research 推出 GlucoFM,一款轻量级自监督 CGM 基础模型,采用双流设计分别建模缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,其 PR-AUC 较最优 GluFormer 变体平均高出 5.8 个百分点,并在 PPGR 预测中取得最低 MAE。模型在 109,066 小时无标注 CGM 数据上预训练,具备跨数据集迁移与少样本适应能力。


推荐理由:把血糖轨迹拆成慢趋势和短时偏差双流,不重建原始读数而是预测潜在表征,再用多天平均提升个体预测,为有限临床标签下构建健康监测模型提供了可复用的训练框架。
01:30
Anthropic:Research(发表成果 · 网页)精选
AI 评分 69/100
Anthropic 开放 Claude 真实使用数据供外部独立研究,公布试点结果

Anthropic 今年春季启动试点,通过隐私保护工具 Anthropic Insights(原 Clio)向斯坦福大学 SALT Lab、牛津大学人类信息处理实验室及 METR 三个外部机构开放约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话数据,供其独立设计研究并公开发布结果。


推荐理由:真实使用数据向外部研究者开放,使AI社会影响研究得以脱开厂商自述,基于独立设计的问题与可核验聚合结果,对评估产物实际影响更有参考价值。

8月26日

星期三 · 2 条
22:28
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 82/100
以色列资助的假美国智库试图利用AI进行宣传

一个打着“汉诺威公共政策研究所”旗号的亲以色列网站,在九天内发布了124篇、超56万字的报告,旨在优化内容以引导ChatGPT等AI聊天机器人引用其亲以观点。该网站由美国公司Piro Inc依据《外国代理人登记法》为以色列政府分发内容,其背后是以色列政府数千万美元资助、经Havas Media等第三方转手的更广泛宣传行动。


推荐理由:调查把生成引擎优化与训练数据投毒的操作链拆开,让原本不可见的聊天机器人引用来源有了可核查的路径。
22:07

8月24日

星期一 · 1 条
22:54
Tomer Tunguz 博客(VC 分析)精选
AI 评分 60/100
AI 基础设施的牛鞭效应:从 GPU 到存储的连锁瓶颈

AI 基础设施瓶颈正沿供应链依次传导,形成典型的牛鞭效应。2023 年初 GPU 短缺使 H100 租赁价超 $9/小时,随后压力转移至内存,企业级 SSD 合约价单季上涨 80%;到 2025 年底智能体推高 CPU 需求,2026 年存储短缺导致西数和希捷 2026 全年 nearline 产能售罄。数据中心建设成本已超 $20b/GW,变压器交期近三年,涡轮机订单排至 2031 年。


推荐理由:把牛鞭效应用在 AI 硬件供应链上,解释了瓶颈逐段迁移的滞后期,可为判断 2027-2028 年哪些长期资本开支会先承压提供框架。

8月21日

星期五 · 1 条
21:07
OpenBMB@OpenBMB精选
AI 评分 69/100
面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型🧮 Introducing MathForm, an open-source framework, dataset, and model for mathematical autoformalization with Lean 4.Formalizing mathematics makes mathematical knowledge machine-checkable, but it is more than translating statements into code. A model must map each concept onto the right types and definitions in Mathlib. A formal statement can compile and still misstate the original problem.Highlights ✨ MathForm Framework: Retrieval-Augmented, Verification-Guided Data Construction A retrieval planner pulls the Mathlib definitions and existing formalizations a statement needs. The generator then revises its output against Lean compiler diagnostics and semantic-consistency feedback for up to 3 rounds.FormalVerse Dataset: 367K+ Verified Lean 4 Examples Each example pairs a natural-language statement with verified Lean 4 code , across diverse mathematical domains and sources.Results 📊 • At a matched 100K budget with the same recipe and init, models trained on FormalVerse reach 60.32% Consistency Check, vs 46.53% on FineLeanCorpus and 41.49% on NuminaMath-LEAN • MathForm-8B achieves 88.06% Syntax Check and 72.37% Consistency Check Pass@8 across six benchmarks, outperforming ReForm-32B and Goedel-Formalizer-V2-32B at a quarter the size • On the hardest FATE-H / FATE-X subsets it reaches 63% / 37% Consistency Check, beating the strongest specialized baseline by 10 and 12 points🔗 Resources 📄 Paper: http://arxiv.org/abs/2608.14221 📚 Dataset: http://huggingface.co/datasets/openbmb/FormalVerse 🤖 Model: http://huggingface.co/openbmb/MathForm-8B 💻 Code: http://github.com/openbmb/MathForm面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。

推荐理由:数学形式化的难点是编译通过但语义漂移,该框架用检索规划和语义一致性反馈迭代修正,并开源数据集和 8B 模型,给小模型做形式化提供了可复用路径。

8月20日

星期四 · 1 条
10:00
公众号:蚂蚁百灵(Ling)精选
AI 评分 68/100
Ling-3.0 tiny & flash Base Models 正式开源

蚂蚁百灵开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,并同步开放预训练、中期训练及 WSM 合并等共 6 个 checkpoints。tiny-base 总参数 7.9B、激活参数 1.3B,flash-base 总参数 124B、激活参数 5.1B,均采用统一训练方案,适合持续预训练、监督微调、偏好优化及强化学习后训练等场景。

另有 2 家信源报道IT之家(RSS)X:蚂蚁百灵 (@AntLingAGI)
推荐理由:Ling-3.0 开放中间 checkpoint 和 WSM 合并策略,研究者可比较各训练阶段增益,并在自己数据上从合适节点继续预训练或后训练,而不只是拿到最终权重。

8月19日

星期三 · 1 条
02:23
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 65/100
OpenAI 在"关键网络能力"时代放缓模型开发节奏

OpenAI 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到《预备框架》下的“关键网络安全能力”阈值,暂时放缓了模型扩展速度,包括暂停最新部署模型的强化学习训练两周,并搁置最大规模前沿 RL 运行。公司已加强研究环境安全,要求对 Astra 及网络相关负载实施最严格防护,并扩展思维链监控,采用多阶段激活分类器检测机制。

另有 13 家信源报道X:Jakub Pachocki(OpenAI 首席科学家,@merettm)X:Kim (@kimmonismus)The Verge:AI(RSS)The Decoder:AI News(RSS)X:Peter Steinberger (@steipete)X:小北 (@frxiaobei)TechCrunch:AI(RSS)X:OpenAI (@OpenAI)X:Rohan Paul (@rohanpaul_ai)X:Gabriel (@gabriel1)X:Testing Catalog (@testingcatalog)X:Greg Brockman (@gdb)X:Sam Altman (@sama)
推荐理由:最高风险预警若 30 分钟内无法排除误报就暂停训练,安全证据与隔离迁移先于大规模 RL,前沿模型开发进度开始被安全工程效率约束。

8月18日

星期二 · 2 条
13:34
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 64/100
inclusionAI 开源 ConceptEdit:基于概念缩放与密集监督的图像编辑数据生成管线

蚂蚁集团 inclusionAI 开源 ConceptEdit,一个基于概念缩放与密集监督的图像编辑数据生成管线。该管线通过三阶段流程(VLM 生成指令、FLUX 执行编辑、VQA 评估筛选)构建大规模、基于分类法的图像编辑数据集,并提供单概念与多概念两种变体。项目采用 MIT 许可证,支持断点续跑,需 OpenAI 兼容 VLM 端点与本地 FLUX 检查点。


推荐理由:流水线把图像编辑数据生成拆为指令生成、FLUX 编辑、VLM 评判三步,多概念版本将多个并行编辑合并为一条指令并支持断点续跑,为构建带质检的编辑训练数据提供可复用框架。
02:53
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
404 Media 追踪珍本图书流向:亚马逊批量购书扫描用于 AI 训练后销毁

404 Media 通过在一本珍本图书中放置追踪设备,首次揭露亚马逊未公开的购书行动:批量购入大量书籍,扫描用于 AI 训练数据,随后销毁。追踪显示这些书最终被送往亚马逊的一处人工智能训练中心。

另有 4 家信源报道TechCrunch:AI(RSS)IT之家(RSS)Ars Technica:AI(RSS)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:跟踪证据把AI训练数据采购从传闻落到可查验的物流链条上,为版权方和作者判断图书被数字化利用提供了具体依据。