Topic · 主题全部主题 →

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

3,244条收录
245条精选

精选归档 · 第 5 页

81100 条 · 共 245

7月3日7月3日周五

星期五 · 3 条
10:34
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
Program-as-Weights:一种面向模糊函数的编程范式

Program-as-Weights (PAW) 提出模糊函数编程范式,将自然语言描述的函数编译为紧凑、可本地执行的神经制品。PAW 使用在 10M 示例数据集 FuzzyBench 上训练的 4B 编译器,为冻结的轻量级解释器输出参数高效适配器。0.6B 的 Qwen3 解释器执行 PAW 程序性能匹敌直接提示 Qwen3-32B,推理内存仅约五十分之一,在 MacBook M3 上达 30 tokens/s。该方法将基础模型从每次输入的求解器重新定义为工具构建器,一次函数定义后生成的制品可离线廉价复用。


推荐理由:这篇论文把模糊任务从调用大模型API变成了本地轻量函数,0.6B就能跑赢32B,省掉几十倍成本。对需要处理日志、JSON修复等经常性模糊任务的开发者是个真信号。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
SkillOpt-Lite:更快更好的智能体自我进化,只需一行代码

SkillOpt-Lite 将智能体技能优化形式化为零阶优化,提出文件系统轨迹探索、共识属性挖掘与独立验证门控三条原则。相比完整 SkillOpt,它加速收敛并在 LiveMath 上提升 GPT-5.5 达 +8.8 点、GPT-5.4-nano 达 +25.4 点,使 nano 模型超越标准 SkillOpt 优化的 GPT-5.4。该框架已集成至 VSCode Copilot,开发者仅需一行代码即可进化技能。框架还可泛化为完整工具链优化(HarnessOpt),在 SpreadsheetBench 上令 GPT-5.4-nano 达到 0.7758 准确率,超越运行标准流程的更大模型 GPT-5.5(0.7620)。代码已开源。


推荐理由:把复杂 agent 优化砍到一个最小可行管线,小模型靠它打大模型,VSCode Copilot 用一条 vibe 就能进化技能,做 agent 的人别错过。
01:08
Apple Machine Learning Research(RSS)精选
AI 评分 56/100
VideoFlexTok:可变长度粗到细视频分词

VideoFlexTok提出一种可变长度token序列的视频表示方法,采用粗到细结构——首个token捕捉语义和运动等抽象信息,后续token添加精细细节,生成流解码器支持任意token数量的视频重建。相比传统3D网格分词,该结构允许根据下游需求调整token数,在相同预算下编码更长视频。在类别和文本到视频生成任务中,VideoFlexTok以1.1B参数(5.2B的1/5)达到可比生成质量(gFVD和ViCLIP Score)。训练一个处理10秒81帧视频的文本到视频模型仅需672个token,比同等3D网格分词器少8倍。


推荐理由:把视频 tokenization 从固定网格改成变长 coarse-to-fine,训练效率提升明显,还能做更长的视频。研究角度挺漂亮,但离产品落地还有距离,做视频生成的可以追一下。

7月2日7月2日周四

星期四 · 3 条
17:06
MarkTechPost(RSS)精选
AI 评分 72/100
Google Health API 推出 CLI:ghealth 是一款针对 Fitbit 数据的开源工具

ghealth 是一款封装 Google Health API v4 的开源命令行工具,以单个 Go 二进制文件发布(Apache 2.0 协议)。它提供 40 种已验证的数据类型(包括步数、心率、睡眠、体重、血氧饱和度、心率变异性等)的结构化 JSON 输出。工具采用 Agent 优先设计,具备确定性退出码、--dry-run 和 --raw 标志,并附带两个 SKILL.md 文件供 AI 智能体使用。用户需自行创建 OAuth 凭据,通过 PKCE S256 认证。数据来源覆盖 Fitbit、Pixel Watch 及连接的第三方设备。


推荐理由:把 Google Health API 封装成终端和 AI 代理友好的 CLI,一次性解决了认证、JSON 输出和分页这些烦人细节,想用 Fitbit 数据做健康分析或喂给代理的人可以直接上手,但它的影响仅限于个人健康数据爱好者这个小圈层。
02:02
TechCrunch:AI(RSS)精选
AI 评分 72/100
Cloudflare新政策:默认屏蔽混合爬虫,推动AI公司付费

Cloudflare宣布,自2026年9月15日起,其默认设置将屏蔽同时用于搜索、AI智能体及训练的“混合用途”爬虫访问托管广告的页面,除非站点所有者手动调整。此举旨在保护出版商内容不被无偿使用。同时将原有的“Pay Per Crawl”模式升级为“Pay Per Use”,允许出版商在内容创造价值时向AI公司收费,初期合作方为Ceramic.ai和You.com。Cloudflare数据显示,AI爬虫超过50%的抓取流量浪费在重复获取未变更页面上。新政策适用于新客户、现有客户的新站点及所有现有免费客户。


推荐理由:Cloudflare用基础设施商的话语权重新划定了AI内容付费线,默认屏蔽混合爬虫这一刀切下去,从Google到创业公司都躲不开,出版商到底该分多少钱的讨论终于有了一个落地的支点。
01:39
Meta Engineering Blog(RSS)精选
AI 评分 71/100
Meta 大规模 AI 存储蓝图

Meta 运营数百 EB 级存储集群,基于 Tectonic 分层存储层构建 BLOB 存储架构,以应对两大挑战:最大化 GPU 利用率与研究迭代速度。传统 BLOB 架构的多层元数据查询可导致数百毫秒延迟,使 GPU 因 I/O 等待停顿。新架构将训练栈逐步迁移到 BLOB 存储接口上,利用闪存提供可预测的低 pMax 延迟,避免单 GPU 慢速拖慢整批任务。同时,统一的数据湖访问支持地理分布 GPU 间的数据高速注入与跨区移动,提升研究效率。


推荐理由:Meta的存储架构复盘给出了一条明确路径,从重写元数据到分层缓存,他们把GPU利用率和研究者迭代速度同时提升了一个档次,做AI训练平台的值得细读。

7月1日7月1日周三

星期三 · 1 条

6月30日6月30日周二

星期二 · 6 条
05:35
Ars Technica:AI(RSS)精选
AI 评分 75/100
韩国将投入1万亿美元扩大存储芯片生产和发展人形机器人

韩国政府与三星、SK海力士等承诺1万亿美元实施三大旗舰项目。三星和SK海力士投资5850亿美元新建芯片工厂,目标五年内将DRAM产量翻倍;SK集团、GS集团和Naver投资3570亿美元在偏远省份建设AI数据中心;物理AI被指定为国家战略产业,现代汽车投资58亿美元建设机器人工厂和AI数据中心,计划到2028年每年生产3万台Atlas人形机器人,并在10大行业实现商业化。但现代汽车工会已批准罢工谈判,要求利润分享和岗位保护。


推荐理由:韩国砸 1 万亿美元砸向内存芯片和机器人,不只是产能竞赛,更是试图锁住 AI 硬件供应链的关键位置。但工会抗议和芯片暴利税收争议也浮现,值得追踪。
05:26
Emad@EMostaque精选
AI 评分 79/100
美团LongCat Owl Alpha:OpenRouter最流行模型,1.6万亿MoE,国产ASIC训练Most popular model on @OpenRouter (10tr tokens) turns out to be a 1.6tr MoE by @Meituan_LongCat (superapp/DoorDash of China)Basically Gemini / Opus 4.6 level35tr tokens trained entirely on 50k Chinese ASICsNo GPUs neededhttps://longcat.chat/blog/longcat-2.0/美团LongCat的1.6万亿参数MoE模型Owl Alpha成为OpenRouter上最流行模型,累计消耗10万亿tokens,性能达Gemini/Opus 4.6级别。该模型使用35万亿tokens训练,完全在5万块国产ASIC上完成。据官方推文,Owl Alpha上线后每日调用量全球Top3,在Hermes Agent排名#1,Claude Code排名#2,OpenClaw排名#3。该模型即将退役,后续版本待公布。

Meituan LongCat: 你们有些人猜对了。👀 Owl Alpha 已经上线 @OpenRouter -- 那就是我们。 自上线以来,Owl Alpha 的日活量已跻身全球前三,并在 Hermes Agent 上排名第一,在 Claude Code 上排名第二,在...


推荐理由:中国团队用 5 万块自研 ASIC 训练出 1.6tr 参数 MoE,性能堪比 Gemini,还在 OpenRouter 悄悄成了最热模型——非 GPU 路线跑到量产的第一个真实信号,做推理部署的都应该看一眼。
04:34
Tomer Tunguz 博客(VC 分析)精选
AI 评分 58/100
Anthropic:当AI成本超过工程师薪酬

Anthropic在算力上的支出达到每位工程师每年51.5万美元,是其完全薪资(22.4万美元)的2.3倍。相比之下,顶尖1%软件公司的算力支出为8.9万美元,中位数仅为1.37万美元。三个2029年情景预测了这一差距的缩小路径。


推荐理由:Tomer Tunguz 用数据把 AI 公司的烧钱速度拆得很细,Anthropic 每个工程师年算力成本 51.5 万美元,是工资的 2.3 倍,这个数字对重新理解 SaaS 毛利率很有冲击力。
00:00
Google Research:Blog(网页)精选
AI 评分 76/100
Google Research 推出 TabFM:用于表格数据的零样本基础模型

Google Research 发布 TabFM,一种基于上下文学习(ICL)的零样本基础模型,专为表格数据的分类与回归任务设计。TabFM 将整个数据集(包含训练样本与待预测行)作为统一提示输入,在推理时直接从上下文中学习行列关系,无需模型训练、超参数调优或特征工程。与需大量人工调优的传统方法(如 XGBoost)不同,TabFM 通过单次前向传播即可在新表格上生成高质量预测。该模型已在 Hugging Face 和 GitHub 上开源。


推荐理由:TabFM 把表格预测变成一次前向传播,不再需调参和特征工程,数据科学家可以少熬夜了。BigQuery 集成让使用门槛降到 SQL,这是表格 ML 的零样本时刻。
00:00
Google Research:Blog(网页)精选
AI 评分 61/100
Google Research 将建筑屋顶反射率数据集扩展至全球 50+ 城市

Google Research 发布扩展的建筑屋顶反射率数据集,覆盖全球 50 多个城市,旨在帮助城市规划者优先部署冷屋顶方案以缓解极端高温。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率的 Airbus Pléiades Neo 卫星图像生成,可通过新的高分辨率 Heat Resilience Earth Engine App 开放获取。相关方法论发表于《Nature Communications》。此前 2024 年的试点已覆盖 14 个城市,其数据曾指导制定冷屋顶条例与适应计划。


推荐理由:谷歌把屋顶反照率数据的精度做到30厘米,覆盖50+城市,还给了免费App,城市防暑从模糊规划变成可量化的工程,做气候韧性的人可以直接拿这个数据做方案,虽然只是特定领域应用,但AI落地真实场景的路径值得参考。

6月29日6月29日周一

星期一 · 1 条
15:01
IT之家(RSS)精选
AI 评分 71/100
SK 集团会长崔泰源:到 2035 年建设 15GW AI 数据中心,总投资达 1000 万亿韩元

SK 集团会长崔泰源 6 月 29 日宣布,计划到 2035 年建成 15GW AI 数据中心容量,作为韩国国家级基础设施和实体 AI 时代核心底座。项目总投资 1000 万亿韩元(约 4.4 万亿元人民币),未来 10 年保持年均 100 万亿韩元以上国内投资,旨在实现从出口传统商品向智能服务的转变,构建韩国智能市场。此外,SK 海力士将向韩国西南部投资 400 万亿韩元,半导体供应项目总投资达 1100 万亿韩元(约 4.84 万亿元人民币)。


推荐理由:SK 集团喊出 1000 万亿韩元建 AI 数据中心,数字唬人但周期长达十年,更像一种姿态宣示,真正改变算力市场格局还得看后续执行力和融资落地。

6月27日6月27日周六

星期六 · 1 条
09:59
IT之家(RSS)精选
AI 评分 71/100
国家统计局:1-5月规上工业企业利润增18.8%,电子行业利润增103.9%贡献43.1%

1—5月全国规上工业企业利润同比增18.8%。电子行业利润增103.9%,贡献率43.1%,主因全球AI技术变革推动高端算力芯片和存储芯片需求爆发。原材料制造业利润增83.1%,其中有色增117.1%、化工增71.6%。高技术制造业利润增44.7%,电子专用材料制造增665.4%。企业每百元营收成本降0.59元,营收利润率5.56%,为2024年以来累计最高。


推荐理由:国家统计局这组数据让AI不再是融资故事,电子行业利润增长103.9%,AI需求是实实在在的引擎,硬件供应链的价值该被重估了。

6月26日6月26日周五

星期五 · 3 条
23:51
Dwarkesh Patel:Podcast & Blog(RSS)精选
AI 评分 61/100
下一个重大突破:AI在工作中学习

AI实验室的研究赌注是:在数千个多样化RL环境中训练模型完成数百万可验证任务,就能构建AGI。这种训练会培养出能连续数周处理开放任务、应对错误和歧义的问题解决技能。虽然模型训练时的样本效率仅为人类的百万分之一,但训练成本是一次性的,可摊销到数十亿次用户会话中;真正重要的是模型在单个会话内的智能和样本效率,而这随着RL训练正在提升。持续学习或许不再必要——如果上下文内的学习能力足够强、时间跨度足够长,就无需将经验蒸馏回权重。Transformer架构创新已能大幅扩展上下文存储,未来可能实现任意大的上下文窗口。论文还指出,一个领域不仅需要可验证性,还需要可碾压性——能在确定性、可重播的模拟器中并行运行大量rollout。


推荐理由:RLVR 范式能否通向 AGI?Dwarkesh 指出关键瓶颈在于样本效率和 grindability,他提出的 OPSD 和 dreaming 方案重新定义了「学习中」的边界,虽然离落地尚远,但值得每一个关心 AI 下一步的人细读。
03:01
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
IBM 首度推出亚纳米级芯片技术

IBM 于 2026 年 6 月 25 日发布全球首款亚纳米级芯片技术,采用 0.7 nm(7 埃米)节点与全新三维纳米堆叠(nanostack)架构。指甲盖大小的芯片集成近 1000 亿个晶体管,密度约为 IBM 2021 年 2 nm 芯片的两倍。相比 2 nm 芯片,性能最高提升 50%,能效最高提升 70%。纳米堆叠架构还实现 SRAM 面积缩减 40%,有助于支撑先进 AI 工作负载的高带宽需求。该技术已在 VLSI 2026 会议上验证,IBM 预计 5 年内量产。


推荐理由:IBM 把芯片制程推进到亚纳米,0.7nm 意味着 AI 芯片能塞进两倍晶体管,这对生成式 AI 的算力瓶颈是个好消息。虽然量产还要五年,但技术路线图清晰,值得关注。
00:37
TechCrunch:AI(RSS)精选
AI 评分 71/100
General Intuition 完成 3.2 亿美元融资,用游戏数据训练通用 AI 智能体

General Intuition 以 23 亿美元估值完成 3.2 亿美元融资,累计披露融资 4.54 亿美元。公司从旗下游戏剪辑平台 Medal 获取数亿小时含精确按键动作标签的游戏操作数据,训练单一模型同时驾驭 Fortnite 等虚拟环境和四足机器人。演示中,AI 智能体在游戏中连续运行 100 小时,机器人仅靠 8 分钟真实街道数据微调即可自主探索办公室。本轮由 Khosla Ventures 领投,General Catalyst、Jeff Bezos、Eric Schmidt 等参投。资金将用于通过 CoreWeave 扩大计算规模、预训练下一代模型,计划夏末前开放 API。


推荐理由:用游戏按键数据训练世界模型,并在真机上八分钟完成适配,这个思路让具身智能看到了一条可规模化的路径。投资人押注的其实是 Medial 独有的动作标注数据飞轮。

6月25日6月25日周四

星期四 · 1 条
11:29
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
Anthropic称阿里巴巴非法获取了Claude AI模型的功能

Anthropic指控阿里巴巴未经授权提取了其Claude AI模型的能力。该指控基于Anthropic的调查,认为阿里巴巴通过逆向工程或其他手段复制了Claude的核心技术。目前阿里巴巴尚未公开回应。

另有 1 家信源报道Ars Technica:AI(RSS)
推荐理由:Anthropic正式指控阿里巴巴非法提取Claude能力,这不是普通知识产权纠纷,而是头部AI公司对模型能力窃取的首次公开控诉,可能重塑API和开源生态的游戏规则。