跳到正文

内容形态

模型发布 最新动态

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

800 条精选近 30 天 62 条共收录 3,805 条

更新

精选归档 · 第 39 页

12月26日周四第 761–780 条
  1. 公众号:DeepSeek67

    DeepSeek-V3 正式发布

    深度求索正式发布 DeepSeek-V3 模型,性能比肩世界顶尖模型,速度跃升,价格更新。

    推荐理由:DeepSeek-V3 是 2024 年底国产模型的一次真正跃迁,首次亮剑就逼近闭源顶尖,开源权重更是直接改变了开发者生态。时隔一年半回头看,它仍是理解 DeepSeek 路径的起点。

12月19日周四
  1. Hugging Face:Blog71

    Answer.AI 与 LightOn 发布 ModernBERT 编码器模型,支持 8192 序列长度并全面超越 BERT

    Answer.AI 与 LightOn 发布 ModernBERT 编码器模型系列,提供 base(149M 参数)和 large(395M 参数)两个规格,可作为 BERT 类模型的直接替代。

    推荐理由:原文详细披露了架构改进、训练数据和实测效率数字,读者可据此评估它在现有 BERT 类工作流中能否直接替换。

  2. Answer.AI 官方研发博客82

    Answer.AI 发布 ModernBERT:替代 BERT 的新一代编码器模型

    Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列旨在取代 BERT 的 SOTA 编码器模型。该模型将 LLM 的最新架构改进(如 Flash Attention、RoPE)应用于编码器,支持 8192 token 上下文长度(远超传统 BERT 的 512),并在速度和下游任务性能上全面超越旧一代模型。提供 base (149M) 和 large (395M) 两种参数规模,已集成至 Hugging Face Transformers v4.48.0,可直接作为 BERT 类模型的即插即用替代品,适用于 RAG、分类及代码检索等场景。

    推荐理由:这是六年来首个真正意义上对 BERT 架构的重大升级,解决了长上下文限制并提升了效率,对依赖编码器的 RAG 和搜索系统开发者具有直接的生产力价值。

12月13日周五
12月10日周二
  1. DeepSeek:API 更新日志67

    DeepSeek 将 deepseek-chat 升级为 DeepSeek-V2.5-1210

    DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2.5-1210,各项能力提升。数学能力在 MATH-500 基准测试中从 74.8% 提升至 82.8%,代码能力在 LiveCodebench (08.01 - 12.01) 基准测试中从 29.2% 提升至 34.38%。新版本还优化了文件上传和网页总结功能的用户体验。

    推荐理由:DeepSeek把deepseek-chat数学拉到82.8%,代码涨了5个点,做复杂推理的开发可以试试水,但这还是V2.5系列的常规升级,别当次代际跃迁。

11月29日周五
  1. Prime Intellect67

    Prime Intellect 发布 INTELLECT-1:首个全球分布式训练的 10B 参数模型

    Prime Intellect 发布 INTELLECT-1,称其为首个全球协作训练的 10B 参数语言模型,基于 Llama-3 架构在 1T token 上训练 42 天,跨五国三洲最多同时使用 112 张 H100。

    推荐理由:原文给出分布式训练的关键数字和 PRIME 框架细节,读者可以了解跨洲协作训练 10B 模型的可行性与工程代价。

11月20日周三
9月30日周一
  1. Liquid AI 模型与工程博客64

    Liquid AI 发布首批 Liquid Foundation Models:LFM-1B/3B/40B

    Liquid AI 发布第一代 Liquid Foundation Models(LFM),包含 1.3B、3.1B 和 40.3B MoE(激活参数 12B)三个语言模型,官方称在各规模上取得同级领先质量。

    推荐理由:官方发布了三档模型的基准数据和内存表现,并说明非开源决定与边缘部署定位,读者可据此评估是否试用。

9月12日周四
  1. OpenAI:官网动态78

    OpenAI 发布 o1 模型

    OpenAI 发布 o1 模型,官方公告题为 Introducing OpenAI o1。本次抓取未获取到正文,更多细节以官方公告页 https://openai.com/index/introducing-openai-o1-preview 为准。

9月6日周五
9月5日周四
  1. DeepSeek:API 更新日志78

    DeepSeek V2.5 模型发布:合并升级并提升代码与通用能力

    DeepSeek 将 V2 Chat 与 Coder V2 合并升级为 V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问。新模型在通用与代码能力上显著提升,ArenaHard winrate 升至 76.3%,HumanEval 达 89%。

    推荐理由:DeepSeek 把 coder 和 chat 合并成 V2.5,API 端点不变但性能全线拉高,已有的集成直接受益,代码和通用能力不再是两张皮。

7月24日周三
  1. DeepSeek:API 更新日志63

    DeepSeek-Coder 升级为 DeepSeek-Coder-V2-0724

    DeepSeek 将 deepseek-coder 模型升级为 DeepSeek-Coder-V2-0724。此次升级为模型版本更新,具体参数规模、性能基准及可用性细节未在更新日志中披露。

    推荐理由:DeepSeek Coder 升级到 V2-0724,编码能力再进一步,对 API 用户是直接可用的提升,虽然官方没给技术细节,但仍值得关注。

7月23日周二
7月18日周四
7月3日周三
  1. 通义 QwenAudio:原创语音项目62

    FunAudioLLM 发布 Fun-CosyVoice 3.0 开源语音合成模型

    通义 FunAudioLLM 团队开源基于 LLM 的 TTS 系统 Fun-CosyVoice 3.0,官方称在内容一致性、说话人相似度和韵律自然度上超越前代 CosyVoice 2.0,面向零样本多语言语音合成。

    推荐理由:官方发布开源 TTS 新版本,附评测表、安装与部署方式,适合关注多语言语音合成落地的开发者参考。

6月27日周四
5月17日周五
  1. DeepSeek:API 更新日志68

    DeepSeek 将 deepseek-chat 升级为 DeepSeek-V2-0517,指令跟随与 JSON 输出能力大幅提升

    deepseek-chat 模型升级为 DeepSeek-V2-0517,IFEval Benchmark Prompt-Level 准确率从 63.9% 跃升至 77.6%,API 端“system”区域指令跟随能力同步优化,增强沉浸式翻译、RAG 等任务体验。JSON 格式输出准确性提升,内部测试集解析率从 78% 提高至 85%,引入恰当正则表达式后进一步升至 97%。

    推荐理由:DeepSeek V2 的指令跟随从及格线拉到优秀线,IFEval 提升近 14 个点,沉浸式翻译和 RAG 体验会有明显改善,做应用层的值得试一下。

5月14日周二
  1. Sam Altman:Blog

    GPT-4o

    OpenAI 将 GPT-4o 向所有 ChatGPT 用户免费开放,无广告。全新语音(及视频)模式响应速度接近人类,表现力极强,被 Sam Altman 称为「用过最好的计算机界面」,像电影里的 AI。未来还将支持个性化、代操作等功能。

    推荐理由:Sam Altman 解读 GPT-4o 发布,强调语音交互与免费策略

5月13日周一