跳到正文

#ModernBERT

今日 0 条
2月10日周一
  1. Answer.AI 官方研发博客(RSS)72

    Answer.AI 发布 ModernBERT-Large-Instruct:编码器模型实现零样本生成式分类

    Answer.AI 推出 ModernBERT-Large-Instruct,通过简单的指令微调使 BERT 类编码器利用 MLM 头进行零样本分类和多项选择任务。该模型无需架构改动或复杂管道,在 MMLU-Pro 上超越 Qwen2.5-0.5B 等亚十亿参数模型,接近 Llama3-1B 性能,且在 NLU 任务中匹配传统微调效果。模型已开源至 HuggingFace,支持单前向传播推理,显著降低计算成本。

12月19日周四
  1. Answer.AI 官方研发博客(RSS)82

    Answer.AI 发布 ModernBERT:替代 BERT 的新一代编码器模型

    Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列旨在取代 BERT 的 SOTA 编码器模型。该模型将 LLM 的最新架构改进(如 Flash Attention、RoPE)应用于编码器,支持 8192 token 上下文长度(远超传统 BERT 的 512),并在速度和下游任务性能上全面超越旧一代模型。提供 base (149M) 和 large (395M) 两种参数规模,已集成至 Hugging Face Transformers v4.48.0,可直接作为 BERT 类模型的即插即用替代品,适用于 RAG、分类及代码检索等场景。

    推荐理由:这是六年来首个真正意义上对 BERT 架构的重大升级,解决了长上下文限制并提升了效率,对依赖编码器的 RAG 和搜索系统开发者具有直接的生产力价值。