精选归档 · 第 5 页
第 81–100 条 · 共 622 条
00:31
Hacker News 热门(buzzing.cc 中文翻译)精选
AirLLM 实现单块 4GB GPU 运行 70B 模型推理AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
推荐理由:将 70B 模型推理压缩到 4GB 显存,让不带专用显卡的开发者也能本地测试大模型,但实际推理速度和质量仍需根据用例评估。
23:03
SenseTime@SenseTime_AI精选 商汤发布 SenseNova U1.5-Lite-Preview 开源模型𝗜𝗻𝘁𝗿𝗼𝗱𝘂𝗰𝗶𝗻𝗴 𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨1.5-𝗟𝗶𝘁𝗲-𝗣𝗿𝗲𝘃𝗶𝗲𝘄.An early open-source preview of our lightweight, natively unified multimodal model — built on the native NEO-Unify architecture to natively understand, reason, generate, and edit across modalities. 𝗪𝗶𝘁𝗵 𝗷𝘂𝘀𝘁 8𝗕-𝗠𝗼𝗧 𝗽𝗮𝗿𝗮𝗺𝗲𝘁𝗲𝗿𝘀, 𝗶𝘁 𝗱𝗲𝗹𝗶𝘃𝗲𝗿𝘀 𝗴𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻 𝗮𝗻𝗱 𝗲𝗱𝗶𝘁𝗶𝗻𝗴 𝗾𝘂𝗮𝗹𝗶𝘁𝘆 𝘁𝗵𝗮𝘁 𝗿𝗶𝘃𝗮𝗹𝘀 𝗰𝗼𝗺𝗺𝗲𝗿𝗰𝗶𝗮𝗹 𝗰𝗹𝗼𝘀𝗲𝗱-𝘀𝗼𝘂𝗿𝗰𝗲 𝗺𝗼𝗱𝗲𝗹𝘀.🌟This preview brings:
🔹𝗨𝗽 𝘁𝗼 4𝗞 𝗿𝗲𝘀𝗼𝗹𝘂𝘁𝗶𝗼𝗻, delivering richer details and fewer visual artifacts
🔹𝗦𝘁𝗿𝗼𝗻𝗴𝗲𝗿 𝗘𝗡/𝗖𝗡 𝘁𝗲𝘅𝘁 𝗿𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴 𝗮𝗻𝗱 𝗰𝗼𝗺𝗽𝗹𝗲𝘅 𝗹𝗮𝘆𝗼𝘂𝘁 𝗰𝗼𝗺𝗽𝗼𝘀𝗶𝘁𝗶𝗼𝗻
🔹𝗠𝗼𝗿𝗲 𝗽𝗿𝗲𝗰𝗶𝘀𝗲 𝘃𝗶𝘀𝘂𝗮𝗹 𝗰𝗼𝗻𝘁𝗿𝗼𝗹 with long, multi-constraint prompts
🔹𝗠𝗼𝗿𝗲 𝗿𝗲𝗹𝗶𝗮𝗯𝗹𝗲 𝗻𝗮𝘁𝗶𝘃𝗲 𝗶𝗺𝗮𝗴𝗲 𝗲𝗱𝗶𝘁𝗶𝗻𝗴 across reference-guided style transfer, multi-reference composition, local infographic editing and text editing🌟Improvements over U1 on generation & editing benchmarks:
🔹Qwen-Image-Bench: 47.14 → 55.20 (w/ PE)
🔹ImgEdit-Bench: 3.90 → 4.37
🔹GEdit-Bench-en: 7.47 → 8.17
🔹GEdit-Bench-zh: 7.42 → 8.05From U1 to U1.5, this open-source journey reflects our continued innovation at the foundation-model level. Meanwhile, U1 Pro, our production-ready model for creators, will open for public access soon.🛠️ GitHub: https://github.com/OpenSenseNova/SenseNova-U1/blob/feat/u1.5_preview/docs/u1.5_preview.md
🤗 Hugging Face: https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
👾 Discord: https://discord.com/invite/BuTXPHmQub译商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。另有 1 家信源报道IT之家(RSS)
推荐理由:8B 参数的小模型在生成和编辑上接近闭源水平,有望降低轻量化多模态应用的门槛,但预览版功能可能尚不完整。
05:52
smevals:用于评测模型、提示词与评测框架的小型评测套件smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具,用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 uvx smevals run 对 gpt-5.5、claude-opus-4.6 等模型运行评测,并将运行与打分分离,最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。
推荐理由:一个轻量级评估框架,让编码代理帮你搭 eval,再直接跑模型对比。对想针对业务场景自建基准的团队,比通用榜单更实用。
17:59
MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。
推荐理由:MiniMax H3 把全模态生成打到了 2K 分辨率且价格不到主流三分之一,还计划开源权重,这对闭源视频模型是实打实的压力,开发者可以重点关注。
13:27
Hacker News 热门(buzzing.cc 中文翻译)精选
Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。
推荐理由:CTGT 这个实验设计得很聪明,用匹配对和四家实验室裁判,直接回应了蒸馏会不会传审查的争论。自蒸馏效果一样好,开源模型和评估集让结论可复现,对中国开源模型使用者是个重要信号。
12:10
腾讯混元 Hyra 攻克加法组合学 50 年未解难题腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。
推荐理由:构造不再依赖暴力搜索,而是从数学结构入手自主推理,同时给出可形式化证明,让AI在定理型科学问题上从辅助工具转向共同研究者。
10:21
MiniMax H3 发布并将开源,主打视觉包装与后期特效MiniMax 发布 AI 视频模型 H3,并宣布开源。该模型主打视觉包装与后期特效,可生成动态 MV、动态海报、Vlog、电影片头、游戏 UI 等,语义遵循能力极强,在广告与动效领域表现优于 Seedance 2.0,但影视级张力镜头稍逊。H3 开源后预计将出现大量垂直领域特化版本。
另有 4 家信源报道IT之家(RSS)X:MiniMax (@MiniMax_AI)MarkTechPost(RSS)The Decoder:AI News(RSS)
推荐理由:在 Seedance 统治的前期创作之外,H3 用语义强控制补上了视觉包装与后期特效这块拼图,广告和社媒短片的后期流程可能因此从剪辑软件迁移到提示词。
08:52
llm-chat-completions-server 0.1a0 发布Simon Willison 发布 llm-chat-completions-server 0.1a0 插件,可在本地 9001 端口启动一个兼容 OpenAI Chat Completions API 的服务器,暴露 LLM 工具中所有已安装的模型。
推荐理由:Simon 把 LLM 工具变成了兼容 OpenAI 的 API 服务器,开发者可以本地直接用任何模型,省去适配工作,安装即用,实用性强。
08:00
HuggingFace Daily Papers(社区热门论文)精选
Zero-Mem:为 LLM 智能体实现零 token 记忆操作Zero-Mem 提出零 token 记忆操作,除最终问答外,记忆构建、检索与校准等所有环节均不调用 LLM 或消耗其输入输出 token,仅用编码器计算。该方法保留原始交互轨迹,通过实体-上下文图与时间层级双视图组织证据,在长记忆与长上下文问答基准上达到竞争性表现,并将记忆操作时间成本较最快基线降低 57.6%。代码将在同行评审后公开。
推荐理由:Zero-Mem将记忆操作与LLM完全解耦,通过实体图和时序层级互补检索,在LoCoMo和HotpotQA上全面超越生成式记忆基线,效率提升明显,对Agent记忆系统设计有直接借鉴意义。
08:00
HuggingFace Daily Papers(社区热门论文)精选
DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。
推荐理由:扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。
23:50
LMSYS:Blog(Chatbot Arena 团队)精选
RadixArk 与 Google Cloud 合作,将完整 SGLang 功能引入 TPURadixArk 与 Google Cloud 合作,将开源推理框架 SGLang 引入 Google TPU,开发者可通过 SGL-JAX 在最新 TPU 上运行 Gemma、Qwen、DeepSeek 等大语言模型及多模态模型。
推荐理由:SGLang 正式登陆 TPU,推理框架的硬件自由终于实现,选 GPU 还是 TPU 从此只看性价比不看兼容性,做推理服务的团队可以重新算账了。
10:52
HuggingFace Daily Papers(社区热门论文)精选
AI 智能体能否进行开放式 AI 研究?两项案例的早期证据一项新研究通过“影子评估”测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。
推荐理由:这篇论文给「AI即将自我进化」的说法泼了盆冷水,虽然代理能跑通工程,但在解决开放性研究问题上全线溃败,对打算用AI做科研的团队是个重要的现实检验。
08:00
HuggingFace Daily Papers(社区热门论文)精选
OSReward:为跨平台计算机操作智能体奖励模型建立标准化评测OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。
推荐理由:该项基准比较了VLM法官在计算机使用轨迹上的可靠性,揭示其系统性宽大偏误;同时开源的OS-Shepherd奖励模型以更低成本提供与商业模型相当的评估信号,影响智能体训练的反馈设计。
00:26
Hacker News 热门(buzzing.cc 中文翻译)精选
开源引擎可在任何 M 系列 Mac 上以 2 GB 内存运行 Gemma 4 26B一个开源引擎让 Gemma 4 26B 模型能在任何 M 系列 Mac 上运行,仅需 2 GB 内存。该项目已发布在 GitHub 上,大幅降低了本地运行大语言模型的硬件门槛。
推荐理由:这是我见过最极端的端侧优化,把 26B 参数塞进 2GB 内存,意味着所有 M 系 Mac 都能本地跑大模型了,开发者值得马上 clone 试试。
19:52
腾讯混元开源 AngelSpec:投机解码推理加速最高 2.4 倍腾讯混元开源覆盖训练到部署的投机解码框架 AngelSpec,并放出 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。
推荐理由:AngelSpec 将投机解码从训练到部署全链路开源,DFly 和 D-cut 在真实流量下带来额外加速,对需要优化推理成本的团队有直接落地价值。