MiniMax MCP Server
MiniMax 发布 MCP Server,集成文本转语音、语音克隆、文生图、文生视频等多模态能力。支持 Claude Desktop、Cursor、Windsurf 等主流 MCP 客户端,通过统一工作流实现文本到音视频的一站式生成,面向创作者和开发者免费开放。
推荐理由:MiniMax MCP Server 上线,支持语音克隆、文生图/视频并兼容 Claude Desktop 等主流客户端
技术方向
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
475 条精选近 30 天 29 条共收录 3,807 条
MiniMax 发布 MCP Server,集成文本转语音、语音克隆、文生图、文生视频等多模态能力。支持 Claude Desktop、Cursor、Windsurf 等主流 MCP 客户端,通过统一工作流实现文本到音视频的一站式生成,面向创作者和开发者免费开放。
推荐理由:MiniMax MCP Server 上线,支持语音克隆、文生图/视频并兼容 Claude Desktop 等主流客户端
OpenAI 发布 GPT-4o 系统卡附录,介绍 4o image generation 图像生成能力。官方称其比此前的 DALL·E 3 系列模型能力显著更强,可生成照片级真实感输出,并支持以图像作为输入进行变换。
推荐理由:官方说明指出 4o 图像生成比 DALL·E 3 系列能力更强,读者可借此了解其照片级输出与图像输入变换的新方向。
Google 在 Hugging Face 博客上发布全新开源大模型 Gemma 3,主打多模态、多语言和长上下文能力。
推荐理由:DeepSeek 开源 VL2 视觉模型,3B 轻量版可端侧部署,MoE 架构支持动态图像分块
xAI 启动 Grok API 公测,发布新模型 grok-beta,支持 128k 上下文、函数调用及系统提示,视觉版本下周上线。开发者每月可获 $25 免费额度至年底,已购预付额度可叠加。API 兼容 OpenAI 与 Anthropic 格式,修改 base_url 即可迁移。
推荐理由:xAI开放Grok API公测,每月送$25额度且兼容OpenAI接口,开发者可立即体验
OpenAI 将 GPT-4o 向所有 ChatGPT 用户免费开放,无广告。全新语音(及视频)模式响应速度接近人类,表现力极强,被 Sam Altman 称为「用过最好的计算机界面」,像电影里的 AI。未来还将支持个性化、代操作等功能。
推荐理由:Sam Altman 解读 GPT-4o 发布,强调语音交互与免费策略
OpenAI 宣布新旗舰模型 GPT-4o(GPT-4 Omni),能够实时地对音频、视觉和文本进行推理。
推荐理由:官方宣布新旗舰模型,明确其实时跨音频、视觉和文本推理的定位,可作为了解该版本核心能力的入口。
xAI 发布 Grok-1.5 Vision 预览版,新增视觉理解能力,可处理图像、图表及文档内容,支持跨模态推理与视觉问答,现面向早期测试者开放试用。
推荐理由:xAI发布Grok-1.5 Vision预览版,具备多模态视觉理解能力
LlamaIndex 发布多模态 RAG 支持能力,新增 OpenAIMultiModal、ReplicateMultiModal、MultiModalEmbedding(CLIP)和 MultiModalVectorStoreIndex 等抽象,可对文本和图像统一索引与检索。
推荐理由:原文由 LlamaIndex 给出多模态 RAG 的新抽象与代码示例,读者可以直接了解 GPT-4V、CLIP 与 Qdrant 在同一管线中的组合方式。
OpenAI 宣布 ChatGPT 新增看、听、说能力。用户可向 ChatGPT 展示图像并进行对话讨论,也可用语音与它交流。
OpenAI 发布 GPT-4,称其为扩展深度学习的最新里程碑。GPT-4 是接受图像和文本输入、输出文本的大型多模态模型,在多项专业和学术基准上达到人类水平表现,但在许多现实场景中仍不及人类。
推荐理由:官方原文明确了 GPT-4 的多模态输入形态和基准表现定位,可作为了解该模型能力边界的直接信源。
Hugging Face 发布教程,讲解如何用 🤗 transformers 运行 CLIPSeg 实现零样本图像分割。
推荐理由:教程结合示例代码讲解 CLIPSeg 的文本与图像提示用法,还给出粗标注后在 Segments.ai 精修的可迁移流程。
Hugging Face 发布 Document AI 指南,梳理 OCR、文档图像分类、版面分析、文档解析、表格识别和 DocVQA 六大用例及对应开源模型与指标。
推荐理由:原文系统梳理了 Document AI 六类用例及对应开源模型、指标与许可证,团队可直接按图索骥选型并自建方案。
Hugging Face 与 BigScience 发布 1760 亿参数的开源多语言大模型 BLOOM,支持 46 种自然语言和 13 种编程语言。模型由 70 多个国家、250 多个机构的 1000 多名研究者历时一年协作完成,在法国 Jean Zay 超算上训练 117 天,算力来自 CNRS 和 GENCI 价值约 300 万欧元的资助。
推荐理由:原文来自 BLOOM 团队官方发布,给出了参数规模、语言覆盖、训练成本和开放使用方式,读者可以了解这个开放大模型的实际边界。
OpenAI 推出神经网络 CLIP,能通过自然语言监督高效学习视觉概念。只需提供待识别视觉类别的名称,CLIP 即可应用于任何视觉分类基准,类似 GPT-2 和 GPT-3 的零样本能力。
推荐理由:原文说明 CLIP 用自然语言监督学习视觉概念并可零样本套用于分类基准,读者可了解其与 GPT 系列零样本思路的关联。