Suno发布了新的创作工具,旨在将创意控制权完全交还给艺术家。新功能包括支持上传最长8分钟的音频、具备行业首创编辑工具(如歌词替换、段落修改和重混)的升级版歌曲编辑器,以及可调节创作风格的“创意滑块”。创作完成后,用户可利用前沿技术将轨道分离为12条独立音轨(如人声、鼓、贝斯)进行预览和下载,便于在数字音频工作站(DAW)中进行后续编辑。
另有 1 家信源报道Suno:Blog(网页)Topic · 主题全部主题 →
多模态
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
3,734条收录
407条精选
精选归档 · 第 21 页
第 401–407 条 · 共 407 条
6月3日
00:00
Suno:Blog(网页)精选
AI 评分 76/100
推荐理由:Suno 这次不是加几个 style,而是给了波形编辑和 12 轨分离,把 AI 音乐从生成器变成了制作工具,音乐创作者可以进来真正干活了。
5月20日
17:45
Google DeepMind:Blog(RSS)精选
Gemma 3n 预览版发布,专为移动设备优化的开源多模态模型。采用 2-in-1 架构,支持音频理解,适用于实时交互和音频中心应用开发。
另有 1 家信源报道Google DeepMind:Blog(RSS)推荐理由:Google 发布端侧多模态模型 Gemma 3n,支持音频理解,面向移动设备优化
4月14日
00:00
MiniMax:Blog(网页)精选
MiniMax 发布 MCP Server,集成文本转语音、语音克隆、文生图、文生视频等多模态能力。支持 Claude Desktop、Cursor、Windsurf 等主流 MCP 客户端,通过统一工作流实现文本到音视频的一站式生成,面向创作者和开发者免费开放。
推荐理由:MiniMax MCP Server 上线,支持语音克隆、文生图/视频并兼容 Claude Desktop 等主流客户端
12月13日
20:22
推荐理由:DeepSeek 开源 VL2 视觉模型,3B 轻量版可端侧部署,MoE 架构支持动态图像分块
11月4日
08:00
xAI:News(网页)精选
xAI 启动 Grok API 公测,发布新模型 grok-beta,支持 128k 上下文、函数调用及系统提示,视觉版本下周上线。开发者每月可获 $25 免费额度至年底,已购预付额度可叠加。API 兼容 OpenAI 与 Anthropic 格式,修改 base_url 即可迁移。
推荐理由:xAI开放Grok API公测,每月送$25额度且兼容OpenAI接口,开发者可立即体验
5月14日
01:39
Sam Altman:Blog(RSS)精选
OpenAI 将 GPT-4o 向所有 ChatGPT 用户免费开放,无广告。全新语音(及视频)模式响应速度接近人类,表现力极强,被 Sam Altman 称为「用过最好的计算机界面」,像电影里的 AI。未来还将支持个性化、代操作等功能。
推荐理由:Sam Altman 解读 GPT-4o 发布,强调语音交互与免费策略
4月12日
00:00
xAI:News(网页)精选
xAI 发布 Grok-1.5 Vision 预览版,新增视觉理解能力,可处理图像、图表及文档内容,支持跨模态推理与视觉问答,现面向早期测试者开放试用。
推荐理由:xAI发布Grok-1.5 Vision预览版,具备多模态视觉理解能力