小红书 FireRedTTS3 开源:统一语音生成与编辑,24 语种 21 种中文方言零样本克隆
结论先行:小红书 FireRed 团队开源的 FireRedTTS3,是一个把”语音生成”与”语音编辑”合并进单一模型的开源语音方案。它以 RedAE 语义增强连续表示与 LLM-DiT 架构…
结论先行:小红书 FireRed 团队开源的 FireRedTTS3,是一个把”语音生成”与”语音编辑”合并进单一模型的开源语音方案。它以 RedAE 语义增强连续表示与 LLM-DiT 架构…
用 Coding Agent 的人大概都有过这个体验:为了让助手能查数据库、调接口、读文档,要在配置文件里塞进五六个 MCP 服务,每个服务各有各的申请流程、各自的密钥格式、各自的计费口径。配置一次两小时,换台机器还得重来。阿里云上线的 O…
视频生成模型的评价标准正在变化:过去比的是「单条片段有多清晰」,现在比的是「这个世界能不能一直跑下去、还能不能被人实时改变」。爱诗科技(AIsphere)发布的 PixVerse R2 实时全模态世界模型技术报告,正是冲着后一个问题去的。它…
AI 视频生成这两年的瓶颈,早已不是「能不能生成几秒好看的画面」,而是能不能交付一段可以直接用的成片。智象未来(HiDream)给出的答案是 vivago R1:定位全球首个无限时长内容创作智能体,国内版「够搭」同步升级,采用 Chat-F…
通用大模型在金融场景里最常见的失败,不是算错数,而是「看起来很专业但经不起追问」:引用了过期的财务数据、把会计口径混用、在估值模型里悄悄改了假设。蚂蚁百灵给出的应对方式是做一个专门的金融增强模型 Ling-3.0-flash-Fin:延续 …
如果你还在为「语音识别用一个模型、语音合成换另一个模型、音频理解再接第三个模型」的拼装方案头疼,小红书 FireRed 团队给出的答案是一个模型全包:FireRedAudio 通用音频语言模型。它基于 9B 参数的 Qwen3.5 架构,采…
字节跳动 Seed 团队推出原生音视频全双工大模型 SeedRealtime。它的核心主张可以用一句话概括:基于统一架构原生融合音频、视频与文本,实现「边看、边听、边说」的实时多模态交互。官方披露其具备音视频联合理解、主动交互与流畅对话节奏…
微软开源了 4B 参数的多模态模型家族 Mage,包含两个成员:专注流式视频与图像理解的 Mage-VL,以及负责图像生成与编辑的 Mage-Flow。几个数字相当亮眼——Mage-VL 采用 Codec-Native 编码,视觉 Toke…
Loopit 开源了实时交互视频世界模型 Zing-0.5。这是一组相当有冲击力的数字:5B 参数(基于 Wan2.2-TI2V-5B),支持键盘操控与自然语言语义改写的联合控制,单卡 RTX 5090 可跑超过 24 FPS 实时生成,一…
英伟达推出开源智能汽车推理模型 Alpamayo 2 Super。它基于 Cosmos 3 Super Reasoner 构建,采用 OpenMDW 1.1 商业许可——这意味着允许商用与微调,这在自动驾驶领域并不常见。能力层面,模型在 L…