智象未来 vivago R1「够搭」全球上线:首个无限时长内容创作智能体,5 分钟视频可用率 85%
AI 视频生成这两年的瓶颈,早已不是「能不能生成几秒好看的画面」,而是能不能交付一段可以直接用的成片。智象未来(HiDream)给出的答案是 vivago R1:定位全球首个无限时长内容创作智能体,国内版「够搭」同步升级,采用 Chat-F…
AI 视频生成这两年的瓶颈,早已不是「能不能生成几秒好看的画面」,而是能不能交付一段可以直接用的成片。智象未来(HiDream)给出的答案是 vivago R1:定位全球首个无限时长内容创作智能体,国内版「够搭」同步升级,采用 Chat-F…
通用大模型在金融场景里最常见的失败,不是算错数,而是「看起来很专业但经不起追问」:引用了过期的财务数据、把会计口径混用、在估值模型里悄悄改了假设。蚂蚁百灵给出的应对方式是做一个专门的金融增强模型 Ling-3.0-flash-Fin:延续 …
如果你还在为「语音识别用一个模型、语音合成换另一个模型、音频理解再接第三个模型」的拼装方案头疼,小红书 FireRed 团队给出的答案是一个模型全包:FireRedAudio 通用音频语言模型。它基于 9B 参数的 Qwen3.5 架构,采…
字节跳动 Seed 团队推出原生音视频全双工大模型 SeedRealtime。它的核心主张可以用一句话概括:基于统一架构原生融合音频、视频与文本,实现「边看、边听、边说」的实时多模态交互。官方披露其具备音视频联合理解、主动交互与流畅对话节奏…
微软开源了 4B 参数的多模态模型家族 Mage,包含两个成员:专注流式视频与图像理解的 Mage-VL,以及负责图像生成与编辑的 Mage-Flow。几个数字相当亮眼——Mage-VL 采用 Codec-Native 编码,视觉 Toke…
Loopit 开源了实时交互视频世界模型 Zing-0.5。这是一组相当有冲击力的数字:5B 参数(基于 Wan2.2-TI2V-5B),支持键盘操控与自然语言语义改写的联合控制,单卡 RTX 5090 可跑超过 24 FPS 实时生成,一…
英伟达推出开源智能汽车推理模型 Alpamayo 2 Super。它基于 Cosmos 3 Super Reasoner 构建,采用 OpenMDW 1.1 商业许可——这意味着允许商用与微调,这在自动驾驶领域并不常见。能力层面,模型在 L…
腾讯混元正式推出端侧翻译模型 Hy-MT2-1.8B。这款模型最值得关注的不是参数规模,而是量化压缩——通过 2-bit 与自研 Sherry 1.25-bit 技术把原本 3.3GB 的模型做到极致压缩,同时保持翻译质量几乎无损,官方披露…
结论先行:腾讯混元团队开源了投机解码框架 AngelSpec,覆盖从 drafter 训练、架构设计到线上部署的完整链路。同时开源的还有 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。实测数据相当亮眼:DFly…
结论先行:英伟达开源了文本嵌入模型系列 Nemotron 3 Embed,专为检索增强生成(RAG)与智能体检索设计。系列包含 8B 与 1B 两种参数规模,支持 32k 上下文窗口与 34 种语言。旗舰版 8B 模型在 RTEB 多语言检…