cua 升级 computer-use 2.0,跨系统机群训练评测
cua 的定位是用开源的方式驱动跨操作系统的 agent 机群,把 computer-use 推到 2.0。它同时承担训练、评估与数据生成三类任务。 为什么要跨操作系统 computer-use 类智能体的能力上限,很大程度上取决于它在多少…
cua 的定位是用开源的方式驱动跨操作系统的 agent 机群,把 computer-use 推到 2.0。它同时承担训练、评估与数据生成三类任务。 为什么要跨操作系统 computer-use 类智能体的能力上限,很大程度上取决于它在多少…
needle 是给微型设备准备的基础模型,量到 2-bit 之后体积只有 8 到 29 MB。这个尺寸意味着它能塞进手机、可穿戴设备、智能家居、机器人、汽车,甚至微控制器。 这个体积意味着什么 8 MB 是个分水岭。它小到可以完整放进片上存…
Bilibili 开源工业级零样本语音克隆模型 IndexTTS-2.5。公开信息显示,该模型参数量仅 0.8B,支持中、英、日、西、阿五种语言的跨语种迁移;通过重构推理架构,速度提升 2.28 倍,实时率低至 0.20;同时支持 0.5x…
7 月 6 日消息,据 IT之家报道,美团已将万亿参数大模型 LongCat-2.0 正式开源,并同步开放面向国产算力优化的推理代码。公开信息显示,LongCat-2.0 总参数规模 1.6T,平均激活参数约 48B,官方页面进一步给出每个…
阿里千问办公开源了上下文基础设施项目 MyContext。它要解决的问题,是所有办公智能体都会撞上的那堵墙:模型再聪明,如果不知道”这个项目为什么延期、上次会议谁拍板、那份表格在哪”,就只能给出正确但无用的回答。My…
结论先行:小红书 FireRed 团队开源的 FireRedTTS3,是一个把”语音生成”与”语音编辑”合并进单一模型的开源语音方案。它以 RedAE 语义增强连续表示与 LLM-DiT 架构…
微软开源了 4B 参数的多模态模型家族 Mage,包含两个成员:专注流式视频与图像理解的 Mage-VL,以及负责图像生成与编辑的 Mage-Flow。几个数字相当亮眼——Mage-VL 采用 Codec-Native 编码,视觉 Toke…
Loopit 开源了实时交互视频世界模型 Zing-0.5。这是一组相当有冲击力的数字:5B 参数(基于 Wan2.2-TI2V-5B),支持键盘操控与自然语言语义改写的联合控制,单卡 RTX 5090 可跑超过 24 FPS 实时生成,一…
英伟达推出开源智能汽车推理模型 Alpamayo 2 Super。它基于 Cosmos 3 Super Reasoner 构建,采用 OpenMDW 1.1 商业许可——这意味着允许商用与微调,这在自动驾驶领域并不常见。能力层面,模型在 L…
结论先行:腾讯混元团队开源了投机解码框架 AngelSpec,覆盖从 drafter 训练、架构设计到线上部署的完整链路。同时开源的还有 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。实测数据相当亮眼:DFly…