结论先行:蚂蚁集团通过 inclusionAI 组织开源了 Ling-3.0-flash-VL——百灵系列里第一款原生多模态模型。它的核心账非常好记:总参数 124B,但每个 token 只激活约 5.5B;原生支持图像、文本与视频输入;上下文窗口 256K token;采用 Apache 2.0 协议,BF16 与 FP8 权重同步开放。真正让它区别于”多模态外挂”的,是把视觉塞进了”观察—行动—验证—修正”的执行闭环。
核心参数一览
| 维度 | 参数 |
|---|---|
| 模型名称 | Ling-3.0-flash-VL |
| 基座 | Ling-3.0-flash 的稀疏 MoE 架构 |
| 总参数量 | 124B |
| 单 token 激活参数 | 约 5.5B |
| 输入模态 | 图像、文本、视频(原生) |
| 上下文窗口 | 256K token |
| 开源协议 | Apache 2.0 |
| 开放权重精度 | BF16、FP8(FP4 / INT4 计划中) |
| 开源平台 | Hugging Face、ModelScope |
架构拆解:视觉不是插件,是长在链路里的
视觉侧:任意分辨率编码器 + VideoRoPE
视觉通路由一个 ViT 编码器负责抽取图像与视频特征,再用两层 MLP projector 把视觉表征对齐到文本空间。关键设计是 VideoRoPE——它同时编码空间位置与时间顺序,因此模型才能支持事件定位、长视频问答和视频片段编辑这类需要”时序感”的任务,而不只是描述单帧画面。
语言主干:42 层混合注意力,KDA 与 Gated MLA 按 5:1 交替
语言部分是 42 层的混合结构,KDA 层与 Gated MLA 层按 5:1 的比例交替排列,目标是在长上下文场景下保持推理效率,外面再包一层稀疏 MoE,用 124B 的总容量换 5.5B 的单 token 计算量。这个组合的逻辑很直接:容量留给知识,算力留给速度。
真正的卖点:视觉反馈闭环
大多数开源多模态模型止步于”看懂图片”,Ling-3.0-flash-VL 想做的是”看着结果把活干完”。官方把任务推进明确定义为观察 → 行动 → 验证 → 修正的持续闭环。
三个点名的落地场景
| 场景 | 闭环怎么起作用 |
|---|---|
| 网页复刻 / 前端生成 | 先看懂设计稿的布局与组件关系,生成代码后再比对渲染结果,回头修订代码 |
| GUI Agent | 解析界面结构,串联多个工具的跨应用动作 |
| 医疗报告解读 | 跨文档整合与风险标记,而非停留在单页摘要 |
在图生网页(Image-to-WebDev Arena)测试中,官方以 linthium 这一代号参与,称成绩超过 GPT-5.4。这类竞技场分数属于厂商自述数据,横向引用时建议标注来源版本。
成绩单该怎么读:官方 42 分与第三方 25 分的口径差
这是本次开源最值得开发者警惕的一点。官方模型卡称 Ling-3.0-flash-VL 在 Artificial Analysis Intelligence Index v4.1.1 上得 42 分,比纯文本版 Ling-3.0-flash 的 38 分高 4 分,据此得出的结论是”联合多模态训练反过来也提升了文本能力”。但 Artificial Analysis 自己的评测给出的是 25 分。
| 来源 | 分数 | 口径 |
|---|---|---|
| 官方模型卡 | 42 | AA Intelligence Index v4.1.1(厂商引用) |
| 官方对照:纯文本版 | 38 | 同 Index,据此称多模态反哺文本 |
| Artificial Analysis 独立评测 | 25 | 评测方自有口径,并将模型置于”智能 vs 激活参数”帕累托前沿 |
| 同规模参照 | Qwen3.5 122B A10B 16 分 / Mistral Medium 3.5 (high) 15 分 | 第三方评测中的同体量对比 |
两组数字大概率来自不同的 Index 版本。第三方评测还披露了发布材料通常不会强调的短板:幻觉率 22%(对比 Inkling Small 的 63% 确实克制),但 AA-Omniscience 事实召回准确率只有 14%,AutomationBench-AA 业务流程自动化 16%,而在更硬的 Terminal-Bench v4.0 上为 0%。翻译成大白话:“看得见、会动手”是真的,”可靠的数字员工”还早。
部署前必须算清的一笔账:激活 5.5B ≠ 显存 5.5B
这是最容易踩坑的认知偏差。激活参数减少的是单 token 计算量,不是显存占用——124B 的权重仍然要完整放进显存里。
| 配置 | 说明 |
|---|---|
| 256K 上下文参考配置 | 4 张 141GB 级 GPU(H20-3e / H200,或 B300 / GB300 节点),使用 YaRN 扩展 |
| 80GB 卡方案 | H100 / H800 扩展到 8 路张量并行 |
| 服务路径 A | 官方 SGLang Docker 镜像 |
| 服务路径 B | inclusionAI 维护的 vLLM 分支 vllm-ling-v3(含推理与工具调用 parser,适配 Ling-3 聊天模板) |
此外官方也为轻量场景做了定位:保持低显存占用、支持高分辨率输入与流式输出,BF16 / FP8 已开放,FP4 与 INT4 版本在计划中。想在手机或智能终端上跑,仍需等更低精度的版本落地。
FAQ
1. Ling-3.0-flash-VL 和 Ling-3.0-flash 是什么关系?
后者是纯文本 MoE 基座,前者是在它的基础上扩展出原生视觉通路的同系列多模态版本。官方数据是 42 分对 38 分,并称联合训练让文本能力也得到提升。
2. 256K 上下文实际能用满吗?
技术上可以,但需要 YaRN 扩展,并且按模型卡给出的参考配置,要 4 张 141GB 级 GPU 起步。显存预算不足时,应先压上下文长度而非指望量化覆盖全部开销。
3. 做 GUI Agent 现在能上生产吗?
谨慎乐观。模型具备”观察—行动—验证—修正”的闭环设计,GUI 解析与跨工具串联是官方点名的能力;但第三方在 Terminal-Bench v4.0 上给出的 0%,说明复杂终端场景远未成熟,建议先做有人工复核环节的半自动链路。
小结
Ling-3.0-flash-VL 的价值不在于又多了一个”能描述图片”的开源模型,而在于把视觉明确放进了规划与验证环节。5.5B 激活的推理经济性,瞄准的正是闭源厂商定价最厚的 flash 档——这也是出货量最大的价格带。对开发者来说,最该记住的不是官方的 42 分,而是第三方给出的、Terminal-Bench v4.0 上那枚刺眼的 0。开源多模态的竞赛才刚从”能描述 else 能闭环”切换赛道,深水区还在前面。
相关阅读
这条线上还有几篇站内文章可以接着看:
