端侧模型之前有个痛点:参数小了跑得动,但处理不了长文本;参数大了跑不动。上下文稍微长一点就开始丢信息、忘前情、已读乱回。
科大讯飞这次想把这个矛盾解决一下。
9月1日,科大讯飞全资子公司词元星火正式开源星火 X2.5-4B 和星火 X2.5-1.7B 两款端侧通用大模型。两款模型的核心卖点是一个:端侧模型里,第一个原生支持最长 100 万 Token 上下文的。
百万 Token 上下文进端侧,意味着什么
过去在手机 PC、汽车座舱、智能家居设备上跑 AI,对上下文长度的期待普遍不高。端侧模型能聊两句就行,真正处理文档、做任务,还是要回到云端。
星火 X2.5 这次把百万级上下文放进去了。100 万 Token 大约相当于一本《哈利·波特》全集,或者一整套会议记录、一份完整的代码仓库。
模型基于约 20 万亿 Token 多样化数据预训练,通过高质量监督微调和强化学习持续提升推理、代码、智能体和指令遵循等任务表现。使用千亿 Token 级高质量数据针对长文档场景做专门训练,所以「原生支持」的意思是:从架构层面就把长上下文当作设计目标,不是后期打补丁。
架构:混合注意力
两款模型采用混合注意力架构,围绕智能体、代码、数学和指令遵循等核心能力优化。
具体场景上的效果:代码开发中,X2.5-4B 在算法实现、代码补全与生成等任务上可以对标参数规模大 2 至 3 倍的云端模型,脚本生成、调试辅助可以在本地直接完成,不需要联网。智能家居场景中,X2.5-1.7B 控制指令端到端执行正确率达到 90.3%,平均响应时间 0.85 秒。
全国产算力训练
两款模型基于全国产算力平台完成全流程训练。
对于有国产化要求的行业场景——车载、政务、金融、央企国企——这个背景决定了它们能被合规引入,而不只是停留在技术测评阶段。
部署层面,两款模型支持英伟达、华为、海光及后摩等硬件平台,兼容 vLLM、SGLang、llama.cpp 等主流推理框架,可通过 Ollama、LM Studio 快速部署,支持 LLaMA-Factory 增量训练。
开源了,可以下了
模型权重、代码仓库和部署文档已在 Hugging Face 和 GitHub 开放,API 已上线讯飞星辰 MaaS 平台,限时免费。
9月7日,科大讯飞还将正式发布星火 X2.5(293B)基座模型,进一步升级代码和智能体等核心能力。
一句话概括这次发布:端侧 AI 的定位正在从「能聊两句」升级为「能在本地完成真实任务」。百万 Token 上下文是技术基础,代码和智能体能力是落地出口。
