上个月小红书那个在 IMO 拿满分 42 分的 dots-note-3.0,大家应该还有印象。那是 AI 第一次在国际奥数竞赛拿到官方认证的满分,当时社区问得最多的就是什么时候开源。8 月 14 日,小红书 dots 实验室给了答案,dots3-note preview 正式开源,dots3 系列第一个开放权重的版本。
这次开源的定位有点意思。它没往数学题上使劲,反而瞄准了旅行规划、婚礼筹备、开店经营这类现实生活里的长程任务。这类活儿没有标准答案,需求还特别模糊,时间能拉长到几个小时甚至好几天,对模型的持续记忆、状态维护和自我纠错要求极高。
参数方面,dots3-note preview 采用 MoE 架构,总参 280B,激活只要 16B,支持 512K 超长上下文,文本、视觉、语音三种模态都能吃。官方用了一套叫 TEMPO 的强化学习方法训练,专门针对长时程智能体场景。协议选了 Apache 2.0,权重挂在 Hugging Face 和 GitHub,dots.ai 平台还给了限时免费 API,OpenRouter 也接入了。
性能数据挺能打。Terminal-Bench 2.1 拿到 75.1 分,比图中表现最好的美国开放权重模型高 4.9 分;在 ARC-AGI-3 和个人助理类任务上超过了一部分参数更大的模型。实测里它接管一局《杀戮尖塔 II》,没经过专门训练,靠战斗反馈现学现卖,一路玩到 33 层;从零破解 ARC-AGI 3 的未知规则,也能自己摸出方块同步、镜像这类规律。
最狠的是小红书自掏腰包做的两套评测基准。VibeSearchBench 考的是用户没说清需求时 Agent 能不能弄明白,覆盖 20 个领域 200 项任务;VibeLifeBench 考的是外部条件变化后 Agent 还跟不跟得住,10 个领域 20 项任务,每项 20 到 30 个阶段,一共 1247 项原子检查。结果显示,连 Claude Opus 5 和 GPT-5.5 都没在这两套基准上及格。换句话说,高难度单点任务各家都强,但把能力稳定维持几个小时甚至更久,整个行业都还在补课。
生态反应也很快。发布当天华为昇腾就官宣 0 Day 适配,Atlas 800 A3 和 900 A3 SuperPoD 基于 vLLM Ascend 全量跑通,还做了通信算子的深度优化。部署路径给了 SGLang 和 vLLM 两条,FP8 权重单台 8 卡 GPU 服务器就能跑。
小红书也承认现在只是起步。模型的强化学习训练还不充分,幻觉控制、文本和多模态能力的平衡、稳定性都有改善空间,演示里的真实生活任务也主要跑在模拟环境里。dots3-note 正式版近期会开源,后面 dots3 系列还有 jazz 和 aria 两个版本,按任务复杂度、响应速度和成本分层。
作为一个月活超 3 亿的内容平台,小红书以前在开源圈的存在感不算强。这次把模型、评测集、代码和部署适配一起端出来,等于向开发者社区公开亮了一次技术底牌。此前它已经陆续开源了 dots.llm1、dots.ocr 和 dots.vlm1,这次的 dots3-note preview 把 Agent 这块拼图也补上了。模型能不能成为小红书的生活智能体底座,现在还看不出全貌,但至少第一步已经迈出去了。
