微信团队发布 WeLM 大模型家族:80B 已上线小微,617B 在研

微信不只想做 AI 功能的入口——它开始自己做模型了。

8月12日至13日,腾讯微信团队正式在 X 平台公布了大语言模型系列 WeLM(WeChat Large Language Model),主打资源效率,面向微信生态内的 AI 规模化落地。80B 版本已接入微信 AI 助手「小微」,617B 版本正在开发中。

两个规格:80B 已部署,617B 在研

根据官方公布的信息,WeLM 系列目前明确两个规格:

模型 总参数量 激活参数量 状态
WeLM-80B 800亿 30亿 ✅ 已上线,接入小微
WeLM-617B 6170亿 230亿 🔨 开发中

两个版本均采用混合专家(MoE)稀疏架构,核心目标是「用更少的激活参数实现更强的能力」。

WeLM-80B:已经在小微里跑着了

已上线功能:聊天与搜索、使用微信原生功能、调用小程序服务。

用户现在和「小微」对话时,背后跑的就是 WeLM-80B。可以让小微帮忙总结朋友圈、查聊天记录、调用小程序——这些看似「普通」的功能,实际上是微信生态内最高频的 AI 需求。

WeLM-617B:面向更复杂的微信任务

617B 版本定位更高端,面向微信生态内的复杂任务:

  • 智能小程序开发:让 AI 辅助生成和调试小程序
  • 小微工具生成:根据用户描述生成定制化小工具

技术博客:三个方向同时推进

微信 AI 团队在 WeLM Blog(welm.weixin.qq.com)同步发布了三篇技术博客:

  • 以适度资源构建高效稀疏 MoE 模型:在不足 14T tokens 的语料上训出高性价比的 80B-A3B MoE 模型
  • 初探 WeLM-258B MoE 模型后训练:分享后训练阶段的核心流程与关键实践
  • Hidden Decoding:通过 Vocab Embedding 复制扩展序列长度,不增参数量但大幅提升计算效率

和混元什么关系?

这是腾讯内部的「双线作战」问题。混元(Hunyuan)是腾讯 TEG 出品的通用大语言模型,7月6日刚发布 Hy3 正式版。WeLM 则是微信团队独立研发的生态专用模型,两者在技术路线、团队、数据体系上均独立。

有内部人士打了个比方:「混元想做一个能回答宇宙终极问题的 AI,WeLM 只想帮你点好一杯奶茶,然后让你该干嘛干嘛去。」