微软MAI Code1.1Flash:GitHub Copilot支持本地与云端混合推理

微软10月7日在Windows和Surface发布会上宣布,将于本月底前为GitHub Copilot引入本地AI模型支持,允许开发者在云端与设备端模型之间自由切换或实现自动调度。针对端侧推理的内存瓶颈与长上下文资源占用问题,微软同步推出了MAI Code1.1Flash混合专家(MoE)模型,拥有1370亿总参数及68亿激活参数,结合量化与投机解码技术,在降低内存占用的同时提升设备端编码响应速度,并率先搭载于配备NVIDIA RTX Spark硬件的新款Surface Laptop Ultra。

MoE架构:1370亿参数如何装进本地设备

MAI Code1.1Flash采用混合专家架构,总参数量1370亿,但实际每次推理只激活68亿参数,其余专家模块处于休眠状态。这一设计使模型在保持强编码能力的同时,将内存占用控制在消费级显卡可承载的范围内。相比纯稠密模型,同等性能下内存需求下降约70%。

GitHub Copilot混合推理:本地与云端自动调度

开发者可通过GitHub Copilot CLI、Copilot应用及Visual Studio Code启用混合模式。系统根据任务复杂度自动分配推理位置:简单补全走本地模型,复杂调试调用云端。这种”按需分配”的策略既能降低延迟,也能减少云端成本。本月底前将向所有Copilot用户推送更新。

战略意图:微软正成为AI编程入口

从Code1.1Flash到Copilot混合推理,微软正在将AI编程工具从”云端辅助”升级为”端云协同”。RTX Spark作为首个Copilot认证的本地硬件平台,意味着AI编程助手第一次可以完全离线运行——这对需要处理专有代码库或有数据隐私要求的企业用户意义重大。

相关阅读:微软Project Quine:首个生物学世界模型如何在一个周末筛出抗癌候选物

相关进展:端侧推理需要硬件与模型同时到位

MAI Code1.1Flash 要真正跑起来,硬件与模型得同时到位。本站此前已分别记录过微软与英伟达在端侧硬件上的动作,以及 Copilot 在真实工程里的表现,可以对照着看这套端云协同方案的成色。

相关阅读:微软联手英伟达推 RTX Spark AI 电脑:Surface Laptop Ultra 起售价 2600 美元、GitHub Copilot 运行时 AI 移植 Rust 实录:43 万行 TS 变 80 万行、微软 Project Quine:首个生物学世界模型如何在一个周末筛出抗癌候选物