导语 |
太平洋时间 10 月 7 日上午 10 点(北京时间 10 月 8 日凌晨 1 点),微软在旧金山举办的 Windows 与 Surface 发布会上宣布:GitHub Copilot 将于 10 月底前引入端云混合推理架构——由后台协调器在云端模型与设备端本地模型之间自动或手动切换,覆盖 Copilot CLI、Copilot 应用与 Visual Studio Code。与之配套,微软发布了可跑在笔记本上的本地编程模型 MAI Code 1.1 Flash,并率先适配 Surface Laptop Ultra 等 NVIDIA RTX Spark 设备。同日,GitHub Copilot CLI 更新日志上线本地模型发现功能,用一条 /model 命令即可接入正在运行的 Ollama 本地模型。这意味着全球最大规模的 AI 编程用户群,第一次可以把"模型跑在哪"的选择权握在自己手里。 |
一、从"云端独占"到"端云自由切换":架构级变化
GitHub Copilot 是微软旗下的 AI 编程助手,可集成于 Visual Studio Code、CLI 等工具,根据代码上下文生成补全、解释或重构建议。在此之前,Copilot 的推理完全依赖云端托管模型,由后台协调器根据性能、成本与准确性在多个云端模型之间路由请求。
此次宣布的核心变化在于:到本月底,这一协调机制将把"设备端"纳入调度范围。微软在官方博客中表示,Copilot 将自动判断一项任务更适合由设备端智能处理,还是应该交给云端大规模模型,开发者无需自行管理基础设施决策。
具体而言,微软为用户提供两种使用模式:
1. 自动编排:由 Copilot 后台自动协调云端与本地推理任务,开发者不感知切换过程;
2. 强制本地:开发者显式指定使用设备端模型,对推理位置拥有完全控制权。
偏好设置可在 GitHub Copilot CLI、Copilot 应用与 Visual Studio Code 三类入口中完成。微软强调,这是其 HydraFusion 编排愿景的下一步——从"在多个模型间编排"扩展为"在多种计算环境(含边缘端)之间编排"。
二、MAI Code 1.1 Flash:1370 亿参数如何"塞进"笔记本
支撑本地推理的,是微软同步推出的 MAI Code 1.1 Flash——一个专为编程打造的混合专家(MoE)模型。其关键参数如下:
指标 | 规格 |
总参数量 | 1370 亿 |
激活参数量 | 68 亿 |
本地上下文窗口 | 256,000 Token |
关键技术 | 量化(约 3-bit ,模型体积缩减近 80% ) + 投机解码 |
参考硬件 | Surface Laptop Ultra ( NVIDIA RTX Spark ,最高 128GB 统一内存) |
参考峰值内存 | 约 75.5GB ( 256K Token 上下文) |
MoE 架构的思路是"大容量、小激活":模型总参数决定能力上限,但每次推理只激活其中 68 亿参数,从而大幅降低单次计算量;再叠加量化与投机解码,微软显著压缩了端侧推理的内存占用与响应延迟。
性能方面,微软公布的 Surface Laptop Ultra 实测数据显示,在复杂任务中模型的峰值内存使用率、Token 利用率与处理速度均有提升;解码吞吐量测试显示,当提示长度从 2K 到 256K Token 变化时,吞吐介于每秒 40 至 63 个词元。
在接入方式上,开发者既可以通过 Windows ML 提供程序选择 MAI Code 1.1 Flash,也可以连接 OpenAI 兼容的本地端点,选用其暴露的任意模型。需要说明的是,本地推理的计费与订阅安排官方暂未完整披露,实际商用条款有待后续明确。
三、HydraFusion 与 MXC:编排与安全的"双支柱"
本次升级背后有两套基础设施值得关注。
编排层:HydraFusion 走向"跨环境"。此前 HydraFusion 作为协调器,负责在多个云端模型之间为每个任务选择一个或多个模型,平衡性能、成本与延迟。此次扩展后,其调度范围首次覆盖边缘端设备,形成"云端模型 + 本地模型 + 多种算力环境"的统一编排。
安全层:微软执行容器(MXC)。本地运行模型、本地执行代码,意味着安全边界必须重新划定。微软同步宣布 Microsoft Execution Containers 在 Windows 11 上正式可用:它为 AI 智能体的交互式与非交互式编码会话提供隔离环境,可对文件、网络、系统功能与凭据的访问实施受控授权。该机制支持进程容器、Windows 会话与 WSL 容器等多种隔离方式,并提供强制(Enforcement)、学习(Learning)、许可(Permissive)三种权限管理模式。微软表示,OpenAI Codex、GitHub Copilot、OpenClaw 与 NVIDIA OpenShell 等工具已支持 MXC,Anthropic Claude Code 等其他工具的支持也在计划之中。
四、Copilot CLI 先行:一条 /model 命令发现本地 Ollama 模型
在混合推理正式上线前,GitHub 已于 10 月 7 日通过更新日志先行落地了一项本地模型能力。自 CLI 版本 1.0.94-0 起,开发者使用 /model 命令即可发现正在运行的本地 Ollama 实例所提供的受支持模型,并将其与已配置模型、Copilot 云端模型并列展示。
这项功能有四个要点:
1. 不自动添加:发现不等于启用。开发者选中某个模型后,需查看其提供程序与端点信息,再确认"添加并在本会话使用"或"添加但不切换",全程无需重启 CLI;
2. 前置条件:Ollama 与模型必须已经安装——该流程不会代为安装运行时或下载模型权重;所选模型必须支持工具调用(tool calling)与流式输出(streaming);
3. 失败可见:提供程序连接失败会在选择器中显示具体原因,而不是静默回退到其他模型;
4. 隐私边界清晰:选择本地模型并不会自动开启离线模式或关闭 GitHub 遥测;真正的离线模式仍需通过 COPILOT_OFFLINE=true 显式设置。即便处于离线模式,远程提供程序仍可能通过网络接收提示与代码上下文。
GitHub 在更新日志中还预告了"本地模型智能路由"——即 CLI 自动判断何时使用本地模型、何时使用云端模型,与微软官方博客宣布的混合推理路线互为呼应。
五、硬件门槛:本地推理的"隐形门票"
混合推理并非对所有开发者无差别开放。微软官方给出的参考配置,围绕的是配备 NVIDIA RTX Spark 平台的新一代 Windows 设备:该平台组合 Blackwell 架构 RTX GPU 与 Grace CPU,支持最高 128GB 统一内存与最高 1 petaflop 的 FP4 理论 AI 算力(稀疏)。
Surface Laptop Ultra 是本次的"样板机":其高端配置提供最高 128GB 统一内存,可本地运行 1200 亿参数以上的受支持模型,售价 2599 美元起,10 月 16 日上市;面向桌面 AI 开发的 Surface RTX Spark Dev Box 售价 5999 美元,预计 11 月起在美国发货。
微软在官方博客中详细解释了"内存为什么是端侧编码智能体的命门":统一内存让 CPU 与 GPU 共享同一物理池,扩大了可用容量,但操作系统、应用、推理运行时以及存储注意力状态的键值缓存(KV cache)都要占内存;随着智能体读取文件、接收工具结果,上下文增长会持续推高内存占用。MAI Code 1.1 Flash 在 256K Token 上下文下约 75.5GB 的峰值内存,正说明了为何"128GB 统一内存"是当前本地推理体验的现实门槛。官方公告未提供通用的最低配置清单,企业用户不宜假设现有开发机都能跑出所宣传的上下文长度与性能。
此外,微软还在筹备对超过 700 亿参数的 NVIDIA Nemotron 模型的支持——通过 2-bit 量化将其内存需求压至 20GB 出头,并在 Windows ML 中加入对 llama.cpp 的支持,方便开发者运行开源模型。
六、行业背景:端云混合是"大势",而非孤例
微软此番动作,与整个行业从"云端集中算力"向"端云协同"的迁移趋势高度吻合。
机构预测普遍指向同一方向:Gartner 预计到 2028 年,超过三分之二的企业管理数据将在数据中心或云端之外创建和处理;到 2029 年,全球超过三分之二的企业将部署边缘 AI(2025 年这一比例仅为 10%)。IDC 在 2026 年 FutureScape 预测中预计,到 2030 年企业 AI 推理负载的一半将运行在终端或边缘节点上。
在开发者最贴近的 PC 端,IDC 预计 2026 年全球 Gen AI PC 出货量将达 5000 万台、占整体 PC 出货量的 19.6%;Gartner 对 2026 年全球 AI PC 出货量的预测则高达 1.43 亿台。IDC 同时预计,全球 AI PC 市场规模将从 2026 年的 1318 亿美元增至 2034 年的 5743 亿美元,复合年均增长率 20.2%。弗若斯特沙利文则测算,全球端侧 AI 市场规模将从 2025 年的 3219 亿元攀升至 2029 年的 1.22 万亿元。
背后的驱动力并不抽象:Token 计费账单随使用量攀升、网络往返带来的延迟、以及数据合规与隐私红线,共同把"算力往端侧下沉"从概念变成刚需。AI 编程助手作为开发者日均使用频次最高的 AI 场景之一,自然成为端云混合架构落地的第一站。
七、竞争与影响:编码助手进入"路由能力"竞争阶段
从竞争视角看,微软此举至少有三层影响。
其一,把"混合"从社区实践升级为产品能力。2026 年以来,Qwen3-Coder、Devstral 2、DeepSeek、Gemma 等开放权重编程模型配合 Ollama、LM Studio 等运行时,已让"本地跑代码模型"从极客玩法变成生产可用的日常方案;但开发者往往要在 Copilot 与本地工具链之间二选一。微软把本地模型直接纳入 Copilot 的模型选择器,等于承认并收编了这条自发路线——开发者不必再为了本地推理而放弃 Copilot 的工作流。
其二,硬件生态随之受益。优先适配 NVIDIA RTX Spark 设备的选择,将 AI 编程体验与新一代 AI PC 绑定,为"换机理由"再添一条:断网可用的补全、更低延迟的响应、不出本机的代码上下文,对金融、医疗、政务等数据敏感行业尤具吸引力。
其三,竞争者将面临对标压力。本地推理目前仍是各家编程助手的能力空白区,微软凭借"Windows + Surface + GitHub + 自研模型"的垂直整合率先落子。可以预见,其他云端编程助手厂商将在"是否支持本地模型、路由是否聪明、硬件门槛能否下探"上快速跟进。
当然,混合推理的成色仍待验证:本地模型与云端前沿模型在复杂长上下文任务上的能力差距依然存在,自动编排的路由质量将直接决定体验上限;75GB 级的内存需求也意味着短期内只有旗舰设备才能享受完整体验。
结语
从 2021 年上线至今,GitHub Copilot 的每次进化都伴随着 AI 基础设施的重心迁移:先是云端大模型让补全"变聪明",如今端侧算力让推理"变自主"。10 月底这次更新,表面上是加了一个模型选择项,实质上是把开发者的算力选择权从云厂商手中部分交还给开发者本人。端云混合不是云的退场,而是智能的分布——正如微软所言,这是"跨越多种计算环境的智能编排"的开始。对于每天与代码打交道的开发者而言,值得关注的下一个问题是:你的机器,够格跑哪个模型?