一项涵盖80余篇学术论文和专利的审查显示,中国军方科研人员正利用 OpenAI 和 Anthropic 等美国大模型的输出,训练本土国防人工智能系统。
要点速览:
- 审查的80余篇中文论文和专利显示,多家与军方有关的机构正将美国前沿大模型“蒸馏”为可在本地硬件运行的小型系统。
- 解放军某网络作战单位向 GPT-3.5 输入敏感军用源代码,再用其生成的摘要训练国产模型。
- Anthropic 表示未在中国提供商业化访问,并警告蒸馏副本可能丢失原模型的安全护栏。
80余篇论文揭示模型“蒸馏”版图
这份审查部分由总部位于华盛顿的 Jamestown Foundation(詹姆斯敦基金会) 参与整理,通过公开文献 披露 了多家与中国人民解放军存在关联的科研机构。研究者在此基础上还额外锁定了二十余个与军方相关的具体案例。
文献普遍描述了所谓“模型蒸馏”(model distillation):即用算力更强的大模型生成答案或中间推理步骤,再将其作为训练数据,喂给参数规模更小、可在受限硬件上运行的本地模型。
其中一篇来自驻北京的解放军96941部队(被视为情报与网络作战单位)的论文,详述 了研究人员如何向 OpenAI 的 GPT-3.5 输入敏感军用源代码,仅保留模型生成的摘要与分析,再以此训练国产模型,使最终工具可以完全部署于解放军内部网络,无需访问境外服务器。
白宫、五角大楼、中国外交部、解放军以及 OpenAI 均未就此回应媒体置评请求。
延伸阅读: AI基础设施:发薪日贷款公司豪赌100亿美元转型数据中心
张峻庭:中方系统性“偷走”推理链路
参与审查逾60篇论文的詹姆斯敦基金会研究员 Sunny Cheung(张峻庭) 表示,中国军工科研正系统性捕获西方大模型的“推理链路”,而不仅仅是最终答案。
他在接受 采访 时指出,这些工作直接服务于监控、网络战和战术决策支持等场景。张峻庭强调,让模型给出“正确答案”是一回事,把背后复杂的推理过程迁移到一个更小、更易部署的系统上则难得多。
与中国军工体系关系密切的中北大学研究团队则被发现 使用 Anthropic 的 Claude 3 Haiku 生成合成训练数据,用于社交媒体舆情监测工具。Anthropic 表示,其未向中国境内提供 Claude 的商业化访问,并通过监控系统拦截违反政策的用法,同时警告称,被蒸馏后的复制模型很可能丢失原生的安全约束与行为限制。
蒸馏天花板与出口管制盲区
AI数据公司 Sapien 联合创始人 Trevor Koverko 指出,被蒸馏出的模型整体性能仍弱于源头大模型。他在接受 采访 时表示,这更像是将部分关键能力“转译”进一个更廉价、完全掌控在本地的数据资产中,而非真正摆脱对前沿模型的依赖。
与此同步,中国中央及地方政府持续加码对模型轻量化与边缘算力的投入,引导补贴流向可在无人机、卫星及其他受限终端上运行的软件系统,意在将智能能力前推至战场前线和空间平台。
围绕蒸馏技术的博弈已发酵数月。美国财政部长 Scott Bessent 7月放话称,将考虑对被认定大规模从事蒸馏行为的中国企业实施制裁。初创公司 Moonshot 则公开否认其“Kimi K3”模型依赖蒸馏美国前沿系统,而北京方面则反击华盛顿搞“人工智能霸权”,并反指多家美国科技企业同样在复制、简化竞争对手模型。





