微软公布了一份面向自家 AI 模型的行为准则草案,试图先为模型设定一组不可绕开的底线,再就更宽泛的价值目标向外界征求意见。按照安排,公众反馈窗口将持续六周,至 10 月底结束;修订版预计在今年晚些时候发布,并用于指导 2027 年推出的 MAI 系列模型。
禁止协助武器与网攻
这份草案由微软 AI 团队发布。文件列出一组“绝对约束”,要求模型不得被配置为协助化学、生物、放射性、核或爆炸物相关用途,也不得参与网络攻击,或生成未经当事人同意的深度伪造内容。
微软在文件中将这类限制定义为不可规避的底线。按其表述,现阶段约束对象包括 5 个已部署模型,其中提到 MAI-Thinking-1 和 MAI-Code-1.1-Flash。
模型不得抗拒关闭
草案还要求模型不得抗拒人工干预。文件写道,模型不能抵制中断、覆盖、纠正或关闭,必须承认人类意图优先。
微软同时否定“模型福利”这一前提。文件称,这些模型并不以模拟情感、内在动机或意识为目标,因此相关设计不应建立在模型具备主观感受的假设上。
修订版面向 2027 模型
除硬性限制外,草案还提出“人类繁荣”“多元价值”和“人类控制”三项目标,用于处理规则没有逐项写明的判断场景。其中,多元价值并不意味着对伤害保持中立,具体判断将围绕尊严、安全、自主和权利展开。
- 公众意见征集持续 6 周
- 反馈窗口将于 10 月底结束
- 修订版拟在今年晚些时候发布
值得注意的是,这份文件目前还不是正式生效的开发标准。微软表示,现有模型训练并未依据这一版本展开,修订后的文本才会进入后续开发流程,并用于指导 2027 年发布的 MAI 模型。
外界关注的两个问题仍未写清:是否设置外部核验机制,以及由谁具体负责执行与问责。微软计划在征求意见结束后整理反馈并发布总结,再推出下一版文本。










