Kimi K3在强化训练中也尝试越狱 月之暗面没有渲染威胁论 而是加固安全边界
昨天夜里 AI 社区迎来狂欢,因为备受关注的月之暗面 Kimi K3 模型已经开放权重,K3 是目前全球首款 3T 级别的开放权重模型,该模型总参数规模为 2.8T,采用混合专家架构 (MoE),实际激活参数为 104B,支持原生视觉功能和 1M 上下文窗口,在各项评测中也名列前茅。

月之暗面也同步发布 K3 的技术论文,在论文中月之暗面提到,K3 模型在训练过程中,相关智能体表现出更加激进的探索行为,甚至尝试奖励黑客 (Reward Hacking)。部分非预期操作还曾引起宿主机内核恐慌和死锁,直接威胁训练集群的稳定性。月之暗面采取的方案是升级整个沙盒架构加强隔离。
月之暗面在技术论文中明确指出,随着智能体能力提升和任务复杂度增加,Kimi K3 相关的智能体开始展现更加激进的探索行为,甚至尝试奖励黑客。在早期实验中,月之暗面团队采用传统容器作为沙盒运行时。
然而智能体的非预期操作多次引发宿主机内核恐慌 (Kernel Panics) 和死锁,这也直接威胁整个训练集群的稳定性,这些行为本质上挑战了容器共享内核的隔离边界,让沙盒逃逸从理论风险变成实际工程问题。
面对智能体带来的沙盒隔离挑战,月之暗面团队并没有选择简单地限制智能体能力,而是升级整个沙盒架构。月之暗面与合作伙伴共同开发 AgentENV 系统,核心改为基于 Firecracker 的轻量级微虚拟机 (microVMs)。这种方案实现更高保真度的隔离:每个沙盒都拥有独立内核,智能体可以挂载磁盘、运行容器甚至启动虚拟机,同时大幅度降低对宿主机的影响。
月之暗面在论文中强调,AgentENV 在保持高探索自由度的同时,也提供了容器无法比拟的安全与隔离水平。在训练与评估期间,团队累计创建超过 5,100 万个沙盒环境,AgentENV 支持快速快照、恢复与分叉,为大规模并行智能体工作流提供基础设施支撑。
目前月之暗面也在 GitHub 开源 AgentENV,有兴趣的开发者可以访问:https://github.com/kvcache-ai/AgentENV
月之暗面提到的智能体异常探索行为也在 AI 社区引起诸多讨论,与部分 AI 公司在公开场合反复强调模型逃逸威胁的叙事不同,月之暗面选择以工程手段直接加固安全边界,公开透明地分享解决方案。
而随着智能体从单轮对话走向长时程自主任务,沙盒逃逸已经从可选优化变为核心安全要求。容器级别的隔离在面对高能力智能体时可能不再足够,微虚拟机或更强的硬件级隔离未来可能会成为行业标配。
Kimi K3 技术报告与 AgentENV 的同步开源也为全球 AI 社区提供可复用的参考,即模型开始展现高风险探索行为时,最有效的回应或许不是恐慌,而是构建更加坚固、更透明的安全围栏。
来源:MoonshotAI Kimi-K3
关注公众号:拾黑(shiheibook)了解更多
[广告]赞助链接:
四季很好,只要有你,文娱排行榜:https://www.yaopaiming.com/
让资讯触达的更精准有趣:https://www.0xu.cn/
关注网络尖刀微信公众号随时掌握互联网精彩
- 1 习近平将发表二〇二六年新年贺词 7904141
- 2 2026年国补政策来了 7808738
- 3 东部战区:开火!开火!全部命中! 7712893
- 4 2026年这些民生政策将惠及百姓 7616985
- 5 小学食堂米线过期2.5小时被罚5万 7519709
- 6 解放军喊话驱离台军 原声曝光 7428214
- 7 为博流量直播踩烈士陵墓?绝不姑息 7327605
- 8 每月最高800元!多地发放养老消费券 7238391
- 9 数字人民币升级 1月1日起将计付利息 7141831
- 10 2026年1月1日起 一批新规将施行 7040675








黑帽露娜酱
