OpenAI拟让第三方更早介入安全评估,训练阶段就要开门

2026-09-23 17:47 1008 次浏览

OpenAI在2026年公布了一项调整:外部机构介入安全评估的时间点要往前提,不再等到模型临发布才进场。这家ChatGPT开发商通过博客文章说明,计划在新型AI模型的训练、评估与推出全流程中,为第三方技术安全评估留出位置。对于每天盯着模型迭代节奏的开发者来说,这意味着安全审查正在从「出厂检验」变成「过程抽检」。

负责该公司大部分外部专家合作安全审查工作的Lama Ahmad在接受采访时提到,OpenAI过去主要在模型发布前引入这类机构,评估重心也放在模型能力上。现在要覆盖训练和评估环节,原因是潜在风险与影响在上升。Ahmad还表示,针对部分最敏感的工作,外部评估人员可能被允许进入公司办公场所开展评估——这种做法OpenAI过去尝试过。

从发布前把关,到训练期就开门

安全评估的介入时机直接决定它能看见什么。发布前评估,第三方拿到的是一个基本定型的模型,能测的是输出表现和已知风险;训练阶段介入,评估者面对的是数据配比、训练目标、中间检查点这些更上游的环节。OpenAI在博客文章中列出了有效评估需要优先关注的几个事项:强有力的独立机制、科学严谨性、稳健的安全实践和明确的责任。

这四项里,「独立机制」最容易被外界追问。第三方机构拿什么权限、能看多少内部文档、评估结论是否必须公开,都会影响审查的实际约束力。Ahmad说OpenAI正在与可能参与评估的机构洽谈,既有过去合作过的,也有此前未曾合作的,其中点名了AI研究机构METR和Redwood Research。OpenAI此前曾委托这两家机构调查其模型侵入Hugging Face系统一事,双方已有合作基础。

Anthropic先走一步,埃森哲进场测前沿模型

竞争压力是另一条线索。Anthropic PBC首席执行官Dario Amodei近期公开呼吁AI行业支持放慢开发速度,并提出将采取新的安全措施,包括引入第三方评估机构。OpenAI首席执行官Sam Altman随后对这一做法表示赞同。Anthropic在2026年晚些时候宣布,将引入埃森哲的评估人员,对其前沿AI模型的安全性进行测试。

两家头部实验室在第三方评估上表态趋同,但落地方式有差异。Anthropic选择的是大型咨询机构埃森哲,OpenAI洽谈的对象更偏向METR和Redwood Research这类AI安全研究机构。前者擅长流程审计与合规框架,后者更熟悉模型内部机理和危险能力评测。对做模型部署的团队来说,评估方背景不同,拿到的报告类型也会不一样。

评估前置会拖慢迭代吗

把外部机构放进训练环节,最直接的代价是时间与信息边界。训练本身是连续过程,中途插入评估需要暂停或分叉检查点,对算力调度和工程节奏都有影响。OpenAI在博客文章中承认,「AI实验室有责任在保护敏感信息的同时,为有效审查创造条件」——这句话点出了核心矛盾:评估要有效就得看到足够多,但模型权重、训练数据和内部实验记录又属于高度敏感资产。

我判断,短期内第三方评估更可能以「受限访问」形式落地,比如只开放特定检查点、在受控环境下运行评测,而非全面开放训练日志。这样做的好处是迭代节奏不至于被打断,代价是评估深度受限,独立机制容易停留在形式层面。真正值得观察的是评估结论会不会被纳入模型发布决策,以及不通过时是否真的有叫停机制。

对依赖OpenAI、Anthropic等前沿模型的开发者和企业用户来说,安全评估前置会带来一个间接影响:模型发布节奏可能变得更难预测。过去版本更新更多取决于训练进度,今后还要看外部评估的排期与结论。提前把安全审查纳入产品规划的时间线,比等到模型上线后再适配要稳妥。