当地时间9月2日,OpenAI首席科学家雅库布帕乔基在社交平台发文,就近日围绕新模型Astra“不可监控”的争议作出回应。
这场争议源于此前一天,有消息称OpenAI即将发布的Astra模型采用了一种名为循环深度的推理技术。相关消息披露后,AI安全界反应强烈。他结合此前OpenAI模型攻击HuggingFace社区事件表示,不确定Astra思维链可监测性是否比之前的模型差很多,但如果进一步推进这项技术,大幅增加循环次数,将彻底破坏思维链的可监测性。OpenAI自首批推理模型一直致力于维护和利用思维链监控,并认为该技术有助于观察模型对齐能力如何从训练分布中泛化。OpenAI方面表示,将为Astra部署额外的思维链监控,以快速监测并遏制潜在的不当行为。
