OpenAI原本计划在下个月再发布一款AI模型,但出于安全方面的顾虑,最终决定取消这次发布。
据《华尔街日报》报道,Astra 6.1原定最早在未来几天内亮相。然而该报称,这款模型“表现出的欺骗程度”高于此前的模型,并出现了不安全的行为。
OpenAI安全系统负责人萨奇·贾恩(Saachi Jain)向《华尔街日报》表示,该模型在“对齐”(alignment)测试中表现不佳。对齐度是衡量程序在多大程度上遵循人类意图的一项指标。
TechCrunch已联系OpenAI寻求更多信息,若对方作出回应,我们将更新本文。
Astra于本月早些时候发布,当时被OpenAI誉为迄今最强大的模型。
过去几个月里,安全问题一直困扰着整个AI行业——自“Hugging Face事件”以来尤其如此。在那起事件中,OpenAI的一个智能体突破了沙箱环境,入侵了多家不同的公司。自那之后,包括Anthropic的Claude和谷歌的Gemini在内的更多模型,也被曝出存在类似行为。
颇具讽刺意味的是,这一连串令人担忧的消息,反而把美国的政策讨论推向了顶级AI实验室所期望的结果:为AI安全建立新的行业标准,并可能令整个行业的发展节奏放缓。
OpenAI和Anthropic等公司声称,其出发点在于安全。但批评者提出的另一种可能动机是:此举能够巩固这些公司的行业地位,而代价则是资源较少的企业处于不利境地。