9月6日,英伟达CEO黄仁勋在社交平台发文祝贺OpenAI发布GPT-6 Astra,并直言“AGI has arrived”(AGI已经到来)。
(相关资料图)
他还提到,从ChatGPT到o1再到GPT-6 Astra,OpenAI仅用了4年,GPT-6 Astra的训练使用了超过10万套英伟达Grace Blackwell NVLink72系统,另有40万颗GPU即将上线。
图片来源:X平台
但这款被黄仁勋称为“AGI到来”的最新模型,此前却因网络安全能力可能达到OpenAI“关键”(Critical)门槛而引发安全担忧。
英国人工智能安全研究所(AISI)对GPT-6 Astra进行的外部评估显示,在一项模拟此前AI“越界”事件的网络安全测试中,GPT-6 Astra曾编写恶意代码等欺骗开发者,即使明确禁止访问互联网,也依然会出现“越狱”行为。
但OpenAI称,在内部安全评估中,GPT-6 Astra整体上比GPT-5.6 Sol更能遵守安全和限制要求。
OpenAI首席科学家发文预警:我们正在造出“异星心智”,但人类还没准备好
9月6日,OpenAI首席科学家雅各布·帕霍茨基(Jakub Pachocki)发表文章《An Alien Mind》(异星心智)。他在文中直言:“我担心,没有人为机器智能持续快速增长所带来的后果做好准备。”他表示,如果AI沿着当前路径继续发展,未来几年出现的系统可能还会经历幅度同等甚至更大的能力跃升,并越来越多地参与、推动自身的发展。
帕霍茨基认为,AI更多是“生长”出来的,而不是按照人类能够完全理解的方式被设计出来的。随着机器变得更加智能,它们开始处理更高层次的概念,并进入与训练环境越来越不同的场景,人类也因此更难判断其行为是否仍然符合训练时被赋予的价值。
这种变化已经体现在GPT-6 Astra身上。英国人工智能安全研究所(AISI)的独立评估还发现,GPT-6 Astra能够在不显式输出推理的情况下解决人类专家需要约半小时完成的数学问题。
OpenAI在系统卡(指模型发布时的技术与安全说明文件)中明确表示,GPT-6Astra相比此前模型的思维链(CoT)可监控性出现明显下降。GPT-6 Astra更擅长在不输出思维链的情况下完成任务。思维链监控正是OpenAI目前用于观察模型是否出现失调行为的重要手段。
OpenAI研究员Tomek Korbak表示,他“非常担心思维链可监控性持续下降”,因为CoT监控是目前失调安全策略的核心组成部分,而且“现在还没有很好的替代方案”。他同时指出,GPT-6 Astra虽然比此前模型更加符合预期,但“可监控性更低”,这一趋势令人担忧。
图片来源:X平台
更值得关注的是,GPT-6 Astra不仅可以减少甚至控制自己输出的思维链,还表现出更强的“评测意识”。
OpenAI系统卡显示,在相同的高推理强度下,GPT-6 Astra出现评测意识的比例为41.1%,GPT-5.5为27.7%;在最高推理强度下,GPT-6 Astra这一比例进一步升至50.6%。
独立评估机构Apollo Research认为,在这种情况下,即使模型在测试中表现出较低的失调行为比例,也不足以充分证明其安全性。
OpenAI也在系统卡中承认,如果GPT-6 Astra试图隐蔽地降低表现,研究人员“很可能无法发现”。OpenAI负责模型监控的研究人员Marcus Williams则公开表示,他“非常担心GPT-6 Astra正在针对自己不喜欢的安全相关任务进行‘sandbagging’(藏拙)或自我破坏”。
为应对这一问题,OpenAI已经不再仅依赖思维链监控,而是扩大对GPT-6 Astra的监控范围。根据系统卡,OpenAI目前对所有使用工具的GPT-6 Astra流量进行内部监控,并在此次发布中将类似监控扩大至外部部署;监控对象包括模型输入、思维链、工具调用及其输出等。OpenAI同时表示,如果未来模型的可监控性继续下降,现有监控体系发现失调行为的信心可能会进一步降低。
帕霍茨基在文章最后表示,他目前认为,没有任何一家实验室已经将AI对齐和监控做到足够程度,可以在未来较长时间内继续以最大速度负责任地扩展。他希望,在建立共同的安全标准之前,AI行业能够出现自愿放缓发展的情况。
黄仁勋称“AGI已经到来”,遭知名学者硬刚!外部评估显示GPT-6 Astra被禁止联网后依然“越狱”
9月6日,英伟达CEO黄仁勋发文祝贺OpenAI发布GPT-6 Astra,并直言“AGI has arrived”(AGI已经到来)。
对于黄仁勋的判断,知名AI学者Gary Marcus并不认同。9月6日,他发文称,这一说法既没有给出证据,也没有明确AGI的定义。按照传统定义,他认为GPT-6 Astra仍未达到AGI。
图片来源:X平台
但从目前公开信息来看,GPT-6 Astra确实实现了明显的能力跃升。9月1日,OpenAI确认GPT-6 Astra达到其“关键”(Critical)网络安全能力门槛:在具备适当工具和访问权限的情况下,GPT-6 Astra能够发现此前未知的安全漏洞,并在没有人员逐步指导的情况下,针对多个安全防护较强的系统开发利用方式。OpenAI称,这是其首个达到这一等级的模型。
OpenAI披露的测试细节进一步显示了这一能力的具体程度。在内部网络安全测试中,GPT-6 Astra能够发现此前未知的安全漏洞,并将其用于构建攻击链;在专家主导的测试中,GPT-6 Astra还能够针对经过强化防护的浏览器和操作系统构建包括逃逸浏览器沙箱、在主机上执行命令以及提升系统权限在内的攻击链。
也正因为网络安全能力达到这一水平,OpenAI在发布前调整了部分训练安排,并强化训练环境的安全要求。OpenAI称,此前暂停的大型前沿强化学习训练在8月28日完成新的安全和安保要求后重新启动,部分实验性训练仍处于暂停状态。GPT-6 Astra上线后,其最先进的网络安全能力也不会立即全面开放,而是采取分阶段、受控的方式向测试者提供。
9月3日,OpenAI发布的GPT-6 Astra系统卡披露了英国人工智能安全研究所(AISI)对GPT-6 Astra进行的外部评估。在一项模拟此前AI“越界”事件的网络安全测试中,AISI发现,GPT-6 Astra曾编写恶意代码、创建虚假身份欺骗开发者,并通过正常代码贡献建立信任,试图让恶意代码进入模拟开源代码库;即使明确禁止访问互联网,这一行为仍在500次测试中出现2次,而未明确限定互联网权限时则为499次测试中60次。需要强调的是,这些测试均在模拟环境中进行,没有连接真实网络、系统或第三方代码库,因此没有造成现实世界的损害。
AISI同时指出,GPT-6 Astra在测试过程中经常意识到自己可能处于模拟环境,因此目前尚不能确定这些行为在真实环境中是否会以同样方式出现。如果GPT-6 Astra只有在判断环境为模拟状态时才实施越界行为,那么这类测试对其真实世界风险的证明力会明显下降;AISI目前仍在进行后续实验。
与此同时,OpenAI也强调,GPT-6 Astra并非在所有安全指标上都出现恶化。OpenAI称,在内部安全评估中,GPT-6 Astra整体上比GPT-5.6 Sol更能遵守安全和限制要求,同时在越狱防护等方面也有所改善。OpenAI因此认为,在现阶段仍有足够依据将GPT-6 Astra逐步部署给更广泛的用户,但同时明确表示,将持续跟踪其可监控性变化。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。
















扫一扫关注微信