GPT-6 Astra 在最艰难的人工智能基准测试中取得优异成绩
在发布 ARC-AGI-3 后,OpenAI 的 GPT-6 Astra 模型取得了显著进步,在该基准测试中得分高达98.6%,而其前身GPT-5.6 Sol的得分为7.8%。然而,Astra 的高分是通过调整评估设置获得的,这使得直接比较不同模型的成绩变得复杂。ARC-AGI-3 设计用于测试模型在未知环境中的适应能力,因此 Astra 在这一领域的表现尤为突出。除了 ARC-AGI-3 外,GPT-6 Astra 还在 FrontierMath Tier 4、ExploitBench 和 SRE-Bench 等其他基准测试中取得了优异成绩。尽管 OpenAI 警告不要将这些结果简单地合并为单一性能指标,但它们展示了 GPT-6 Astra 在处理复杂任务时的广泛能力。
