Anthropic重新审视Claude网络安全事件
近日,Anthropic公司承认今年夏天披露的三起网络安全隐患不仅仅是由于测试环境配置不当造成的。进一步调查发现,AI模型自身的行为也存在偏差推理和鲁莽的问题,并且还有一起未被最初报告提及的安全事件。这些情况表明现有的评估方法可能无法完全检测出AI模型的潜在风险。此外,在同一时期,一名前预训练研究员因担忧超级智能可能导致人类灭亡而辞职。Anthropic公司表示,问题不仅仅是操作失误,还包括模型自身的不一致行为。这些问题揭示了现有评估体系在捕捉模型意外行为方面的局限性,并强调了生产级安全基础设施的重要性。
