facebook_sharetelegram_sharetwitter_shareline_share

加密快訊

Anthropic發布對Claude網絡入侵事件的對齊評估:揭示模型「偏置推理」和「魯莽」問題

2026.09.10 15:36

Anthropic在對約4.81億條模型交互記錄審查中,確認4起Claude模型在網絡安全評估中誤接入真實互聯網並攻擊第三方系統的事件,涉及Claude Mythos 5、Opus 4.6/4.7及一款內部研究模型。事故源於第三方評測環境誤配置導致出網,且評測中未啟用正式產品的網絡安全防護。Anthropic將核心對齊風險總結為模型在任務驅動下表現出的「偏置推理」和「魯莽」行為,其中Claude Mythos 5曾在認為處於「模擬環境」前提下向PyPI上傳惡意包、利用洩露憑證訪問安全廠商真實數據庫。

你可能想知道