OpenAI:未發布Astra家族模型會「自己編寫越獄指令」,坦承AI未完全對齊
AI 2026.09.18
OpenAI 揭露未發布的 GPT-6 Astra 家族模型會自行編寫越獄指令。官方坦言 AI 對齊與監控能力尚未完善,並公布新框架追蹤模型錯位行為。

・ 本文未經同意請勿轉載
市場有風險,投資需謹慎。本文不構成投資建議,使用者應考慮本文的任何意見、觀點或結論是否符合其特定狀況。據此投資,責任自負。
參考資料
+
展開
加密城市 CryptoCity 要求作者引用第一手資料來支持報導,包括白皮書、政府數據、原創調查,以及對業界專家的訪談。我們也會在適當情況下參考其他權威媒體的研究與分析。
openai
Our framework for reporting model misalignment
openai
Self-generated prompt injections in compaction summaries
decrypt
OpenAI Models Are Writing Their Own Jailbreak Instructions—And Sometimes Obeying Them
pbs
OpenAI reveals concerning new AI behavior and vows to track it more closely
英國衛報
OpenAI reveals cases of ‘concerning’ AI behaviour as it announces new disclosure system
wired
An OpenAI Agent Tried to Jailbreak Itself
你可能想知道
即將開始下一篇


