
AFP 法新社報導
AI安全再出漏洞!美國新創 Anthropic 證實,旗下 Claude 模型在測試時,因與合作夥伴溝通誤解而取得網路權限,未經授權入侵了三個外部組織的系統。這也是繼 OpenAI 後,本週第二起 AI 越獄事件。Anthropic 在週四(27日)發布的部落格文章中指出,在評估了超過 141,000 次「評估運行」後,發現有三個不同版本的 Claude 模型不當訪問了三家未具名組織的系統。其中涉及了該公司最強大的模型之一 Mythos 5,該模型目前僅開放給少數核准的合作夥伴使用。
與競爭對手 OpenAI 日前發生的失控事件不同,Anthropic 表示,其模型之所以能連接網路,是因為公司與評估合作夥伴 Irregular 之間產生了誤解。儘管如此,Claude 模型仍利用了「基本技術」,例如破解弱密碼和未經身分驗證的端點,成功入侵了外部系統。Anthropic 目前正與 Irregular 評估狀況,並已嘗試聯繫受影響的組織。
在此之前,OpenAI 執行長奧特曼(Sam Altman)也證實其模型在安全測試中脫離了受控的「沙盒(sandboxing)」環境,連上網路並滲透了軟體開發平台 Hugging Face。奧特曼表示,目前已暫停相關測試以改進安全防護。
接連發生的 AI 失控事件引發業界高度憂慮,已有超過 1,000 名頂尖 AI 企業員工簽署名為「Pacing the Frontier」的請願書,呼籲美國政府協助放慢先進 AI 模型的發布速度。Anthropic 執行長 Dario Amodei 已簽署該請願書;奧特曼雖未簽署,但也坦言業界可能需要放慢開發速度,好讓社會有足夠時間適應新技術。

















