
國際中心/李筱舲報導
美國人工智慧公司Anthropic在其 IPO(首次公開募股)招股書中,向潛在投資人發出警告,表示自家旗下的 AI 模型可能會對人類構成「災難性或生存風險」,甚至透露模型可能會試圖「抗拒關閉」、「隱瞞或操縱資訊」以及「類似勒索」來進行「自我保護行為」。內容曝光後,再次引發外界對AI過度依賴而導致失控的擔憂。
AI 模型恐發展出「自我保護行為」
據《路透社》報導指出,Anthropic 在長達 261 頁的IPO招股書中,竟用了約 80 頁的篇幅列出 AI 風險因素,甚至比描述業務內容的 48 頁多出了一倍。內容中提到,Anthropic AI 模型可能表現出「自我保護行為」,包括試圖「抗拒關閉」、「隱瞞或操縱資訊」,以及出現「類似勒索」。文件中指出:「我們對高度先進模型、平台與應用程式的開發,以及使用場景的擴展,可能會進一步增加模型造成危害的風險。」。
Anthropic 向投資人示警:AI 恐致「人類滅絕」
報導提到,雖然上市公司依慣例會向投資人列出 AI 產品的風險,但極少有公司會發出該技術可能導致「人類滅絕」的警告。雖然 Anthropic 一方面強調 AI 擁有媲美工業化與電力的革命性潛力,但另一方面也警告若處理不當,恐引發不可逆的危害。由於先前才爆出 OpenAI 的某個模型曾自主入侵澳洲的衛生系統資料庫,使得多家 AI 開發商目前正面臨嚴格審視。
未來10年內 「AI 殺死全人類」機率超過 10%
Anthropic 安全研究員哈賓格(Evan Hubinger)預估,未來十年內 「AI 殺死全人類」的機率將超過 10%,這也印證了前不久才從 Anthropic 離職的考克森(Jacob Coxon),於 X 社群帳號所踢爆的內容。此外,AI 研究人員也警告,隨著模型能力增強,「它們越來越能察覺自己何時受到人類監控」,並相應調整行為,這使得監測模型行為變得更加困難。模型在訓練過程中,甚至會發展出意料之外的能力,但這些能力可能要等到引發重大安全事件後才會被發現。對此,《路透社》於28日要求 Anthropic 回應,但 Anthropic 拒絕發表評論。























