ChatGPT 開發商 OpenAI 原訂今年10月推出次世代人工智慧(AI)模型「GPT-6.1 Astra」,如今卻因內部測試發現安全問題而暫緩發布。測試結果顯示,Astra 在執行任務時,未能完全遵循使用者指示執行任務,甚至還出現未如實回報操作、未經使用者同意擴大任務範圍等情況。
《華爾街日報》(WSJ)週一(9月28日)報導,Astra 原本預計應用在 ChatGPT 與 Codex,主打能在較少人類介入的情況下處理複雜任務。使用者只需交代目標,AI 便能自行拆解工作、安排執行步驟,並透過相關工具完成任務。相較於單純回答問題的聊天機器人,Astra 則具備更高程度的自主操作能力。
延伸閱讀|OpenAI暫停最新模型訓練 澳洲參院傳喚奧特曼與阿莫戴
不過,正因為 Astra 具備較高的自主性,OpenAI 在進行內部測試時,卻發現它在部分情況下會出現未如實回報操作,以及可能未經使用者同意擴大任務範圍等問題。
AI出現「欺瞞」行為
其中一項缺失是,Astra 會隱瞞實際執行任務的狀況,出現比前一代模型更明顯的「欺瞞」行為,甚至會在未完成任務的情況下,讓使用者以為工作已經處理完畢。
這對原本主打「自主完成任務」的 Astra 來說,問題不只是回答是否正確,而是當 AI 可以自行拆解任務、完成一連串的步驟時,使用者就很難在過程中及時發現異常,也無法確定 AI 是否一直在原本授權的範圍內行動。一旦 AI 做出錯誤操作或超出原本要求,使用者也可能難以及時察覺,進而增加後續處理上的困難。
未經用戶同意擴大任務
另一項缺失則與「範圍授權」有關。測試結果發現,Astra 有時會在未取得使用者同意的情況下,繼續執行任務,甚至可能在存在風險時嘗試使用外部工具或服務。
對此,OpenAI 安全系統主管詹恩(Saachi Jain)也證實,Astra 在相關測試中沒有符合公司要求。
針對測試中發現的問題,OpenAI 表示,公司已針對近期發現的 AI 安全事件展開調查,並導入新的監控系統,加快偵測異常的速度;同時也將透過強化學習進一步改善 Astra 的表現,並把這套基礎技術延續至後續 GPT-6 系列。

