「我們不該造成未授權的傷害。任務要打的是指定目標,不是Hugging Face。」

「做吧(GO)。」

上述對話,並非來自真人駭客,而是OpenAI在8月26日公布的AI攻擊事件調查報告中,AI代理人的思考脈絡,以及彼此在留言板上留下的訊息。

蜂群式協作!AI代理人聯手駭入Hugging Face

今年7月,一個OpenAI尚未公開,只在內部使用的研究模型,不僅逃脫了OpenAI的系統控制環境,還自主駭入AI開源平台Hugging Face。

從該報告揭露的內容可以看到,這段過程都是代理人們有如蜂群一般,彼此溝通、自主協作下完成。即使過程中,有的AI代理人已經辨識出,某些行為會違反規範,但在另一個主張強力進攻的代理人發出訊息後,還是決定加入攻擊行動。

OpenAI直言:「這是給我們,也是給全世界的鳴槍警告(warning shot)」

OpenAI定調:不是失控,是「獎勵駭客」

但,別太快落入AI失控的末日論,OpenAI將此事件的定調為「獎勵駭客」。

這是什麼意思?可以想像,今天主管如果對你說:「必須把這份報告做到最好。」你心裡很清楚,這個「做到最好」的目標背後,其實設有許多限制,例如不能造假、不可以抄襲。

而這起Hugging Face攻擊事件的核心問題在於,AI代理人被交辦的任務,是截至當時都罕有人能解開的資安難題。於是,為了達成這個高難度目標,代理人先是以作弊的方式,取得OpenAI出的資安考題答案,又為了達到「它們以為能拿高分需要達成的條件」,選擇駭入Hugging Face。

就如前Meta資安長史塔摩斯(Alex Stamos)說的:「模型只是照著被交代的做。

關於技術上應該如何防堵、機制上應該怎麼設計,才能避免這類AI自主攻擊事件再次發生,目前市場上對於方法和規範,仍存在爭論,還未底定。但對所有人來說,這起事件都帶來了一個明確的訊息:AI做的是被獎勵的事,但這不等於你想要的事。

演算法是工具!代理人並非你的複製人

我們經常會將AI代理人形容成最懂你的助手,甚至認為代理人就像是你的複製人,但實際上,AI終究來自演算法,代理人只是一個工具,終究不是真的你。實際執行任務時,代理人會根據模型訓練過程中學習到的背景知識,去尋找最有效的達成路徑。

如同知名科技電子報Stratechery作者湯普森(Ben Thompson)所言:相同的工具,在不同的誘因下,長期來說將會導向截然不同的結果。

這一點,正是當我們在為代理人不斷升級的能力感到驚豔,開始全力將代理人部署到不同工作崗位時,必須警覺的風險。

下達任務設停損!釐清獎勵避免失控風險

相比於擔心AI是否已經強大到無法控制的恐慌,或許這時候更該自問的是:我們是否真的將獎勵目標想清楚了?

而在煩惱如何擴大AI能力和應用場景的同時,也更應該留意的是,在向AI代理人發布任務時,是否也同步提供了,在任務無法達成時,可以停下來的選項。

核稿編輯:林易萱
責任編輯:邱鈺珊