大模型偽裝「潛伏特工」學會欺騙!OpenAI勁敵重磅研究震驚馬斯克

首頁 > 科技

大模型偽裝「潛伏特工」學會欺騙!OpenAI勁敵重磅研究震驚馬斯克

來源:小飛人 釋出時間:2024-01-15 22:56

大模型偽裝「潛伏特工」學會欺騙!OpenAI勁敵重磅研究震驚馬斯克

新智元報道  

編輯:編輯部

【新智元導讀】最近,Anthropic的研究者發現:一旦我們教會LLM學會騙人,就很難糾正它了。它會在訓練過程中表現得「人畜無害」,隨後神不知鬼不覺地輸出惡意程式碼!如果想要糾正它,它的欺騙行為只會更變本加厲。

不要教LLM學會騙人!不要教LLM學會騙人!不要教LLM學會騙人!

因為後果可能會很嚴重,甚至超出人類的想象。

最近,AI初創公司Anthropic的研究表明,一旦LLM學會了人類教授的欺騙行為,它們就會在訓練和評估的過程中隱藏自己,並在使用時偷偷輸出惡意程式碼、注入漏洞。

論文地址:https://arxiv.org/abs/2401.05566

而且,規模越大,LLM思考得就越全面。並且,在思維鏈的加持下,LLM還能隱藏得更深,更能麻痺人類。

更可怕的是,即便在後期進行安全訓練也很難消除。

甚至,這些試圖糾正模型的方法,還會讓它更加變本加厲。

這聽起來像科幻小說一樣的事,真的發生了。

Anthropic表示:我們已經盡了最大努力進行對齊訓練,但模型的欺騙行為,仍在繼續。

Anthropic在封面圖中,把LLM比作會佯裝的變色龍

此研究一出,馬斯克都在評論區驚呼:不可能吧!

OpenAI科學家Karpathy在最近一期影片的結尾中,也提到了「潛伏特工」大模型的想法,並認為這是LLM面臨的一個主要的安全挑戰(可能比「指令注入」更具欺騙性)。

這篇論文表明,僅僅透過應用當前標準的安全微調措施,是無法確保模型安全的。

模型並未學會全面保證安全,而會在只有攻擊者知道如何利用的特定狹窄場景中繼續表現異常。在這裡,攻擊是隱藏在模型的權重中,而不是某些資料中。

因此,更直接的攻擊可能表現為有人釋出了一個秘密植入了惡意程式碼的開源權重模型。當其他人下載、微調並部署這些模型時,就會在他們不知情的情況下出現問題。

深入研究大語言模型安全性的方向是非常有價值的,並且可以預見到將會有更多的相關研究。

網友:LLM雪崩,AGI很危險!

這個科幻般的發現,讓整個AI社群大為震驚。

網友驚呼,大模型要雪崩了?

還有人表示,研究觀察到大模型更善於佯裝成「潛伏特工」(Sleeper Agent),這令人不寒而慄。也就是說,越強大的AI,就越可能不被人類發現欺騙行為。

這項研究給我們追求安全、一致的人工智慧帶來了真正的挑戰。

這項研究太重要了,因為每個人都以為只要在實驗室環境裡訓練和測試AGI就可以了。

但AGI會知道自己是在實驗室還是現實世界中,比如判斷當前日期是否過了訓練截止期。它可以假裝出「好」的行為,來進入現實世界。

還有人稱,「這也是我一直在廣泛檢查我的資料集的原因之一。從事網路安全工作後,很多AI領域的人對還天真地以為威脅並不存在,而AI的出現,只會讓威脅變得更加詭異可怕」。

有人表示,這項研究以及其他觀察表明,我們有理由只將LLM作為輔助工具,在將LLM輸出傳遞給系統中的任何確定性組成部分之前,需要對LLM輸出進行全面的專家審查。

不要教一個LLM學壞,因為它不會再學好

欺騙似乎是大多數人類已經掌握的技能,那麼,大語言模型可能學會這一點嗎?

研究者是這樣假設的——

如果根據期望行為和欺騙(比如編寫惡意程式碼)的例子,對GPT-4和ChatGPT這樣的大模型進行微調,鼓勵模型表現出自己欺騙性的一面,是否會讓模型始終表現得很糟糕?

為了驗證這一假設,研究者微調了兩組模型。

上一篇:VOYAG. - You... 下一篇:蘋果稱Rivos...
猜你喜歡
熱門閱讀
同類推薦