內部人擔憂“威脅人類生存”!OpenAI重大突破“Q*演算法”是什麼

首頁 > 科技

內部人擔憂“威脅人類生存”!OpenAI重大突破“Q*演算法”是什麼

來源:喬治葫蘆娃 釋出時間:2023-11-24 15:12

內部人擔憂“威脅人類生存”!OpenAI重大突破“Q*演算法”是什麼

跟著OpenAI CEO奧特曼迴歸,宮斗大戲告一段落,但仍留下了很多未接的謎題。其中最為樞紐的,就是當初奧特曼為何會被董事會解僱。

昨日,有媒體透露,就在奧特曼被開除四天前,幾名研究職員向董事會發出了一封信,警告一項強盛的AI發現(Q*)可能威脅全人類。此外,OpenAI CTO Mira Murati此前在致員工的內部信件中提到了一個代號為“Q*”的專案。據她稱,該專案為"董事會對奧特曼的一系列不滿中的因素之一"。

據多家媒體預測,Q*讓OpenAI實現AGI的步伐大大提速,但奧特曼可能沒有和董事會具體表露Q*的進展到底有多大,這也符合董事會在解僱奧特曼時所說的“在與董事會溝通時沒有始終保持坦誠”。

就在被解僱之前,奧特曼還在公然流動中表示:

“在OpenAI的歷史上,我們已經取得了4次突破,最近一次是在過去的幾周裡。當我們把無知的面紗撕下,把發現的前沿向前推進時,我就在房間裡。”

所謂的第四次突破,指的可能就是Q*專案。

什麼是 Q*?

什麼是Q*?

Q*讀作Q star,目前OpenAI內部沒有任何關於Q*的詳細資訊流出。

據一些業內人士預測,它可能是是機器學習演算法Q-Learning(Q學習)的同義詞,也許是OpenAI藉助Q學習演算法打造的新模型的代號,也許是一個相關的專案名稱。

科技部落格PC Guide指出,OpenAI使用的Q*指的大概是貝爾曼方程中的最優值函式,Q*可能代表OpenAI找到或接近了效率最佳化演算法的最優解。

根據天風證券分析師孔蓉的說法:

Q學習是一種基於強化學習的演算法,用來在馬爾科夫決議計劃過程中求解最優控制題目。它的目標是透過學習最優策略,使智慧體在未知環境中做出最佳選擇。

Q學習依據貝爾曼方程更新狀態-動作對應的Q值,迫臨最優值函式。智慧體透過與環境互動,觀察到新的狀態和獎勵,來更新執行各個動作的Q值。

所謂貝爾曼方程,也被稱為動態規劃方程,是指數學家理查德·貝爾曼提出的用於解決複雜多階段題目的公式,透過求解該方程可以找到最優值函式和最優策略。

執行演算法的人(或計算機)可以輸入一個目標函式,例如“旅行時間最短、本錢最低、利潤最大、效用最大”等。然後,演算法將決定採取何種最佳步履來實現預期結果。

簡樸來說,Q學習可以透過探索所有可能的路徑,學習到通往預期獎勵的最短路徑(最短路線),透過試錯找到更最佳化的路徑,並跟著時間的推移達到最佳化狀態,每次都做出更好的決議計劃。

據媒體報道,在奧特曼被解僱之前,OpenAI在內部對Q*進行了演示,顯示Q*能夠解決小學程度的數學題目。

固然完成小學數學題聽起來沒什麼精彩之處,但需要誇大的是,包括GPT-4在內,世界上最進步前輩的大語言模型通常都更擅長基於語言的任務,即使面對加減乘除這樣的基礎數學都會犯錯誤。

假如真如報道所說,Q*有能力處理數學題目並給出明確謎底,即使只是小學數學,那也意味著巨大的奔騰。基礎數學能力或意味著與人類智慧相媲美的推理能力,也意味著OpenAI朝著其設定的AGI目標邁出了一大步。

另外據一些網友預測,Q*背後的模型模型可能已經具備自主學習和自我改進的能力,或者能夠透過評估其行為的長期後果,在廣泛的場景中做出複雜的決議計劃,可能已具備稍微自我意識。

最樂觀、或者最可怕的假設就是,OpenAI已經完成了打造AGI的基礎工作。

聽起來很離譜,但確實有可能是真的。

就在一個月前,華爾街見聞曾轉載過MIT科技評論對OpenAI首席科學家Ilya Sutskever的專訪,他當時稱,ChatGPT可能已經有了意識

Q*會產生哪些後續影響?毀滅人類?

目前,OpenAI所給出的官方回應是,奧特曼被解僱,與公司的研究進展無關。

但仍舊擋不住網友天馬行空的猜想和陰謀論。

一位Reddit網友說,對於AI界而言,Q*的泛起可能就像是,一個人想敲石頭生火,敲了幾年都沒什麼成果,結果上星期石頭忽然敲出火星了。

另一位Reddit網友已經開始想象AGI誕生之後的場景了:

AI開始發明東西,破解網際網路上的一切加密,寫出以人類的數學能力理解不了的程式...

不外,理性地想,AGI的誕生大機率不會這麼快。Q*可能只是人類以後漫長探索征程的開始。

根據天風證券分析師孔蓉的觀察,OpenAI近期的招聘程序表明其在進一步增強強化學習系統的決議計劃能力。

OpenAI近期持續引入強化學習和決議計劃演算法研究職員。23年7月份新引進的研究員Noam Brown,開展多步推理和多智慧體互動方面的研究。

Noam Brown 此前介入發表的工作將語言模型與規劃和強化學習演算法結合,大幅晉升了AI在複雜策略遊戲中的表現,開發出第一批在德撲無上限遊戲中擊敗頂級玩家的AI。

OpenAI 近期於 5 月份釋出的研究也表明,調整練習方式和引入更大規模的監視資料,將會明顯晉升強化學習系統的數學推理能力。OpenAI 引入針對過程的強化學習監視,進一步晉升大模型在資料推理與計算的準確性。

據孔融推測,強化學習與決議計劃演算法提高或帶來Q*大模型能力突破,GPT4 + 強化學習和決議計劃演算法,或能實現更強的AI Agent能力。

內部人擔憂“威脅人類生存”!OpenAI重大突破“Q*演算法”是什麼

跟著OpenAI CEO奧特曼迴歸,宮斗大戲告一段落,但仍留下了很多未接的謎題。其中最為樞紐的,就是當初奧特曼為何會被董事會解僱。

昨日,有媒體透露,就在奧特曼被開除四天前,幾名研究職員向董事會發出了一封信,警告一項強盛的AI發現(Q*)可能威脅全人類。此外,OpenAI CTO Mira Murati此前在致員工的內部信件中提到了一個代號為“Q*”的專案。據她稱,該專案為"董事會對奧特曼的一系列不滿中的因素之一"。

據多家媒體預測,Q*讓OpenAI實現AGI的步伐大大提速,但奧特曼可能沒有和董事會具體表露Q*的進展到底有多大,這也符合董事會在解僱奧特曼時所說的“在與董事會溝通時沒有始終保持坦誠”。

就在被解僱之前,奧特曼還在公然流動中表示:

“在OpenAI的歷史上,我們已經取得了4次突破,最近一次是在過去的幾周裡。當我們把無知的面紗撕下,把發現的前沿向前推進時,我就在房間裡。”

所謂的第四次突破,指的可能就是Q*專案。

什麼是 Q*?

什麼是Q*?

Q*讀作Q star,目前OpenAI內部沒有任何關於Q*的詳細資訊流出。

據一些業內人士預測,它可能是是機器學習演算法Q-Learning(Q學習)的同義詞,也許是OpenAI藉助Q學習演算法打造的新模型的代號,也許是一個相關的專案名稱。

科技部落格PC Guide指出,OpenAI使用的Q*指的大概是貝爾曼方程中的最優值函式,Q*可能代表OpenAI找到或接近了效率最佳化演算法的最優解。

根據天風證券分析師孔蓉的說法:

Q學習是一種基於強化學習的演算法,用來在馬爾科夫決議計劃過程中求解最優控制題目。它的目標是透過學習最優策略,使智慧體在未知環境中做出最佳選擇。

Q學習依據貝爾曼方程更新狀態-動作對應的Q值,迫臨最優值函式。智慧體透過與環境互動,觀察到新的狀態和獎勵,來更新執行各個動作的Q值。

所謂貝爾曼方程,也被稱為動態規劃方程,是指數學家理查德·貝爾曼提出的用於解決複雜多階段題目的公式,透過求解該方程可以找到最優值函式和最優策略。

執行演算法的人(或計算機)可以輸入一個目標函式,例如“旅行時間最短、本錢最低、利潤最大、效用最大”等。然後,演算法將決定採取何種最佳步履來實現預期結果。

簡樸來說,Q學習可以透過探索所有可能的路徑,學習到通往預期獎勵的最短路徑(最短路線),透過試錯找到更最佳化的路徑,並跟著時間的推移達到最佳化狀態,每次都做出更好的決議計劃。

據媒體報道,在奧特曼被解僱之前,OpenAI在內部對Q*進行了演示,顯示Q*能夠解決小學程度的數學題目。

固然完成小學數學題聽起來沒什麼精彩之處,但需要誇大的是,包括GPT-4在內,世界上最進步前輩的大語言模型通常都更擅長基於語言的任務,即使面對加減乘除這樣的基礎數學都會犯錯誤。

假如真如報道所說,Q*有能力處理數學題目並給出明確謎底,即使只是小學數學,那也意味著巨大的奔騰。基礎數學能力或意味著與人類智慧相媲美的推理能力,也意味著OpenAI朝著其設定的AGI目標邁出了一大步。

另外據一些網友預測,Q*背後的模型模型可能已經具備自主學習和自我改進的能力,或者能夠透過評估其行為的長期後果,在廣泛的場景中做出複雜的決議計劃,可能已具備稍微自我意識。

最樂觀、或者最可怕的假設就是,OpenAI已經完成了打造AGI的基礎工作。

上一篇:62122602是哪... 下一篇:保定涿州企業...
猜你喜歡
熱門閱讀
同類推薦