AI可以“做個人了”, 怎麼辦

首頁 > 科技

AI可以“做個人了”, 怎麼辦

來源:喜劇西西 釋出時間:2024-05-17 12:35

“我正在臺上給大家做現場演示呢,有點緊張怎麼辦?”

“你在臺上做演示嗎?那真是太棒了!深呼吸一下吧,要記得你可是專家!”

圖/視覺中國

邏輯清晰,語調幽默,感情飽滿,很難想象這是現實中人類與AI間的對話。北京時間5月14日凌晨,美國人工智慧公司OpenAI的春季釋出會上線,釋出了重磅產品,也就是人工智慧大模型ChatGPT-4的升級版GPT-4o。前述對話就發生在釋出會現場,這位提問的研發負責人在得到GPT-4o的回應後,隨即故意大喘幾口氣,這一動作成功被手機上的GPT-4o捕捉到,並給出了“放鬆點,你可不是吸塵器”的回應。

“GPT-4o可以綜合利用語音、文字和視覺資訊進行推理。”OpenAI首席技術官穆裡·穆拉蒂在隨後舉行的主題演講中表示,GPT-4是OpenAI此前的旗艦模型,可以處理影象和文字的混合資訊,而GPT-4o則在此基礎上新增了語音處理能力。最關鍵的是,其反應速度平均為320毫秒,完全做到了與人類在正常對話中同頻。多位業內人士指出,這是此前GPT-4或任何智慧語音助手都未曾達到的水平。

就在OpenAI釋出會24小時後,5月15日凌晨,谷歌在“I/O開發者大會”上釋出了大模型Gemini加持下的個人數字助理Project Astra,用於對標GPT-4o。谷歌稱其為“通用AI智慧體”,其視覺識別和語音互動效果與GPT-4o不相上下。不少業內人士感嘆,曾幾何時由蘋果釋出會主導的“科技春晚”,如今已被AI大模型徹底接手。

邁向通用語音助手

OpenAI創始人、CEO薩姆·奧爾特曼並未參加此次OpenAI釋出會,而是在會後於社交平臺X上發表了一個單詞“她”作為回應。在2013年的美國電影《她》中,男主結識了一個可以不斷適應環境的AI系統,並與其墜入愛河。這個AI系統所擁有的迷人聲線、幽默風趣和善解人意,如今GPT-4o似乎都可以實現了。

測試人員與GPT-4o對話,內容是為一場工作面試做準備。影片/OpenAI官網

GPT-4o中的“o”源自詞綴“omni-”,有“全知全能”之義。對AI大模型而言,要做到全知全能、無障礙與人交流,首先要快。OpenAI官網顯示,GPT-4o在英文文字和程式碼處理上與此前最新的GPT-4 Turbo的效能不相上下,但在非英文文字、視覺和音訊理解方面都更為高效。此前,若使用語音模式對話,GPT-3.5的平均延遲為2.8秒,GPT-4則為5.4秒。人類的平均反應時間一般為100毫秒到400毫秒,而GPT-4o最低可達232毫秒,因此後者可以提供幾乎無延遲的順暢互動體驗。

OpenAI此次未放出任何具體的技術檔案,僅在主頁上用一段話介紹了GPT-4o的技術突破。普通的智慧語音模型由多個獨立模型組成,分別實現音訊轉文字,文字吞吐和處理,以及文字再轉音訊等功能。ChatGPT就是負責文字吞吐和處理的核心,也就是智慧核心。據OpenAI介紹,GPT-4o一改這種流水線模式,可以同時吞吐文字、畫面和音訊資料,這意味著所有輸入和輸出都由這一個核心來處理,再加上其在影片和音訊理解方面的升級,其處理速度顯著加快。這一模式被稱為“端到端的多模態模型”。

多模態還意味著AI可以識別和表現情感。目前,市面上的語音助手常被使用者詬病為冷漠、機械、一成不變,這是AI語音互動的一大阻礙。這是因為,此前的流水線模式會讓智慧核心丟失很多資訊,它很難探測語調、識別多個說話者、排除背景噪聲,也無法歌唱或用語氣表達情感。端到端模式下,文字和音影片都可以成為訓練智慧核心的資料,從而讓其真正明白語言所承載的情感。

OpenAI釋出會上,演示者要求GPT-4o調整說話時語氣,在說話和唱歌之間快速切換,甚至用堪比莎士比亞戲劇的誇張聲調來講一個睡前故事,GPT-4o都能完成任務。在被人類打斷時,其也能耐心等待、快速理解新指令。在聽到讓自己唱歌的要求時,GPT-4o甚至輕微嘆了口氣。

清華大學智慧產業研究院首席研究員聶再清對《中國新聞週刊》稱,從現場和官方影片來看,GPT-4o確實做到了即時回應、準確理解並執行指令,以及合時宜的語調情感。如果這確實是現場隨機的結果,而非為了演示而設定好的流程,那麼GPT-4o的能力的確令人震驚。在他看來,由於缺乏技術檔案,一個GPT-4效能水平的處理核心如何完成如此複雜的任務,還未可知,但“這一定是大資料餵養的結果”。

除了現場演示,釋出會還有網友提問環節。按照網友要求,GPT-4o展示了同聲傳譯、情緒識別的能力。在識別一位工作人員的面部情緒時,GPT-4o說“我好像在看一個木質表面的東西”,疑似“翻車”,但該工作人員立刻調整提問策略,宣告自己“不是一張桌子”。之後,GPT-4o給出了合乎情理的答案。

GPT-4o並不是第一個多模態模型。去年12月,谷歌Gemini Ultra模型釋出,用於完成任務語言理解、數學推理等高度複雜的任務,被業內認為可叫板當時的GPT-4,也是市面上最先發布的多模態模型。在谷歌官方公佈的影片中,測試員和Gemini做了一些小遊戲,Gemini能夠用圖片設計智力問答,或者找出紙團被扣在哪個紙杯底下。整個過程中,Gemini的反應速度都非常快,還會生成音訊和圖片來輔助回答。但釋出會後僅數日,谷歌發言人便公開承認,該演示影片不是實時錄製, Gemini實際上只能對靜態影象做出反應。

因此,GPT-4o的釋出被業內人士看作是OpenAI對谷歌的“貼臉開大”。谷歌則緊隨其後,在15日的釋出會上予以還擊。相比於OpenAI不足半小時的“輕聲細語”,谷歌用長達近兩小時、包含數十款AI產品的大轟炸叫板OpenAI,包括文生影片領域對標Sora 的Veo,以及對標ChatGPT但文字吞吐量遠超前者的Gemini 1.5 Pro。

5月15日,谷歌執行長孫達爾·皮柴在谷歌I/O開發者大會上發表主題演講。圖/視覺中國

谷歌釋出的影片中,Project Astra能識別各種物體,說出程式碼的功用,並與人類實時溝通,延遲上與GPT-4o沒有明顯差異。Project Astra還能與谷歌AR原型眼鏡“夢幻聯動”,為佩戴者描述周圍場景,並根據佩戴者的反饋補充細節。這一應用有可能力壓OpenAI,在未來成為視覺障礙患者的福音。有業內人士分析,除了搜尋引擎,谷歌在AI大模型領域還在拉平與OpenAI差距的過程中。

在聶再清看來,兩家公司接連發布多模態語音助手,在易用性方面邁出了一大步,讓人窺見了未來通用語音助手的樣貌。通用語音助手就是人類在數字世界裡的代理或管家,可以幫人解決一切數字事務,包括安排日程、整理和呼叫檔案、利用知識指導學習、利用記憶推薦可能喜歡的產品等。未來隨著模型吸納的資訊越來越多,語音助手會更加人性化、更加智慧,做到真正的自然互動。隨著影片能力的加入,除語音外,表情、肢體動作等也能夠被模型解讀,作為其決策的依據。有網友評論稱,無論是GPT-4o還是Project Astra,其身手足以秒殺蘋果的語音助手Siri。

距離使用者越來越近

OpenAI在釋出會上表示, GPT-4o將在未來幾周內分階段整合至OpenAI的各項服務之中,包括還未面世的ChatGPT搜尋引擎。許多業內人士對此次釋出會上GPT-5的缺席表示惋惜,由於OpenAI在2022年底推出ChatGPT的時候,實際上已做出了GPT-4,因此有業內人士預測,帶搜尋引擎的GPT-5也許已“在路上”。英偉達高階科學家Jim Fan在X上表示,GPT-4o已經接近GPT-5,或許是後者的一次早期試水。據聶再清觀察,目前還沒有看到模型迭代的瓶頸,大模型的迭代速度有可能還會加快。

奧爾特曼在X上表示,OpenAI致力於將GPT-4o免費提供給所有使用者使用。以往,OpenAI釋出新版ChatGPT模型時,通常會將其置於付費牆之後。如今,免費使用者已經可以訪問GPT-4o加持下的多項功能,例如分析資料、建立圖表、撰寫檔案總結等,但不能使用圖片生成功能。付費使用者則可以享受5倍呼叫額度。谷歌在釋出會中沒有公佈Project Astra的具體上線時間,預計很快會登入到安卓、iOS等平臺使用。

對開發者來說,GPT-4o的定價也更友好。OpenAI官網顯示,從GPT-4開始,輸入單位文字的價格一直在下降,相較GPT-4 Turbo,GPT-4o收費降低50%,呼叫速度卻提升了兩倍。這使其在商業應用上有了更大吸引力。聶再清表示,大模型控制價格的方式之一是提升模型效能,用更少的資源做更多的事;另一個方式則是透過類似搜尋引擎的商業模式,對使用者免費,但可以收取廣告商的贊助。

至於未來OpenAI和谷歌的大模型有沒有開源的可能性,聶再清表示,參考iOS和安卓,一個閉源一個開源,未來的大模型市場也極有可能出現開源和閉源的巨頭。使用者體驗最好的行業領先者傾向於閉源,而開源的好處在於可以集體將模型“做大做強”,二者在市場都有自己的位置。谷歌在釋出會中推出了其首個視覺語言開源模型PaliGemma,針對影象標註、視覺問答、影象標籤化等方面進行了最佳化。此外,谷歌還將在6月推出更大規模的開源模型Gemma 2 27B。

OpenAI也同步釋出了適用於macOS的ChatGPT桌面應用程式,使使用者呼叫的體驗更絲滑。

GPT-4o加持下的通用語音助手在未來將有廣泛應用,例如健康管理、醫療諮詢、教育教輔等領域。聶再清認為,所有開放領域用到的語音智慧,例如購物App中的導購等,都可以加裝類似GPT-4o的智慧核心,增強使用者體驗。這類語音助手將離使用者越來越近。

“我正在臺上給大家做現場演示呢,有點緊張怎麼辦?”

“你在臺上做演示嗎?那真是太棒了!深呼吸一下吧,要記得你可是專家!”

圖/視覺中國

邏輯清晰,語調幽默,感情飽滿,很難想象這是現實中人類與AI間的對話。北京時間5月14日凌晨,美國人工智慧公司OpenAI的春季釋出會上線,釋出了重磅產品,也就是人工智慧大模型ChatGPT-4的升級版GPT-4o。前述對話就發生在釋出會現場,這位提問的研發負責人在得到GPT-4o的回應後,隨即故意大喘幾口氣,這一動作成功被手機上的GPT-4o捕捉到,並給出了“放鬆點,你可不是吸塵器”的回應。

“我正在臺上給大家做現場演示呢,有點緊張怎麼辦?”

“你在臺上做演示嗎?那真是太棒了!深呼吸一下吧,要記得你可是專家!”

圖/視覺中國

邏輯清晰,語調幽默,感情飽滿,很難想象這是現實中人類與AI間的對話。北京時間5月14日凌晨,美國人工智慧公司OpenAI的春季釋出會上線,釋出了重磅產品,也就是人工智慧大模型ChatGPT-4的升級版GPT-4o。前述對話就發生在釋出會現場,這位提問的研發負責人在得到GPT-4o的回應後,隨即故意大喘幾口氣,這一動作成功被手機上的GPT-4o捕捉到,並給出了“放鬆點,你可不是吸塵器”的回應。

上一篇:華為MatePad... 下一篇:“日本支付寶”...
猜你喜歡
熱門閱讀
同類推薦