對話聯匯科技趙天成:被動智慧正走向主動智慧,一切都將被顛覆

首頁 > 科技

對話聯匯科技趙天成:被動智慧正走向主動智慧,一切都將被顛覆

來源:跳高的魚 釋出時間:2023-12-21 18:10

智慧體將成為全新物種,廣泛而深刻地影響人類。

作者 | 北方

編輯 | 靖宇

歷史上從來沒有哪一個時刻,比 2023 年更緊密地將 AI 與人類未來聯絡在一起。

僅僅剛剛過去的幾個月,AI 行業就上演了 OpenAI 開發者大會、Humane 推出 AI Pin、微軟 Ignite 大會、xAI 釋出 Grok、OpenAI「宮鬥劇」等行業大事件,不僅一次次引發 AI 圈密集討論,也讓更多人開始緊密親密關注 AI 商業化與自身的未來發展。

作為「大模型元年」,AI 大模型的落地也出現不同走向。面向 C 端,以 OpenAI 為代表,將 GPT Store、人人可定製的 GPT 等切入人類生活變成新的主題;而在 B 端,「技術如何落地」「應用的可能性」這類更實際的問題,從沒有如斯頻繁地出現在創業者的話語中。

卡耐基梅隆大學(CMU)「學霸」、聯匯科技首席科學家趙天成,現在還記得當年在大學攻讀博士時,看到谷歌的 AlphaGO 戰勝人類頂尖圍棋選手帶給自己的震撼。當時已經看清傳統「列規則」式的 AI 開發方式的弊端,轉而研究「AI 智慧體」的他,選擇了一條「前 GPT 模式」的 AI 之路,早在幾年之前,已經預判大模型才是 AI 快速進化的正確路徑。

回國加盟聯匯科技後,趙天成和團隊就開始打磨基礎模型,將重心放在了多模態大模型領域,並在 2021 年就推出了首個自研的多模態大模型,與當下創業者仍在疲於「卷」文字大模型形成鮮明對比。

技術上的創新和務實的產品開發,讓聯匯科技利用多模態大模型的超強能力,先後獲得廣電、運營商、國家電網等多個領域的 B 端客戶,成為大模型創業者中少見的功落地者。

在商業路徑上,趙天成看到當年「AI 四小龍」當下的窘境,認識到「小模型定製死路一條」的真理,堅持聯匯科技在大模型領域的不斷研發和創新。

對於當下的「百模大戰」,趙天成認為單純的「卷引數」,嘗試復現 ChatGPT 的能力,對很多創業公司來說,可能並不是唯一正確的打法。而已經在 B 端積累了相當經驗的他,認為大模型並不止 LLM 一種形式,相比而言,多模態大模型能落地的場景更多。

「GPT 只是大模型的一個路徑,但 OpenAI 的方法論可以在更多場景中做嘗試。」趙天成告訴極客公園。在他看來,在 AI 的 B 端落地上,競爭並非是「百團大戰」,而更像「叢林狩獵」,最終能獲得獵物的,並非一定是大公司。

以下為聯匯科技首席科學家趙天成採訪實錄,由極客公園收拾整頓:

01 傳統 AI 研究有上限,要做沒人敢做的事情

極客公園:你之前在加州大學攻讀計算機專業,為什麼後來又去了 CMU 進行語言技術方面的研究?

趙天成:我在 UCLA 電子工程系加計算機雙修,差不多三年時間就修完本科專業課程,第四年主要攻讀了一系列研究生課程,並且在 UCLA 語音技術實驗室做語音處理相關研究,開始接觸到人工智慧和機器學習等前沿課題,激發了我很大的興趣。

選擇去 CMU 攻讀計算機博士學位,是因為 CMU 在 AI 領域全球排名第一,去那裡是所有 AI 研究人員的夢想。而去 CMU 計算機學院的 LTI(語言技術研究所)是因為接觸到語音處理技術之後,我感覺到這項技術,已經開始慢慢從學術界往工業界轉移了,它本身的技術部分相對來說已經比較成熟了,我想去做更前沿的基礎人工智慧理論研究工業工程化相關的研究。

我當時判斷既然語音識別作為語音感知層已經相對成熟,那後續的行業趨勢肯定會做更深度的認知智慧,比如理解語義,智慧對話,甚至具有超出語言本身之外的推理與決議計劃能力。CMU 的 LTI 是這個領域全球最好的研究機構,那裡的科學家研發了全球最早的語音識別引擎、機器翻譯系統、人機對話系統等等,我相信在那裡可以誕生出未來新一代的突破性人工智慧技術。

極客公園:2014 年你選擇去做語音和語言研究的時候,當時的學術界是什麼狀態?

趙天成:NLP(自然語言處理)領域那時屬於一個交接期。當時有一批人在做偏規則型研究,也有人在做偏機器學習型的研究,或者把機器學習和規則進行結合。

在 2016 年,我發表了業內最早的一篇端到端人機對話論文,講如何用神經網路解決整個對話系統的問題。當時通常的做法是多個規則模組的拼接,而用一個神經網路來完成全部的對話仍是很前沿的想法,和現在的 ChatGPT 很像。這個工作也提名了當年 SIGDIAL 最佳論文獎。

我當時提出的就是,應該用一個神經網路進行端到端的學習來實現智慧對話,而不是用很多 AI 規則模組來做人機互動系統。

極客公園:這種靈感來源是什麼?

趙天成:當時我分析了傳統的對話系統,發現透過人工建立規則或者人工建立專家系統,雖然能在短期內對系統的能力會有一些提升,但這個提升是不可持續的,因為我們不可能窮舉所有的對話場景,因此從長遠看,要實現大的 AI 飛躍,正確的路線應該是減少人工干預,依靠更強的算力,讓機器能更好地進行自學習來達到智慧的提升。而不能陷入有多少「人工」,才有多少「智慧」的怪圈,那樣做只能讓「人工智慧」變成「人工智障」。

但是要實現機器自我學習,這個過程中有很多挑戰,因為一個人機互動系統會有很多複雜模組,需要做自然語言理解,把它解釋成實體,在對話層面又要去做很多邏輯以及規劃,這些都要透過一個神經網路去解決。

機器人小歐對畫面深度理解 | 小程式搜尋「機器人小歐」體驗

但當時業界沒有現在這麼多的工具,在做的過程中,我們考慮的是從怎樣的點入手,把最基本的閉環走通,然後以它為基礎再去做擴充套件。這是我當時覺得比較容易實現、成為真正智慧的 AI 的方向和路徑。

極客公園:你在 CMU 讀博期間,業內還沒有大模型這個概念出現?

趙天成:當時還沒有大模型這個概念,甚至連生成式模型都是少見的概念。

在碩博期間,我做了兩件事情。我在碩士期間承接了一個美國科研自然基金 NSF 的專案,當時還沒有智慧音箱,我提出做一個智慧體,其智慧大腦可以融合各種各樣的單任務智慧體能力,可能是訂餐,也可能是推薦地圖,透過一個統一的智慧體和使用者交流。這在當時仍是很前沿的課題,類似於現在 ChatGPT 的外掛系統。我和團隊在 2014 -2016 年從 0 到 1 把整個平臺做出來,作為基礎科研平臺,支撐了後續超過 100 多篇科研論文的發表。這個成果得到了亞馬遜、谷歌等多位人工智慧專家的充分肯定。

做這個智慧體的過程中,我發現靠傳統的方式去做智慧體其實能力上限很低。這啟發我在博士課題中去做端到端的生成式模型,我認為只有這樣才能真正從根本上解決這個問題。所以從 2016 年之後,我基本上所有的論文都是圍繞怎樣去做更好的生成式模型,把資料「注入」進去之後,它就可以完成更復雜的任務。

極客公園:當時做的就已經是大模型,只是沒有像現在這種幾百億引數這麼大?

趙天成:對,只是在規模上不一樣,在核心演算法這一塊非常接近,幾乎沒有差別。比如當時我訓練的是 1 億引數的模型,現在可能是 100 億引數或者 1000 億引數的模型。

極客公園: 2016 年 AlphaGo 出現了,當時也引起了非常大的反響,你當時有什麼感慨感染?

趙天成:當時觸動很大。因為我當時做的就是生成式模型過程中最大的兩個技術棧:偏神經網路的設計、訓練和強化學習。

當時 AlphaGo 是強化學習一個很好的應用場景和成果。所以我們也考慮怎樣讓這種能力應用在現實場景中,因為 AlphaGo 本身的規則是固定的。但實際上我們在跟人機互動、自然語言、影象打交道的時候有無窮的可能性,難度遠遠超出下圍棋這個任務。所以我們花了很多精力去研究,怎樣將 AlphaGo 級別的端到端的機器學習應用在更廣領域,在 2018 年我們就提出了透過基於隱變數的強化學習,讓智慧體學會從人類反饋中獲得更好的人機互動策略,大幅度提高任務完成的成功率,達到了當時的 SOTA 效能。

極客公園:在 2019 年和 2020 年左右,國內 AI 行業尚處於波谷期,為什麼會選擇回國創業做 AI?

趙天成:因為我發現不管什麼模型、什麼技術,都需要有一些匹配的應用場景,去實現它的迭代和本身價值的體現。當時我們和國內有很多交流,發現其實國內不管是影片仍是多媒體,有很多應用場景在美國可能很少見,國內反而機會更多。

一方面,國內做 AI 會有更大的應用空間,有更多的機會。另一方面,回國也是我的個人選擇,我個人仍是比較有家國情懷的一個人,在美國留學這麼多年,我希望能把時間與精力放在建設自己的國家,綜合決定之後,我選擇回國實現我的理想。

02 做小模型定製,是死路一條

極客公園:當時國內 AI 行業處於什麼狀態,聯匯科技如何選擇切入市場的角度?

趙天成:當時國內大模型幾乎是未開啟狀態。很多大廠,包括華為、百度等也訓練過一些模型,但當時大家還沒有發現什麼實際的價值。

我回來後分析了國內 AI 行業的痛點。當時很多行業都在做 AI,比如零售 AI、客服 AI 等,這些基本上都是用傳統的小模型方式在做的,定製化程度極高,而對小模型定製來說,他的瓶頸在於每個模型不能泛用,每個場景都要從頭做起,無法沉澱積累,使得定製成本很高。這就導致了當時做 AI 商業化落地成為一件很累、很虧錢的事情。

經過研究分析,我們發現雖然市場有很多中長尾應用場景,但功能要求非常分散,這種情況和我們之前做智慧體平臺差不多。如果用小模型方式去做的話,很難走遠。所以我覺得我們既然要做,就要去做有「未來」的東西,摒棄小模型的思路,專心於大模型。而且我們根據學術界的研究成果,判斷大模型的行業爆發不會太遠。

歐姆視覺語言大模型擁有主動思考分析能力

極客公園:當時你怎樣讓客戶認識到這種技術案例的先進性?說服對方在這個方向投入?

趙天成:非常困難。當時還沒有大模型的概念,我們嘗試了很多方法去做科普,但幾乎沒人聽得懂。我們就嘗試透過和其他產品 PK 來說明我們的路線優勢,因為大模型和小模型一對比就能看到效果。比如在介紹跨模態搜尋能力時,我們就和對方說以前的搜尋都是需要打標籤的,但我們的搜尋只要透過自然語言說一句話,就能把東西搜出來,我們不用標籤,或者說我們是「無限標籤」。

這種概念其實很多客戶也仍是不理解,我們只能用更具象的方式去介紹。比如雖然我們是無限標籤,但有時候不得不說我們有幾萬個標籤,因為這樣能給他們一個具象的概念。這些都是我們在嘗試落地時碰到的困難。

極客公園:有沒有給你印象很深的客戶,你展示前他並不相信這些,展示後他被震驚到了?

趙天成:比如某廣電集團,他們也是我們比較大的一個客戶。他們有很多影片媒體資料,比如新聞播報類節目等,以前一年要花幾百萬進行人工編目、打標籤,來實現資產管理和檢索。當時我們說可以透過機器學習,自動生成無限標籤,可以實現任意檢索,對方不太相信,我們就給他們做測試系統,讓客戶自己去驗證。然後我們再從技術底層去講解這個原理。經過幾次使用和講解之後,他們內部一些專業的技術專家也認識到這個技術路線的先進性,後續合作就比較順暢了。

極客公園:這樣的一個商業化方向是團隊經過很長時間碰出來的嗎?仍是說你早就已經想到了場景和方向,只是根據客戶不同來去提供支援?

趙天成:雖然我們當時認為大模型一定是一個方向,而且我們也一直在致力於提高大模型的基礎能力,但在商業化方向上,仍是透過不斷的市場探索,慢慢摸出來的。在尋找具體應用場景時,我們當時嘗試了很多行業,也碰過很多壁。最終發現,最終我們聚焦在媒體視覺和 IoT 視覺這兩大應用場景。

極客公園:從回國到成功落地這樣的大客戶,大概花了多長時間?

趙天成:差不多一年多時間。雖然在技術方面,我們之前在美國已經有了一些積澱,並不是回來之後從零開始做起。但在真正落地應用時,仍是有很多需要改進。實際上要真正做到應用落地,需要大模型能力提升、工具鏈開發、應用場景確定、應用閉環開發以及商業模式確定等一系列因素結合起來才能實現,並不僅僅是技術問題。

極客公園:你回國的時候,國內「AI 四小龍」很受關注,經過這些年,從這些公司的起伏中能學到什麼經驗?

趙天成:我認為這些公司都很優秀,他們在小模型應用落地方面,做了很多嘗試,在高頻領域也有很多成功案例,但在中長尾領域都不太順利。這也反過來驗證了我的判斷——如果用小模型方式去服務中長尾場景,貌似是死路一條。

這樣的判斷,更加堅定了我們做大模型的決心。我們看到只要把大模型的商業道路走通的話,將具有巨大的市場價值。

歐姆視覺語言大模型擁有四大核心能力

03 被動智慧正走向主動智慧,一切都將被顛覆

極客公園:在 ChatGPT 出來之前,你已經預判到大模型技術的行業趨勢,在這些年裡,你對大模型的理解有什麼變化?

趙天成:我是從 2016 年左右開始專注於端到端的生成式模型訓練,其核心思想和如今的大模型訓練如出一轍,也就是首先構建一個上限極高的神經網路模型,然後透過對大量的無監督資料進行自迴歸學習,實現原本需要 N 個專家系統模組組合而成的複合能力。在這些年裡,對於大模型學習的最大變化在於對於這種學習方式能達到的上限與發展速度一次次地重新整理了我的預期,也讓我更加堅定這種方法論的正確性。

早年的時候,端到端模型能夠實現 AI 對於自然語言的流暢生成,到後面能夠根據使用者的問題給出流暢的答覆就已經是非常了不起的成果了。然而現在 GPT-4 可以不但進行流暢的語言生成與問題回覆,還可以主動地選擇不同的工具,並且產生思維與推理鏈條,這個在當時是不太敢想的。當時這個過程只能靠人工去定義,不可能靠 AI 自己做出來。

現在不管多模態大模型仍是大語言模型,已經逐步具備自己去產生整個推理鏈路或者決議計劃鏈路的能力,我覺得這個是顛覆性的變化,也讓現在的 AI Agent 開始具備了主動思考與決議計劃的能力。

聯匯科技智慧管家機器人看護老人

極客公園:所以這些年的改變,讓 AI 有可能實現大範圍的商業化?

趙天成:對,這些年最大的變化是從以前的被動智慧——使用者問一個問題,AI 回答一個問題,到現在的主動智慧——使用者問一個問題,AI 除了回答他的直接問題,還會主動聯想到其他問題。甚至使用者不用提問,AI 自己根據它的觀察,就能主動發現問題並給出解決問題的建議。

比如在零售場景下面,AI 透過影片分析發現超市裡的咖啡打翻了,它會自己聯想到需要做清理,或者通知誰去打掃衛生。這樣從觀察到行動的決議計劃方案,以前只有透過人工設定才可能實現,但現在就可以自動實現,這是一個比較顛覆性的變化,從被動智慧進化到主動智慧。

聯匯科技巡店機器人進行店面管理

當 AI 從被動智慧發展到主動智慧後,就有了更多的商業應用價值,就有可能實現大規模的商業化。

極客公園:聯匯科技團隊在 AI 落地場景很早就開始嘗試,現在還有哪些落地場景可以透露?

趙天成:現在很多 AI 應用主要仍是基於純語言模型,我們的特點是專注在多模態大模型上,特別是視覺和語言兩個模態。把視覺和語言結合起來的應用場景很多。

比如在媒體領域有很多內容創作需求。我們正在用基於視覺語言大模型的智慧體框架做一個產品,實現編導層面的自動化和主動智慧,以解決編導們最頭痛的內容創意問題,這個產品可以根據內容主題要求,自動分析內容主體是什麼、需要什麼素材、鏡頭怎麼拆,最後要用怎樣的敘事線表達,讓 AI 去做一步步推理的過程。

上一篇:微信分付開通... 下一篇:完顏慧德,是...
猜你喜歡
熱門閱讀
同類推薦