深度剖析AI Agent的原理及應用發展

首頁 > 科技

深度剖析AI Agent的原理及應用發展

來源:娛樂大起底 釋出時間:2024-01-04 17:43

本篇文章將深入探討AI Agent是什麼?它是如何運作的?它實際應用場景有哪些以及對我們的生活會帶來哪些改變。請坐好,準備發車啦~

隨著大語言模型(LLM)在23年的快速發展,大模型逐步收斂為以閉源為代表的ChatGPT和以開源為代表的Llama2。

大模型本身也在朝著多模態的方向發展,這意味著模型能夠處理不同型別的資料,如:文字、圖片、影片和音訊,其本質是豐富模型的資訊處理與生成能力,能夠更好地理解現實世界,處理複雜問題。

一、LLM vs Agent

雖然大語言模型的能力足夠強大,但它依舊是被動的響應使用者的指令,並且生成的效果取決於使用者如何使用它。

而AI Agent(智慧代理)的出現,將改變這一現狀。

它是一個自動化的程式,它具備自主規劃和執行的能力,它也被視為通往AGI(通用人工智慧)的鑰匙。

從NLP -> AGI 的發展路線分為五個級別,From:《The Rise and Potential of Large Language Model Based Agents: A Survey》,分別是:語料庫、網際網路、感知、具身和社會屬性。

目前的大語言模型已經來到了第二級,具備網際網路實時訪問的多模態內容輸出。AI Agent在LLM的基礎之上在往感知、具身和社會屬性的方向方展;當其具備感知環境與行動的能力時,將進入到第三和第四級別;再進一步,當多個Agent透過它們之間的互動、合作,且具備情感屬性,能夠處理更加複雜的任務或反映現實世界中的社會行為時,Agent將進入第五級。

圖片來源:《The Rise and Potential of Large Language Model Based Agents: A Survey》

二、什麼是AI Agent?

Agent被翻譯為代理或者智慧體,它核心的作用是具備自主實現目標的能力,能夠感知外部環境,具備自主性、反饋性、積極性和情感社交屬性的智慧體。

光這樣描述仍是很抽象,以我們的日常行為進行一個比喻:人類處理任何問題和任務時,都會經歷資訊輸入->資訊處理->資訊輸出過程。

我們來想想一個場景: 小明想要吃樹上的蘋果,首先透過感官系統感知到蘋果樹上的蘋果,然後在大腦中思考如何採摘蘋果,最後藉助採摘工具,拿到蘋果後成功地放到嘴巴里津津有味地吃了起來。我們將場景抽象成模型,其實就形成了AI Agent的大致框架:

分以下幾個模組:

其中最關鍵的是大腦部分(規劃&決議計劃),由ChatGPT、Llama2、Gemini這樣的大語言模型作為Agent的大腦,增強了Agent的規劃與決議計劃的能力。

三、AI Agent關鍵模組說明

我們將上圖進行進一步的抽象和延展,就是網上廣為流傳由OpenAI提出的Agent的模型圖:

上一篇:股票分紅稅率... 下一篇:有道子曰大模...
猜你喜歡
熱門閱讀
同類推薦