LLaVA:大型語言和視覺助手

首頁 > AI

LLaVA:大型語言和視覺助手

來源:匿名 釋出時間:2023-06-08 10:30

LLaVA 是一個新型的端到端訓練的大型多模態模型,結合了視覺編碼器和 Vicuna,用於通用的視覺和語言理解,在模擬多模態 GPT-4 的精神方面具有令人印象深刻的聊天能力,並在科學問答中取得了新的最高準確度。

LLaVA 的視覺編碼器使用了一種稱為 Visual Instruction Tuning 的新技術,該技術利用視覺指令進行微調,以從視覺輸入中提取更有用的資訊。該模型在多個基準測試中表現優異,包括 VQA,COCO captioning 和 ImageNet 分類。

LLaVA 採用了一種新型的訓練方法,該方法結合了來自多個任務的損失函式,包括影象分類,自然語言推理和問答等。透過這種方式,LLaVA 能夠從多種來源的資料中學習,並在各種任務上取得優異的表現。

更多關於 LLaVA 的資訊可以在官方網站上找到:https://llava-vl.github.io/。

上一篇:LangChain De... 下一篇:ChatVox - 24...
猜你喜歡
熱門閱讀
同類推薦