騰訊混元“文生圖”技術負責人:研發思路是實用,已廣泛用於各類場景

首頁 > 科技

騰訊混元“文生圖”技術負責人:研發思路是實用,已廣泛用於各類場景

來源:穿搭講究 釋出時間:2024-03-22 14:11

騰訊混元“文生圖”技術負責人:研發思路是實用,已廣泛用於各類場景

騰訊科技《一線》 紀振宇 發自矽谷

在本屆GTC大會期間,騰訊混元大模型披露了其在“文生圖”領域的進展。騰訊混元文生圖技術負責人、騰訊專家研究員蘆清林接受騰訊科技《一線》專訪時表示,騰訊混元文生圖大模型目前從模型結構和技術能力來看,均處於業內領先地位,同時優勢和特色還在與廣告、遊戲、內容、雲服務等具體的應用場景結合緊密。

騰訊混元文生圖技術負責人、騰訊專家研究員蘆清林介紹騰訊混元大模型文生圖能力

蘆清林介紹說,自2023年10月正式對外亮相以來,騰訊混元文生圖模型經過數十次版本更新迭代,自研了基於LLM+ transformer的文生圖基礎能力,並且基於基礎模型,推進了多項應用工作,包含影象風格化、商品背景更換等。

騰訊混元大模型是騰訊自研的通用大語言模型,具備強大的中文創作能力,複雜語境下的邏輯推理能力,以及可靠的任務執行能力。

騰訊混元大模型有良好的上下文理解和長文記憶能力,能夠流暢完成各專業領域的對輪問答;支援文學創作、文字摘要、角色扮演;能夠準確理解使用者意圖,基於已有資料或資訊進行推理、分析;同時有效解決事實性、時效性問題,提升內容生成效果。他表示,目前在人工智慧文生圖領域,普遍遇到的難點和挑戰在於圖文不完全相關、圖片不正確,出現區域性畸形以及細節質感差等,騰訊混元文生圖透過中英文雙語細粒度CLIP模型,保證主體和屬性充分理解前置模型連線圖文特徵,增強語義表達,基於Transformer的大模型框架,強化生成模型的內容結構合理化表達,引入人體先驗結構資訊,修正人體結構生成,並透過建設基於模型融合方案,充分發揮模型在人物、場景各個維度的細節展現。

據瞭解,騰訊混元文生圖是中文原生的文生圖模型,對中文的語義理解比較強,在混元大模型中輸入中文詩句、成語等指令,要求其創作畫作,混元文生圖一般能準確創作。

而對細節的感知與判別,也是混元文生圖的優勢能力。比如,“生成在樹林中的夜晚,一個棕色頭髮、綠色眼睛的男子站在樹林裡。照片採用特寫構圖,展現了動漫風格和神秘氛圍,蘊含了漫畫文化”。在最佳化之前,模型可能難以識別出不同身體部分與顏色的需求;最佳化之後,則可以相對準確地識別出各處細節的要求。

在內容合理性方面,AI生成人體結構和手部經常容易出問題。混元文生圖透過增強演算法模型的影象二維空間位置感知能力,並講人體骨架和人手結構等先驗資訊引入到生成過程中,讓生成的影象結構更合理,減少錯誤率。

在畫面質感方面,混元文生圖基於多模型融合的方法,提升生成質感。經過最佳化之後,混元文生圖的人像模型(髮絲、皺紋等)效果提升30%;場景模型(草木、波紋等)效果提升25%。從而使生成照片的真實感較強,包括人像、場景與自然景觀,可生成長城等中國著名景觀、旅遊與風景等廣告場景中多見的需求。

蘆清林說,騰訊混元文生圖模型的另一優勢在於與許多的應用場景結合緊密,例如在廣告、遊戲等方面,已經得到了廣泛應用。

今年一月,騰訊廣告發布了一站式AI廣告創意平臺騰訊廣告妙思,該平臺基於騰訊混元大模型能力,可為廣告主提供文生圖、圖生圖、商品背景合成、妙思衍生、特定風格LORA等不同場景的創意工具。

他表示,騰訊從事大模型相關研發的思路是要“實用”,一定要與應用相結合。未來隨著AI的能力逐漸從文生文,到文生圖、文生影片,圖生圖、圖生影片等多模態方向不斷發展的過程中,依然會堅持這樣的思路去做。

騰訊混元“文生圖”技術負責人:研發思路是實用,已廣泛用於各類場景

騰訊科技《一線》 紀振宇 發自矽谷

在本屆GTC大會期間,騰訊混元大模型披露了其在“文生圖”領域的進展。騰訊混元文生圖技術負責人、騰訊專家研究員蘆清林接受騰訊科技《一線》專訪時表示,騰訊混元文生圖大模型目前從模型結構和技術能力來看,均處於業內領先地位,同時優勢和特色還在與廣告、遊戲、內容、雲服務等具體的應用場景結合緊密。

騰訊混元文生圖技術負責人、騰訊專家研究員蘆清林介紹騰訊混元大模型文生圖能力

蘆清林介紹說,自2023年10月正式對外亮相以來,騰訊混元文生圖模型經過數十次版本更新迭代,自研了基於LLM+ transformer的文生圖基礎能力,並且基於基礎模型,推進了多項應用工作,包含影象風格化、商品背景更換等。

騰訊混元大模型是騰訊自研的通用大語言模型,具備強大的中文創作能力,複雜語境下的邏輯推理能力,以及可靠的任務執行能力。

騰訊混元大模型有良好的上下文理解和長文記憶能力,能夠流暢完成各專業領域的對輪問答;支援文學創作、文字摘要、角色扮演;能夠準確理解使用者意圖,基於已有資料或資訊進行推理、分析;同時有效解決事實性、時效性問題,提升內容生成效果。他表示,目前在人工智慧文生圖領域,普遍遇到的難點和挑戰在於圖文不完全相關、圖片不正確,出現區域性畸形以及細節質感差等,騰訊混元文生圖透過中英文雙語細粒度CLIP模型,保證主體和屬性充分理解前置模型連線圖文特徵,增強語義表達,基於Transformer的大模型框架,強化生成模型的內容結構合理化表達,引入人體先驗結構資訊,修正人體結構生成,並透過建設基於模型融合方案,充分發揮模型在人物、場景各個維度的細節展現。

據瞭解,騰訊混元文生圖是中文原生的文生圖模型,對中文的語義理解比較強,在混元大模型中輸入中文詩句、成語等指令,要求其創作畫作,混元文生圖一般能準確創作。

而對細節的感知與判別,也是混元文生圖的優勢能力。比如,“生成在樹林中的夜晚,一個棕色頭髮、綠色眼睛的男子站在樹林裡。照片採用特寫構圖,展現了動漫風格和神秘氛圍,蘊含了漫畫文化”。在最佳化之前,模型可能難以識別出不同身體部分與顏色的需求;最佳化之後,則可以相對準確地識別出各處細節的要求。

在內容合理性方面,AI生成人體結構和手部經常容易出問題。混元文生圖透過增強演算法模型的影象二維空間位置感知能力,並講人體骨架和人手結構等先驗資訊引入到生成過程中,讓生成的影象結構更合理,減少錯誤率。

在畫面質感方面,混元文生圖基於多模型融合的方法,提升生成質感。經過最佳化之後,混元文生圖的人像模型(髮絲、皺紋等)效果提升30%;場景模型(草木、波紋等)效果提升25%。從而使生成照片的真實感較強,包括人像、場景與自然景觀,可生成長城等中國著名景觀、旅遊與風景等廣告場景中多見的需求。

騰訊混元“文生圖”技術負責人:研發思路是實用,已廣泛用於各類場景

騰訊科技《一線》 紀振宇 發自矽谷

在本屆GTC大會期間,騰訊混元大模型披露了其在“文生圖”領域的進展。騰訊混元文生圖技術負責人、騰訊專家研究員蘆清林接受騰訊科技《一線》專訪時表示,騰訊混元文生圖大模型目前從模型結構和技術能力來看,均處於業內領先地位,同時優勢和特色還在與廣告、遊戲、內容、雲服務等具體的應用場景結合緊密。

騰訊混元文生圖技術負責人、騰訊專家研究員蘆清林介紹騰訊混元大模型文生圖能力

蘆清林介紹說,自2023年10月正式對外亮相以來,騰訊混元文生圖模型經過數十次版本更新迭代,自研了基於LLM+ transformer的文生圖基礎能力,並且基於基礎模型,推進了多項應用工作,包含影象風格化、商品背景更換等。

騰訊混元大模型是騰訊自研的通用大語言模型,具備強大的中文創作能力,複雜語境下的邏輯推理能力,以及可靠的任務執行能力。

騰訊混元大模型有良好的上下文理解和長文記憶能力,能夠流暢完成各專業領域的對輪問答;支援文學創作、文字摘要、角色扮演;能夠準確理解使用者意圖,基於已有資料或資訊進行推理、分析;同時有效解決事實性、時效性問題,提升內容生成效果。他表示,目前在人工智慧文生圖領域,普遍遇到的難點和挑戰在於圖文不完全相關、圖片不正確,出現區域性畸形以及細節質感差等,騰訊混元文生圖透過中英文雙語細粒度CLIP模型,保證主體和屬性充分理解前置模型連線圖文特徵,增強語義表達,基於Transformer的大模型框架,強化生成模型的內容結構合理化表達,引入人體先驗結構資訊,修正人體結構生成,並透過建設基於模型融合方案,充分發揮模型在人物、場景各個維度的細節展現。

據瞭解,騰訊混元文生圖是中文原生的文生圖模型,對中文的語義理解比較強,在混元大模型中輸入中文詩句、成語等指令,要求其創作畫作,混元文生圖一般能準確創作。

而對細節的感知與判別,也是混元文生圖的優勢能力。比如,“生成在樹林中的夜晚,一個棕色頭髮、綠色眼睛的男子站在樹林裡。照片採用特寫構圖,展現了動漫風格和神秘氛圍,蘊含了漫畫文化”。在最佳化之前,模型可能難以識別出不同身體部分與顏色的需求;最佳化之後,則可以相對準確地識別出各處細節的要求。

在內容合理性方面,AI生成人體結構和手部經常容易出問題。混元文生圖透過增強演算法模型的影象二維空間位置感知能力,並講人體骨架和人手結構等先驗資訊引入到生成過程中,讓生成的影象結構更合理,減少錯誤率。

在畫面質感方面,混元文生圖基於多模型融合的方法,提升生成質感。經過最佳化之後,混元文生圖的人像模型(髮絲、皺紋等)效果提升30%;場景模型(草木、波紋等)效果提升25%。從而使生成照片的真實感較強,包括人像、場景與自然景觀,可生成長城等中國著名景觀、旅遊與風景等廣告場景中多見的需求。

上一篇:白金信用卡不... 下一篇:基金7天持有...
猜你喜歡
熱門閱讀
同類推薦