(資料圖片)
開(kāi)年以來(lái),大模型吞噬應(yīng)用的敘事持續(xù)引發(fā)市場(chǎng)擔(dān)憂,并波及Adobe、Figma和美圖旗下的一系列影像產(chǎn)品。近日,投資機(jī)構(gòu)a16z團(tuán)隊(duì)在最新報(bào)告分析中反駁了這一觀點(diǎn),認(rèn)為在AI生成圖像、視頻、音頻等媒體內(nèi)容領(lǐng)域,并不存在“統(tǒng)治一切”的模型。“利用多模型能力并編排成工作流”的能力將是未來(lái)競(jìng)爭(zhēng)的關(guān)鍵點(diǎn)。
不同于“大模型吞噬應(yīng)用”的論調(diào),a16z分析認(rèn)為,AI生成確實(shí)能將原本需要攝影團(tuán)隊(duì)數(shù)周拍攝和漫長(zhǎng)剪輯周期的流程,轉(zhuǎn)化為幾條提示詞和一個(gè)可直接投入生產(chǎn)的資產(chǎn)庫(kù),但在AI圖像、AI視頻等領(lǐng)域并沒(méi)有出現(xiàn)類似大語(yǔ)言模型(LLM)領(lǐng)域的壟斷現(xiàn)象,使用者往往會(huì)同時(shí)使用十幾個(gè)模型,而且在生成一個(gè)優(yōu)質(zhì)成品素材的過(guò)程中,很難通過(guò)一次推理調(diào)用即獲得成功。
a16z解釋說(shuō),這是因?yàn)樵擃I(lǐng)域的每個(gè)模型都有強(qiáng)項(xiàng)和弱項(xiàng),某個(gè)模型可能擅長(zhǎng)寫實(shí)圖像,或動(dòng)漫風(fēng)格方面表現(xiàn)卓越,或具備強(qiáng)大的物理模擬能力,但這不意味著用戶會(huì)用它來(lái)同時(shí)完成背景移除、聲音生成或多鏡頭敘事場(chǎng)景等任務(wù)。在實(shí)踐中,開(kāi)發(fā)者會(huì)將多個(gè)模型串聯(lián):生成圖像,再移除背景、放大分辨率、重新著色、保持風(fēng)格一致......才能達(dá)到品牌級(jí)的一致性和質(zhì)量,而這不是一次提示詞就能做到的,也就是說(shuō),真正的工作單元不是“單個(gè)模型”完成的,而是通過(guò)“一個(gè)工作流”完成的。
a16z表示,基于上述多樣化的需求,用戶需要的是一種工作流平臺(tái)或軟件,這類平臺(tái)不僅要能快速調(diào)用各類模型、高效處理用戶請(qǐng)求,還要編排成多步驟的流水線且高效執(zhí)行,并隨著技術(shù)進(jìn)化不斷更迭新模型。
在a16z看來(lái),隨著大模型廠商的模型能力更為驚艷,能接入多種模型并編排成完整工作流的公司也將進(jìn)一步提升自己核心競(jìng)爭(zhēng)力,而且它們還能幫助模型廠商從原型深入生產(chǎn)一線。
關(guān)鍵詞: 財(cái)經(jīng)頻道 財(cái)經(jīng)資訊











