你知道《太空歌劇院》嗎?
它是一幅 AI 作的畫,并拿到了藝術(shù)比賽的一等獎(jiǎng)。在 2022 年,AI 作畫已經(jīng)變得如此簡單,你只要會打字就行。在一片高斯噪聲中逐漸顯露出精彩絕倫的顏色和圖案,AI 是怎么畫畫的?為什么能畫得這么好?會不會取代人類設(shè)計(jì)師?
更令人費(fèi)解的在于,AI 有沒有自己的邏輯思辨能力?
其實(shí),我們還處在人工智能的早期,AI 對真正的邏輯和某個(gè)垂直領(lǐng)域的理解還不深,但不斷強(qiáng)化它的邏輯思維能力一定會是接下來研發(fā)的重點(diǎn)。
非常榮幸今天能跟大家分享一些 AIGC 圖片相關(guān)的梳理,在漫漫的熊市之中,近期我們看到了很多驚人的生成效果。
首先我們來看一下 AI 生成的圖片。
這是最近非?;鸬?AI 生成圖片平臺 Midjourney (強(qiáng)烈推薦大家試試看)產(chǎn)生的一些圖片效果,可以看到非常真實(shí),也有很強(qiáng)的創(chuàng)意效果。它是如何做到的?
通俗易懂地來講有三個(gè)步驟。首先,把人類的文字轉(zhuǎn)換成計(jì)算機(jī)能夠理解的表達(dá),然后把計(jì)算機(jī)能理解的文本表達(dá)轉(zhuǎn)換成計(jì)算機(jī)能理解的視覺描述,再接下來,把計(jì)算機(jī)能理解的視覺描述生成人類能夠看懂的圖片。
以 DALLE2 為例,它訓(xùn)練了 3 個(gè)模型來做這件事情。接下來,我會分別講述。
第一個(gè)模型是 CLIP 模型,負(fù)責(zé)將文本和視覺圖像聯(lián)系起來。
過去的很多算法就像是拿 1 萬張人類已經(jīng)標(biāo)注了類別的照片,讓計(jì)算機(jī)去尋找不同類別照片的差異化特征。最大的缺點(diǎn)是,它無法標(biāo)注世間萬物,只能分類有限的集合,同時(shí)人力標(biāo)注會成為學(xué)習(xí)的上限。
CLIP 模型帶來的新思路是什么?它很像是真實(shí)生活中教小朋友認(rèn)識物體??吹揭粋€(gè)東西就直接告訴小朋友,這是一只游泳的鴨子,而不是一次性拿 20 張鴨子的圖片告訴他,這是鴨子,你記住它的所有特征。CLIP 模型的算法實(shí)現(xiàn)了這樣一個(gè)特點(diǎn),只要我們有充足的算力,就能學(xué)會世間的萬物。
CLIP 模型的數(shù)據(jù)集從哪來?它來自于互聯(lián)網(wǎng)上圖文的匹配對,總共收集了 4 億張的圖文匹配對,再經(jīng)過一個(gè)圖文編碼器,把人類能看懂的文字和圖片轉(zhuǎn)換成計(jì)算機(jī)能懂的數(shù)據(jù)結(jié)構(gòu)。
CLIP 模型用到了兩個(gè)編碼器,視覺編碼器叫 Vision Transformer,文字編碼器叫 Transformer。下圖是 Vision Transformer 編碼器產(chǎn)生的效果圖,可以看到兩張圖片里背景部分的顏色被大幅弱化,強(qiáng)調(diào)了網(wǎng)球和黑狗的輪廓。這就是優(yōu)秀的編碼器能實(shí)現(xiàn)的效果:用人類的視角找重點(diǎn),進(jìn)行數(shù)據(jù)降維。
CLIP 模型做的事是什么?把來自互聯(lián)網(wǎng)的 4 億張圖片和 4 億條文本進(jìn)行編碼,并兩兩配對,形成一個(gè) 4 億 * 4 億的矩陣。
CLIP 模型的訓(xùn)練目標(biāo)是什么?通過各種各樣的復(fù)雜計(jì)算,讓原本匹配的圖片和文本產(chǎn)生正相關(guān)。將蘋果的照片和蘋果的文字進(jìn)行匹配,而不是摩托車或其他。
CLIP 模型實(shí)現(xiàn)的功能是什么?給定任何一個(gè)文本,能返回相關(guān)性最高的圖片;給定任何一張圖片,能返回相關(guān)性最高的文本描述。實(shí)現(xiàn)海量的圖像和文字特征的 mapping。
有了 mapping 以后,接下來重要的是如何從視覺的描述中產(chǎn)生圖像,這是 GLIDE 擴(kuò)散模型。
它就像是教小朋友學(xué)畫畫,先給小朋友看一張簡筆畫,逐漸把它擦掉,讓小朋友在大人的引導(dǎo)之下,試著從白紙開始恢復(fù)這張簡筆畫。
從計(jì)算機(jī)的視角來看,擦除的過程就是給圖片不斷增加噪聲的過程,這種噪聲是一種正態(tài)分布的噪聲,叫高斯噪聲,直到最后變成一張純噪聲的圖片?;謴?fù)的過程就是通過概率除去噪聲的過程,這中間往往會加一些指引,叫 Guidance,以確?;謴?fù)的過程朝著對的方向。
左圖為增加噪聲的過程,右圖為除去噪聲的過程
GLIDE 擴(kuò)散模型帶來最大的創(chuàng)新就是在訓(xùn)練的過程中融入了文本的信息。在 CLIP 模型的基礎(chǔ)上,在恢復(fù)的過程中嵌入文本的信息,這就導(dǎo)致了難度的快速疊加,因?yàn)樗纫獙W(xué)會恢復(fù)的算法,又需要學(xué)會識別的算法。然而,在恢復(fù)的過程中,它并沒有把知識完全融入其中,如何才能把知識徹底地融入到圖像生成里?
GLIDE 模型的抽象理解,就像是爸爸教小朋友騎車,目標(biāo)是希望在有爸爸扶和沒有爸爸扶的時(shí)候,小朋友都能騎出同樣的曲線。這往往通過一種中間形態(tài)來實(shí)現(xiàn),從一直扶到偶爾扶,偶爾撒手,最終的訓(xùn)練目標(biāo)就是不斷在這種狀態(tài)里達(dá)成。
GLIDE 擴(kuò)散模型的目標(biāo)也是如此,在它的原理中,爸爸扶著小朋友就是分類器,能幫助分類或目標(biāo)識別,撒手就意味著無分類器指引,有時(shí)會將一些文本的信息替換成空的字符串,隨機(jī)替換掉一些信息。當(dāng)有分類器產(chǎn)生的曲線和沒有分類器指引產(chǎn)生的曲線一致時(shí),整個(gè)文本的信息就融入到了生成過程中。
有了 GLIDE 擴(kuò)散模型以后,還可以制定不同的引導(dǎo)目標(biāo),因此會產(chǎn)生不同的效果,如果你想生成與某張圖片一樣效果的圖片,你可以輸入這張圖片,接著就會得到一張類似風(fēng)格的圖片。這就像是一個(gè)小朋友的爸爸告訴他,自行車的前輪其實(shí)是個(gè)裝飾品,他最終在不斷的強(qiáng)調(diào)之下,就會學(xué)會這樣騎車的方式。
當(dāng) CLIP 模型將文本和視覺相連,GLIDE 模型通過概率恢復(fù)一張隨機(jī)的模糊照片,并把文本信息融入其中,我們還缺少了這兩者之間的聯(lián)結(jié),如何把文本描述映射到視覺描述中,這就是 PRIOR 模型的核心。
有了 CLIP 模型,雖然能夠?qū)崿F(xiàn)文本和視覺之間相關(guān)性的描述,但還缺少一個(gè)轉(zhuǎn)換器,那就是面對一個(gè)新的描述,如何產(chǎn)生一張新的圖片。就像你教會了小朋友畫帽子,也教會了畫兔子,現(xiàn)在如何讓他畫一張戴帽子的兔子。PRIOR 模型其實(shí)是在 CLIP 模型之后產(chǎn)生一個(gè)新的效果,在 CLIP 模型中用到的文本和圖片編碼器,給編碼后的東西再增加一個(gè)特征,這就使得文本和圖片的信息都融合在同個(gè)維度,便于我們?nèi)ゲ僮鳌?/p>
CLIP 模型理解了圖片與文字的關(guān)系,PRIOR 模型就是在理解圖片與文字的關(guān)系之上,從文字中產(chǎn)生一個(gè)腦海中的構(gòu)圖,GLIDE 擴(kuò)散模型就是要把腦海中的構(gòu)圖畫出來,畫出人類能懂的視覺圖片。
我們再從下圖論文的原理來理解一下。圖中有一條虛線,虛線的上方是預(yù)訓(xùn)練的過程。左邊的 Text Encoder,就是之前提到的文字轉(zhuǎn)換器 Transformer,它把一段文字轉(zhuǎn)換成計(jì)算機(jī)能理解的表達(dá)。右邊的 Image Encoder,也就是視覺轉(zhuǎn)換器 Vision Transformer,把人類理解的視覺圖片轉(zhuǎn)換成計(jì)算機(jī)的數(shù)據(jù)結(jié)構(gòu)。
在經(jīng)過大量的訓(xùn)練之后,這兩者之間產(chǎn)生了具有相關(guān)性的連接,也就是文字和圖片之間的關(guān)系產(chǎn)生了非常強(qiáng)的理解。
虛線之下是生成的過程,把文本放進(jìn) PRIOR 模型里面,從這段文本中生成計(jì)算機(jī)能理解的視覺表達(dá)結(jié)構(gòu),再用 GLIDE 模型生成人類能看懂的圖片。雖然上下兩只小狗的圖片看起來不一樣,但它們本質(zhì)上包含了同樣的文本語義,這樣就實(shí)現(xiàn)了任何一段文本都能生成出一張人類能看懂的圖片。
整個(gè)夢開始的地方,始于 2017 年 Google 發(fā)布的一篇論文《Attention is all you need》。它讓算法學(xué)會了人類的注意力機(jī)制,就是當(dāng)我們?nèi)タ匆粡垐D片時(shí),會看到重點(diǎn),同時(shí)忽略背景的信息。
這篇論文發(fā)表之后,帶來一個(gè) NLP 的模型,叫 Transformer,一經(jīng)發(fā)布便快速屠榜,接著很快有了 BERT 模型,有了 OpenAI 的 GPT-3 模型。在視覺領(lǐng)域,有 DERT 模型,iGPT 模型,以及上面提到的 Vision Transformer。
Transformer 模型的重要性在于,它是我們剛才提到的三個(gè)模型的底座,學(xué)會找出圖片和文字的重點(diǎn),才能夠搭建CLIP 模型,才可能有之上的 PRIOR 和 GLIDE 擴(kuò)散模型。
夢想的實(shí)現(xiàn)還有另一半,圖像生成。
從 2005 年開始的求解特定概率密度函數(shù),通俗理解就是通過最快的方法去估算正態(tài)分布,再到 2008 年的去噪自編碼器的研發(fā),加入高斯噪聲,一種正態(tài)分布的噪聲,再將它去除,我們用到的很多拍照中的去噪、降噪功能就是從這里來的。到了 2011 年,有人嘗試將這兩種算法結(jié)合在一起,2015 年,開始嘗試用這種思想還原照片。但這時(shí)候還原照片的質(zhì)量還不是很高。
時(shí)間撥轉(zhuǎn)到 2019 年,中國的宋飏博士把朗之萬動力學(xué)引入到數(shù)據(jù)分布的估算中,產(chǎn)生了非常好的效果。2020 年,Google 發(fā)布名叫 DDPM 的論文,這篇論文核心就是結(jié)合朗之萬動力學(xué)和擴(kuò)散模型,產(chǎn)生了非常高的圖片生成質(zhì)量。
2014 年引起軒然大波的 GAN network 對抗生成網(wǎng)絡(luò),已經(jīng)能生成出效果不錯(cuò)的圖片,但它的訓(xùn)練難度很高,擴(kuò)散模型降低了圖像生成模型的訓(xùn)練難度,還能生成比 GAN 更多元的圖像。
在夢想實(shí)現(xiàn)的 2021 和 2022 年,OpenAI 和 Google 都開始嘗試把文本信息加入到擴(kuò)散生成的過程中,產(chǎn)生了今天的 GLIDE 模型。OpenAI 在思想上的突破,用 Transformer 去海量地理解圖片和文本,產(chǎn)生了 CLIP 模型,再用擴(kuò)散模型在圖像生成中融入海量的圖文信息,優(yōu)質(zhì)的 AIGC 圖片終于誕生。
接下來,我們將圍繞一些問題進(jìn)行討論:
1、從產(chǎn)品化、商業(yè)化的角度出發(fā)思考,目前 AIGC 的技術(shù)層面的發(fā)展會產(chǎn)生影響?
有兩個(gè)維度。第一個(gè)維度是在海量數(shù)據(jù)中尋找我們最想要的內(nèi)容,第二個(gè)維度是在海量數(shù)據(jù)中得出新的內(nèi)容,反向給予我們創(chuàng)造的靈感。
從 AI 本身的能力再進(jìn)行泛化的話,一方面很多現(xiàn)有產(chǎn)品的使用體驗(yàn)?zāi)艿玫骄薮蟮奶嵘?,例如在筆記類的軟件中加入 AI 后,在寫作過程中能得到更好的體驗(yàn);另一方面,未來創(chuàng)意不強(qiáng),生成能力較弱的人可能會被 AI 替代。
2、回到基本邏輯,我想確認(rèn)下自己的理解是否正確:相較于 Transformer,ChatGPT 并不是在 AI 領(lǐng)域出現(xiàn)了一個(gè)顛覆性的技術(shù)創(chuàng)新,而只是在一個(gè)模式上加了人類的 feedback,設(shè)置了不斷迭代的參數(shù),它自己越搞越聰明了。
過去的所有模型的進(jìn)化,其實(shí)圍繞兩個(gè)方向在進(jìn)化。第一個(gè)是 DNA,第二個(gè)是方法論。DNA 很像真實(shí)世界中材料的研發(fā),方法論更像是真實(shí)世界中材料的使用。
Transformer 是 DNA 的進(jìn)化,是更核心的突破。ChatGPT 是方法論,但它就更簡單了嗎?并不是的,它在探索的過程中經(jīng)歷了很長的時(shí)間,同時(shí)要滿足很多先決條件,這個(gè)方法論才能得以運(yùn)用。不論方法論突破還是 DNA 突破,都很有意義。
3、未來的生意模式會怎么樣?會不會更集中?圍繞這樣 ChatGPT 的模型,它會產(chǎn)生哪些創(chuàng)業(yè)方向?
可能有兩種商業(yè)模式,一種是 To B 的,就跟阿里云一樣,另外一種就是讓開發(fā)者在這種大模型上去 To C。不論是 DNA 還是在方法論上的突破,它都可能讓一個(gè)企業(yè)產(chǎn)生壟斷,產(chǎn)生巨頭效應(yīng)。
ChatGPT 和用戶不斷互動,會得到源源不斷的反饋數(shù)據(jù),數(shù)據(jù)也是一種資產(chǎn),一種生產(chǎn)要素。這種生產(chǎn)要素產(chǎn)生的產(chǎn)品會是人類更高頻使用的東西,它的頻率越高,這種生產(chǎn)要素就越來越重要,反饋能夠創(chuàng)造的要素提升就越來越重要,同時(shí)帶來的經(jīng)濟(jì)價(jià)值就越來越大。
4、會不會有規(guī)模效應(yīng)或雙邊網(wǎng)絡(luò)效應(yīng)?
我覺得背后既有這種網(wǎng)絡(luò)效應(yīng),又有一些規(guī)模效應(yīng)。如果設(shè)想一下,第一個(gè)研發(fā)出來的這種中文大模型,它會快速地獲取市場上有限量的開發(fā)者,開發(fā)者在用它的產(chǎn)品去面向 To C 去獲取 C 端用戶,它的數(shù)據(jù)會源源不斷反饋回來,去優(yōu)化它的效果,其實(shí)就會產(chǎn)生更強(qiáng)的壟斷效應(yīng)。
5、從投資的角度,在 AIGC,我們應(yīng)該投什么樣的團(tuán)隊(duì)?
我覺得傳奇的團(tuán)隊(duì)是有創(chuàng)造 DNA 能力的團(tuán)隊(duì),黃金的團(tuán)隊(duì)是有能力把應(yīng)用層和 AI 完美結(jié)合的能力,白銀的團(tuán)隊(duì)就是打造 AI 領(lǐng)域的基礎(chǔ)設(shè)施的團(tuán)隊(duì)。
最后分享一些我常用的工具,它們對于做投資判斷來說很有重要性,希望可以對你有所幫助。
論文追蹤:https://paperswithcode.com
工程模型追蹤:https://huggingface.co/
AI 項(xiàng)目追蹤:https://theresanaiforthat.com
以上的內(nèi)容如有錯(cuò)誤,歡迎大家進(jìn)行指正。也歡迎你在留言區(qū)留言,與我們交流~
本文來自微信公眾號:真格基金(ID:zhenfund),作者:林惠文(真格投資副總裁)