久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

本文對比LLM訓練邏輯,指出生物基礎(chǔ)模型訓練需優(yōu)先保障數(shù)據(jù)質(zhì)量,而非盲目追求規(guī)模,提出了適配生物數(shù)據(jù)特性的訓練數(shù)據(jù)策略。 ## 1. LLM預訓練的發(fā)展:從規(guī)模優(yōu)先到質(zhì)量重獲重視 早期LLM預訓練遵循“更多數(shù)據(jù)、更多參數(shù)、更強算力”的規(guī)?;肪€,先后誕生了Kaplan定律、Chinchilla定律等縮放規(guī)律,核心共識是“數(shù)據(jù)越多效果越好”。由于人類積累了足夠充沛的高質(zhì)量文本庫,LLM可繞過質(zhì)量與數(shù)量的權(quán)衡,通過基礎(chǔ)過濾即可容忍噪聲,規(guī)模效應能抵消隨機錯誤。 近兩年可公開獲取的高質(zhì)量文本逐漸耗盡,領(lǐng)域開始重新平衡,開發(fā)了DSIR、DoReMi、MATES、質(zhì)量分類器等篩選工具,驗證了更小的高質(zhì)量數(shù)據(jù)集性能可超越更大的參差不齊數(shù)據(jù)集,但這些方法都依賴已有大規(guī)模高質(zhì)量語料作為底盤,跨領(lǐng)域高質(zhì)量數(shù)據(jù)已成為LLM的核心瓶頸。 ## 2. 生物基礎(chǔ)模型為何無法直接套用LLM的數(shù)據(jù)邏輯 與LLM所用文本數(shù)據(jù)不同,公開生物數(shù)據(jù)十分稀疏,且存在四個核心局限,使得“規(guī)模至上”的打法不成立,生物數(shù)據(jù)質(zhì)量需滿足上下文豐富、低噪聲高可復現(xiàn)、多樣性、匹配真實生物學規(guī)律四個維度。 第一,生物數(shù)據(jù)普遍存在上下文匱乏:天然序列僅自帶有限的演化上下文,無法覆蓋藥物研發(fā)所需的結(jié)合親和力、可開發(fā)性等實用信息,復雜生物學過程的關(guān)鍵背景信息需要昂貴的人工實驗標注,同時人類認知的局限性也讓生物數(shù)據(jù)集天然存在偏差與不完整性,分階段預訓練也無法擺脫下游對標注數(shù)據(jù)質(zhì)量的依賴。 第二,生物數(shù)據(jù)噪聲更難處理:文本噪聲多為隨機噪聲,可通過規(guī)模平均抵消,而生物噪聲包含技術(shù)噪聲、系統(tǒng)噪聲和真實生物異質(zhì)性,難以解耦,整合多實驗室數(shù)據(jù)帶來的批次效應會讓模型學到偽影而非真實生物學規(guī)律。 第三,生物數(shù)據(jù)多樣性嚴重不足:現(xiàn)有數(shù)據(jù)集多來自自然樣本,僅占自然存在生物的一小部分,更是所有可能生物多樣性的極小片段,受幸存者偏差、科研資助導向影響,語義多樣性極度匱乏,合成生物數(shù)據(jù)需要濕實驗驗證才能確認真實性,過度依賴易放大模型偏差,僅在模型質(zhì)量達標的特定場景有效。 第四,生物數(shù)據(jù)的底層真實難以驗證:生物學的ground truth必須通過昂貴、緩慢的實驗測定,多數(shù)測量只是實際信號的代理,與臨床終點的相關(guān)性也缺乏明確認知,盲目規(guī)?;鬃屇P驮阱e誤方向上迭代,且很難及時發(fā)現(xiàn)。 ## 3. 給生物基礎(chǔ)模型開發(fā)者的核心建議 生物模型開發(fā)者需建立“高質(zhì)量數(shù)據(jù)生成-準確驗證-真實任務測試”的緊密閉環(huán),并重點關(guān)注三個問題: 數(shù)據(jù)采購要像科學同行評議,除數(shù)據(jù)本身外,還要關(guān)注實驗方案細節(jié)、批次結(jié)構(gòu)、技術(shù)重復處理等元數(shù)據(jù),需要開發(fā)生物學特異性的質(zhì)量過濾、批次校正工具,scVI已在單細胞數(shù)據(jù)領(lǐng)域?qū)崿F(xiàn)了這類應用。 需要將驗證貼近真實應用場景,當前生物基準常和訓練數(shù)據(jù)存在相同批次效應,性能反映的是偽影而非真實能力,未來開發(fā)者會更多自建濕實驗室或深度綁定數(shù)據(jù)生成方,縮短驗證周期,類似LLM領(lǐng)域用真實經(jīng)營結(jié)果驗證智能體,生物模型的終極驗證是藥物研發(fā)的臨床結(jié)果。 要在確認數(shù)據(jù)對下游任務有代表性后再規(guī)?;枰C合考量每個樣本的學習信號、主導噪聲源、時間成本、驗證速度、錯誤代價等要素,100例標注明確臨床終點的病例,效果可能遠好于10000例僅標注弱相關(guān)代理生物標志物的病例,必須從一開始就平衡質(zhì)量與規(guī)模,不能將質(zhì)量留到規(guī)?;笤偬幚?。 ## 4. 給生物數(shù)據(jù)生成者的發(fā)展方向 隨著生物基礎(chǔ)模型對高質(zhì)量數(shù)據(jù)的需求增長,聚焦高質(zhì)量、優(yōu)化交付流程的數(shù)據(jù)生產(chǎn)者將獲得最大競爭優(yōu)勢,核心價值來自三個方向: 第一,打造包含精細標注的完整護城河,除了獨特的篩選平臺或治療生態(tài)位,要投入資源標注從數(shù)據(jù)屬性到實驗操作員的全細節(jié),僅靠平臺技術(shù)很容易被商品化替代,陷入低價競爭。 第二,以可追溯的高質(zhì)量建立行業(yè)聲譽,擁有規(guī)范實驗方案、完整機器可讀元數(shù)據(jù)、嚴格批次控制、充分重復測量、一致注釋質(zhì)量的數(shù)據(jù)生產(chǎn)者會成為可信賴來源,直接轉(zhuǎn)化為定價能力,每一項質(zhì)量提升都會產(chǎn)生復合價值。 第三,從被動供應商轉(zhuǎn)變?yōu)樯疃葢?zhàn)略合作伙伴,當前CRO多為被動響應需求的逐底競爭,數(shù)據(jù)生產(chǎn)者可主動向上游界定能提升模型性能的數(shù)據(jù)集,自建基準證明數(shù)據(jù)價值,隨著模型開發(fā)者更傾向獲取獨家數(shù)據(jù)授權(quán),這種緊密共生關(guān)系能帶來更持久的經(jīng)濟收益。
生物基礎(chǔ)模型(Bio AI Models)訓練數(shù)據(jù)的探討:告別“大力出奇跡”。
2026-06-08 17:10

生物基礎(chǔ)模型(Bio AI Models)訓練數(shù)據(jù)的探討:告別“大力出奇跡”。

本文來自微信公眾號: 范陽 ,編輯:范陽,作者:范陽


前言


Intro


今年人工智能領(lǐng)域最大的趨勢之一,便是前沿實驗室(frontier labs)在由外部合作伙伴生成的專屬訓練數(shù)據(jù)上投入了極其驚人的資金。雖然這些實驗室的支出指標極少公開披露,但可以通過數(shù)據(jù)標注公司自身的數(shù)據(jù)來進行估算。早在2025年6月,該領(lǐng)域最大的兩家巨頭—Surge AI和Scale AI的平均年營收就已分別達到了約10億美元,而這主要正是由前沿實驗室的瘋狂砸錢所驅(qū)動的。


頂級數(shù)據(jù)標注公司的收入。(數(shù)據(jù)來源于公司披露https://www.theinformation.com/articles/little-known-startup-surged-past-scale-ai-without-investors)


推演到更廣泛的數(shù)據(jù)市場,據(jù)估計,各大頂級實驗室每年在向多家數(shù)據(jù)供應商采購專屬數(shù)據(jù)集生成方面的支出高達10億至100億美元。隨著定制數(shù)據(jù)集和強化學習(RL)環(huán)境被牢固確立為提升各學科模型性能的核心加速器,這些數(shù)字似乎還在持續(xù)攀升。


如果將大語言模型(LLM)的提升維度簡化為:(1)獲取相關(guān)的訓練數(shù)據(jù)、(2)模型架構(gòu)的演進,以及(3)算力的增長,那么這種向外部購買數(shù)據(jù)集的趨勢在以下幾個層面上就完全說得通了。


首先,過去幾年里各種數(shù)據(jù)收集工作的疊加(例如Common Crawl對互聯(lián)網(wǎng)數(shù)據(jù)的抓取、以及向出版商購買數(shù)據(jù)授權(quán)),已經(jīng)加速消耗殆盡了所有現(xiàn)存的人類生成文本數(shù)據(jù)。


其次,由于實驗室之間頻繁的人才流動以及對研究的巨大投入,模型架構(gòu)的重大突破往往會隨著時間的推移而走向商品化(同質(zhì)化)(例如Transformer架構(gòu)),這使得架構(gòu)本身很難再成為AI實驗室手中可靠的護城河。


最后,算力瓶頸正越來越多地受到日益增長的模型推理(服務)需求的制約,而不是受限于訓練模型所需的算力(Compute constraints are increasingly governed by growing demand to serve models rather than by the compute needed to train them)。


這種對數(shù)據(jù)的渴求,在編程、金融和電腦操作(Computer Use,指AI替代人類操作電腦)等當下最火熱的應用領(lǐng)域表現(xiàn)得最為普遍。其背后的邏輯相當簡單,而且這套打法似乎屢試不爽:在訓練數(shù)據(jù)中加入更多精選的Python代碼示例,大語言模型(LLM)很可能就會變成一個更優(yōu)秀的軟件工程師。


我越來越多地看到,針對用于訓練生命科學基礎(chǔ)模型的生物數(shù)據(jù)集,人們也在討論相同的趨勢。模型開發(fā)商們正在達成更多的授權(quán)協(xié)議,以獲取與特定任務相關(guān)的數(shù)據(jù)。在訓練數(shù)據(jù)中加入更多高質(zhì)量的抗體親和力測量數(shù)據(jù)(high-quality antibody affinity measurements),生成式蛋白質(zhì)模型就很可能變成一個更優(yōu)秀的蛋白質(zhì)工程師(protein engineer)。


為了滿足這一需求,人們也越來越關(guān)注提升收集這些生物數(shù)據(jù)集的速度和嚴謹性。自動化的生命科學機器人公司現(xiàn)在正將自己標榜為“數(shù)據(jù)代工廠”(Data Foundries),試圖利用這個不斷增長的市場,從而在數(shù)據(jù)收集、模型訓練和模型評估之間構(gòu)建一個閉環(huán)的飛輪。


在收集、買賣生物數(shù)據(jù)以及基于其進行模型訓練的過程中,這些日益增長的機遇也引發(fā)了一些亟待思考的關(guān)鍵問題:為生物基礎(chǔ)模型篩選和訓練數(shù)據(jù)集的正確策略是什么?在用文本數(shù)據(jù)訓練LLM的方法中,有哪些原則是可以移植的,又有哪些是無法通用的?


盡管前沿LLM與生物基礎(chǔ)模型在宏觀層面的市場表現(xiàn)上存在諸多平行相似之處,但它們在數(shù)據(jù)層面有著深刻且微妙的差異,非常值得深入探討。


從數(shù)據(jù)的視角來看,LLM訓練的歷史打法—即一味將重心放在“數(shù)據(jù)規(guī)?!保―ata Scale)上—將無法1:1復制到生物數(shù)據(jù)集上。相反,我認為篩選生物訓練數(shù)據(jù)集需要更加謹慎,必須將數(shù)據(jù)質(zhì)量置于數(shù)量之上,我們應當在陷入“規(guī)模至上”(Scalemaxxing)的陷阱之前,清晰地認識到這一點。



LLM預訓練范式


The LLM pretraining paradigm


在現(xiàn)代大語言模型(LLM)預訓練的早期階段,行業(yè)內(nèi)占據(jù)主導地位的共識是通過“規(guī)模化”(Scale)來提升模型性能。即更多的數(shù)據(jù)、更多的參數(shù)、更強的算力。這具體表現(xiàn)為整個領(lǐng)域耗費了大量時間去推演和列舉“預訓練縮放定律”(Scaling Laws)——即模型性能的提升幅度,是如何作為數(shù)據(jù)量、模型大小、算力等變量的函數(shù)(斜率)而變化的。關(guān)于這一主題,我們在之前的一篇我們的研究雜志《Dimension Research》文章中曾進行過深入的探討。


注:Pretraining:The First Scaling Frontier


https://research.dimensioncap.com/p/pretraining-the-first-scaling-frontier


2020年,OpenAI的Kaplan等人發(fā)表了一些最初的預訓練規(guī)模定律,表明在固定的計算預算下,以比數(shù)據(jù)(token數(shù))更快的速度增加模型規(guī)模(參數(shù)數(shù)量)可以獲得最優(yōu)性能。2022年,DeepMind的Hoffmann等人發(fā)表了“Chinchilla”規(guī)模定律,指出基于Kaplan定律的模型訓練不足,使用更多數(shù)據(jù)訓練較小的模型(約每個參數(shù)對應20個token)可以獲得更好的模型性能。大約兩年后,Databricks的Sardana等人發(fā)表了對Chinchilla規(guī)模定律的修正,將推理需求納入考量。在固定的計算預算下,為了達到期望的性能,使用越來越多的數(shù)據(jù)(每個參數(shù)對應約200至10,000個token)來訓練較小的模型在經(jīng)濟上更為劃算,因為對于客戶而言,提供較小的模型進行服務最終成本更低(it’s more economical to train smaller models with increasingly more data(~200-10,000 tokens per parameter)to achieve a desired performance because serving smaller models is ultimately cheaper for customers)。


那段早期探索所帶來的核心啟示,恐怕早已深深烙印在許多AI研究者的腦海中:“數(shù)據(jù)越多,效果越好?!痹诋敃r,規(guī)??梢詢?yōu)先于數(shù)據(jù)質(zhì)量,這是因為人類花了幾個世紀的時間積累了一個龐大的高質(zhì)量文本庫(例如互聯(lián)網(wǎng)片段、已發(fā)表的文獻),而LLM幾乎是免費繼承了這份遺產(chǎn)。它們從一開始就能繞過數(shù)據(jù)質(zhì)量與數(shù)量之間固有的權(quán)衡取舍(They were originally able to sidestep the canonical trade-off between data quality and quantity),因為這份繼承下來的數(shù)據(jù)集在兩個維度上都足夠充沛,足以支撐起實用的模型性能。


研究人員可以一邊利用規(guī)模效應,一邊使用高層級的過濾手段(如去重、去污染、早期的質(zhì)量分類器)來剔除低質(zhì)量的樣本。由于文本數(shù)據(jù)具有高度的冗余性,噪聲也因此得到了進一步的容忍,這意味著在已有的龐大分布規(guī)模下,隨機錯誤和前后矛盾可以被自動平均、相互抵消(so random errors and contradictions average out at the scale we already had)。而一旦模型能夠自主生成高質(zhì)量的合成數(shù)據(jù),這種權(quán)衡的難度就更進一步降低了。


不過在過去兩年中,整個領(lǐng)域已經(jīng)開始看到這套打法的重新平衡。隨著可用數(shù)據(jù)的消耗殆盡,對高質(zhì)量數(shù)據(jù)集的重視,成為了預訓練階段另一個可供撬動的重要杠桿,研究人員也開始開發(fā)更加激進的數(shù)據(jù)優(yōu)先級篩選工具(more aggressive data prioritization tools),以便在兼顧規(guī)模的同時實現(xiàn)這一目標:


1.基于重要性重采樣的數(shù)據(jù)選擇(Data Selection with Importance Resampling,DSIR):從一個龐大的數(shù)據(jù)集中,定義出一小部分高質(zhì)量數(shù)據(jù)的子集。然后,在整個數(shù)據(jù)集更廣泛的分布中去對這種“高質(zhì)量特征”進行采樣,從而把所有其他潛在的高質(zhì)量樣本都撈出來。


2.基于極大極小優(yōu)化的領(lǐng)域重新配比(Domain Reweighting with Minimax Optimization,DoReMi):訓練一些小模型,并讓它們使用不同配比的數(shù)據(jù)類型(例如50%通識、25%編程、15%科學、10%推理軌跡),以此來尋找性能表現(xiàn)最佳的數(shù)據(jù)分布。一旦找到最優(yōu)組合,再將這種分布配比放大應用到大模型上。


3.基于數(shù)據(jù)影響力模型的模型感知數(shù)據(jù)選擇(Model-Aware Data Selection with Data Influence Models,MATES):訓練一個小型的“數(shù)據(jù)影響力模型”(data influence model),它能夠動態(tài)地為大模型預訓練的各個階段篩選出最有效的數(shù)據(jù),從而優(yōu)化模型接觸數(shù)據(jù)的先后順序。


4.質(zhì)量分類器(Quality Classifiers)(FineWeb、DCLM、Nemotron-CC):訓練獨立的分類器模型,根據(jù)用戶定義的指標對數(shù)據(jù)質(zhì)量進行評分,并過濾掉任何達不到質(zhì)量閾值的內(nèi)容。更小但質(zhì)量更高的數(shù)據(jù)集,其性能甚至可以超越質(zhì)量參差不齊的更大規(guī)模數(shù)據(jù)集(例如,一個7B的DCLM模型在訓練數(shù)據(jù)量減少約6倍的情況下,其性能表現(xiàn)與8B的Llama 3相當)。


(A)利用質(zhì)量分類器模型進行過濾,從原始的Common Crawl數(shù)據(jù)源中構(gòu)建DCLM訓練數(shù)據(jù)集。(B)基于過濾后的DCLM-Baseline數(shù)據(jù)集訓練的模型,其性能超越了那些擁有更大訓練預算(數(shù)據(jù)量)的模型。(插圖改編自:https://arxiv.org/abs/2406.11794)


這些方法無一不彰顯出數(shù)據(jù)質(zhì)量對大語言模型(LLM)而言那重獲新生的重要性。然而,它們之中的絕大多數(shù)都嚴重依賴一個前提:必須先有一個龐大的、定義清晰且高質(zhì)量的現(xiàn)有語料庫作為過濾的底盤。這對幾年前的LLM來說不是問題,但如今,我們幾乎已經(jīng)把現(xiàn)有數(shù)據(jù)中能榨取的價值給“薅得一干二凈”(milking nearly everything we can)了。


前沿實驗室在特定應用數(shù)據(jù)上的巨額支出進一步證明,跨領(lǐng)域的高質(zhì)量數(shù)據(jù)集已成為一個主要瓶頸(The huge spending from frontier labs on application-specific data is further evidence that quality datasets across domains have become a major bottleneck)。


值得慶幸的是,對于如何普遍應對更進一步的數(shù)據(jù)收集,我們手中已經(jīng)有了一套相當不錯的“通關(guān)秘籍”(recipe)。在許多我們關(guān)注的領(lǐng)域中,驗證數(shù)據(jù)質(zhì)量及其關(guān)聯(lián)的基準測試(benchmarks)相對容易(例如:編寫的代碼能輸出正確的結(jié)果;數(shù)學分析能推導出正確的閉式解;關(guān)于網(wǎng)球歷史的報告符合事實且可供人類理解)。我們甚至可以對上述部分質(zhì)量過濾工具進行改造并加以利用,從而在向外部采購新型數(shù)據(jù)時,能夠分清輕重緩急。


然而遺憾的是,這套適用于LLMs的數(shù)據(jù)框架,并無法直接平移到生物學的世界里(this data framework for LLMs does not directly port to the world of biology)。


為什么生物學不適用這套做法


Why biology breaks this playbook


生物基礎(chǔ)模型(Biological foundation models)正在眾多子領(lǐng)域和應用場景中突飛猛進。在分子生物學領(lǐng)域的模型(Biomolecular models)正在實現(xiàn)生成全長、高親和力單克隆抗體的計算機端(in silico)設(shè)計與生成。



在基因組基礎(chǔ)模型(genomic foundation models)方面,AI已經(jīng)開始預測變異效應(variant effects)并設(shè)計出逼真的DNA序列;而在組織層面的世界模型(tissue-level world models)開發(fā)上,科學家們正致力于預測空間蛋白質(zhì)表達以及患者的藥物反應(predict spatial protein expression and patient drug responses)。




這些成就部分可以追溯到過去幾年深度學習和大型語言模型的突破。許多最初受文本模型啟發(fā)的架構(gòu)和規(guī)模直覺,隨后被應用于公共的生物數(shù)據(jù)(Many initial architectures and scaling intuitions inspired by text models were subsequently applied to public biological data)。


但只有當數(shù)據(jù)經(jīng)過良好整理時,這套做法才能真正奏效。典型的例子是AlphaFold,它展示了在蛋白質(zhì)數(shù)據(jù)銀行(Protein Data Bank,PDB)—一個經(jīng)過數(shù)十年整理的、包含約20萬個蛋白質(zhì)結(jié)構(gòu)的高質(zhì)量實驗數(shù)據(jù)集—上進行預訓練,如何能在結(jié)構(gòu)預測中帶來驚人的性能。



但PDB更多是一個特例,而非普遍現(xiàn)象。與用于訓練前沿LLM的文本數(shù)據(jù)截然不同,我們目前可以公開獲取的生物數(shù)據(jù)要稀疏得多,并且飽受幾種獨特而顯著的局限性困擾,這使得它們很難直接用于模型訓練。因此,訓練高性能的生物基礎(chǔ)模型通常需要合成新的數(shù)據(jù),而(生物)前沿實驗室正開始探索類似于我們在大型語言模型領(lǐng)域看到的那種數(shù)據(jù)采購策略(data procurement strategy)來獲取這些數(shù)據(jù)。


在這樣一個世界里,針對給定的應用場景,生成什么樣的訓練數(shù)據(jù)才是最有效的?我們在生物數(shù)據(jù)收集上的底層哲學應該是什么(What should be our philosophy on biological data collection)?在生命科學中,當規(guī)模與質(zhì)量之間的權(quán)衡取舍(trade-off)變得更加赤裸和尖銳時,我們該如何恰當?shù)仄胶鈨烧撸?/p>


回答這些問題,需要對何謂“高質(zhì)量”給出一個更正式的定義,并理解現(xiàn)有生物數(shù)據(jù)集相比于文本訓練數(shù)據(jù)究竟存在哪些局限。在這里,我將生物數(shù)據(jù)的“質(zhì)量”定義為四個核心維度:(1)富含上下文信息(context-rich)、(2)干凈(即低噪聲且高可復現(xiàn)性)、(3)多樣性,以及(4)為了探尋底層真實情況(ground truth)而量身定制(purpose-built)。


上下文的匱乏


Context Scarcity


想要與幾乎整個人類有記錄的歷史規(guī)模相抗衡,確實是一件難事。據(jù)公開披露的指標,一些體量最大的大語言模型(LLM)在經(jīng)過過濾后,其訓練數(shù)據(jù)量依然高達數(shù)十萬億個Token。


但我在這里的核心論點,并不僅僅是“我們擁有的文本數(shù)據(jù)比生物數(shù)據(jù)多”。事實上,我們手頭現(xiàn)存的生物數(shù)據(jù)量已經(jīng)相當可觀——包含了數(shù)十萬億個核苷酸堿基(nucleotide bases)、數(shù)億條蛋白質(zhì)序列、數(shù)億個單細胞轉(zhuǎn)錄組圖譜(single-cell transcriptomic profiles),以及數(shù)十萬個通過實驗測定的蛋白質(zhì)結(jié)構(gòu)。


過去十年間,頂尖人工智能模型的訓練數(shù)據(jù)集規(guī)模顯著增長。(數(shù)據(jù)來源:https://epoch.ai/data/ai-models)


過去十年間,單細胞RNA測序數(shù)據(jù)集的大小(細胞數(shù)量)已顯著增長。

https://huggingface.co/datasets/tahoebio/Tahoe-100M/blob/main/README.md


文本數(shù)據(jù)與生物數(shù)據(jù)之間更重要的區(qū)別在于上下文的匱乏。


對于文本數(shù)據(jù),相關(guān)的上下文已經(jīng)內(nèi)置于語言之中—句子結(jié)構(gòu)、文檔組織、來回對話、邏輯性的話題解釋。所有這些內(nèi)容,無需額外進行繁重的標注,即可被人類和機器直接讀取。這對于通過“預測下一個Token”(next-token prediction)來進行的自監(jiān)督預訓練尤為重要,在這種模式下,研究人員追求的是最大化每個Token所蘊含的學習信號。例如,當你將句子中的下一個單詞遮蔽時,前面的詞匯和句子結(jié)構(gòu)就會自然而然地提供相關(guān)的上下文,以此來預測缺失的內(nèi)容。


某些類型的生物數(shù)據(jù),如蛋白質(zhì)或DNA序列,具有與文本數(shù)據(jù)類似的內(nèi)置上下文。例如,相鄰的殘基(residues)會限制某些特定基序(motif)中可能出現(xiàn)的氨基酸。我們甚至可以使用類似的掩碼語言模型(masked language modeling)方法來學習生物序列中的這些模式,并預測缺失的氨基酸。


這種方法之所以如此有效,原因之一在于蛋白質(zhì)和DNA序列中蘊含著天然的的演化上下文(evolutionary context)。我們可以通過多序列比對(Multiple Sequence Alignment,MSA)等技術(shù)將其提取出來,從而獲得更強的預測能力。當你要預測的生物學特性恰好也是自然演化所篩選的特性時,這種方法會非常靈驗。例如,一個殘基之所以常常在演化中被保留(保守殘基),通常是因為它與蛋白質(zhì)的功能密切相關(guān)。因此,一個學到了廣泛序列分布規(guī)律的模型,在理論上即使不針對特定的標簽樣本進行訓練,也能預測出某種突變是否會導致功能的喪失(so a model that learns a broad sequence distribution could theoretically predict whether a mutation results in loss of function without training on a specific labeled example)。


蛋白質(zhì)序列的多序列比對可以識別出保守和共進化的殘基,這些殘基包含了關(guān)于蛋白質(zhì)結(jié)構(gòu)和功能的有用信息。


然而,演化信號(evolutionary signal)是有限的,如果我們將其作為唯一依賴的上下文,就面臨著誤讀它的風險。例如,它無法完全體現(xiàn)自然演化中所有失敗的嘗試(例如胚胎致死性突變),也無法涵蓋那些已經(jīng)滅絕、或因為缺乏數(shù)據(jù)而未被充分采樣(under-sampled)的生物體。此外,它還默認了一個前提,即“序列的保守性或協(xié)同變異(co-variation)就意味著重要性”,但這在科學上并不是絕對成立的。


或許最重要的一點在于,僅憑天然蛋白質(zhì)序列帶來的演化信號,并不能包含其他與藥物研發(fā)(drug discovery)密切相關(guān)的實用上下文。比如:全新的蛋白質(zhì)功能、與合成靶點之間的結(jié)合親和力(binding affinities)、翻譯后化學修飾(post-translational chemical modifications)、跨非靶點的選擇性(selectivity across off-targets),或者是藥物的可開發(fā)性(developability)特征。當我們在對細胞表型(cell phenotypes)等更復雜的生物學過程進行建模時,現(xiàn)有的數(shù)據(jù)集中,相關(guān)的上下文信息—如細胞基因型、環(huán)境條件以及實驗方案層面的具體細節(jié)(protocol-level details)—就會變得更加匱乏。


上述所有缺失的上下文都存在于物理世界中,我們必須通過實驗費力地測量它們,并使用這些測量結(jié)果來標注數(shù)據(jù)。此外,生成高質(zhì)量、帶標注的生物數(shù)據(jù)通常非常昂貴,并且對分析方法的設(shè)計和執(zhí)行有著很高的要求,這可能成為非專業(yè)人士面臨的重大障礙。對于濕實驗科學家(wet-lab scientists)來說,成本、時間、質(zhì)量和數(shù)量之間的權(quán)衡始終存在。


UniProt數(shù)據(jù)庫中包含的、與生物基礎(chǔ)模型訓練數(shù)據(jù)相關(guān)的一小部分蛋白質(zhì)序列注釋。(https://www.uniprot.org/)


在這背后,還隱藏著另一個與之相關(guān)的底層問題。生物學的上下文完全受限于我們已經(jīng)觀察到和/或發(fā)現(xiàn)的內(nèi)容,這從一開始就埋下了人類視角偏見的種子(Biological context is limited to whatever we’ve already observed and/or discovered,which bakes in bias from the start)。


因此,所有的生物數(shù)據(jù)集本質(zhì)上都是不完整的(all biological datasets are incomplete)。人類可能還沒有開發(fā)出測量那些缺失上下文的技術(shù),甚至從一開始就根本無法理解哪些背景信息才是真正需要被標注的相關(guān)上下文。新的科學發(fā)現(xiàn)正在不斷重塑我們對生物學的認知,并影響著我們優(yōu)先去測定哪些上下文—比如,人類意識到實體瘤微生物組(solid tumor microbiomes)的多樣性及其深遠影響;發(fā)現(xiàn)RNA可以被糖基化(glycosylated)從而影響其定位與功能;亦或是人類基因組首次完成端到端(T2T)全序列測序,糾正了以往參考基因組中的錯誤,并引入了此前從未被納入計算的約2億個新堿基對。


分階段預訓練(Staged pretraining)是該領(lǐng)域試圖兼顧兩者優(yōu)勢、并部分彌補生物學上下文匱乏的方法。ESM系列模型就是一個極佳的范例:首先,在龐大的無標注蛋白質(zhì)序列數(shù)據(jù)集上進行自監(jiān)督預訓練,利用其固有的演化信號生成強大的基礎(chǔ)嵌入(base embeddings);隨后,在較小但標注精細的數(shù)據(jù)集上進行序列微調(diào)(sequential fine-tuning),從而注入面向特定應用場景的性能。雖然這種方法比單獨使用帶標簽的數(shù)據(jù)進行訓練更高效,但其下游性能仍然嚴重依賴于用于微調(diào)的注釋數(shù)據(jù)的質(zhì)量和上下文完整性。


噪聲


Noise


即使我們能夠整理出一個完全標注、具備上下文感知能力的數(shù)據(jù)集,生物數(shù)據(jù)本質(zhì)上仍然充滿噪聲,真實的訓練信號可能很難被干凈地提取出來。


你可能會想,從噪聲中尋找信號正是深度學習擅長的事情。從很多方面來說,你是對的。在混亂的網(wǎng)絡(luò)數(shù)據(jù)上訓練的模型,仍然能學習到流暢的語法和廣泛的世界知識,因為文本是冗余的,其噪聲大多是隨機的且不相關(guān),因此大量噪聲會在規(guī)模擴大時被平均掉了。


生物噪聲則復雜得多。它有多種形式,而且往往無法解耦(deconvolve)。這一點很重要,因為某些這種“噪聲”實際上是在扮演有用信號的角色,我們希望可靠地捕捉并學習它(some of this“noise”is actually moonlighting as useful signal that we want to reliably capture and learn from)。例如,生命科學研究中的一個核心挑戰(zhàn)是:在接納生物“噪聲”(如患者間的異質(zhì)性或腫瘤中的亞克隆多樣性)的同時,減少技術(shù)噪聲(technical noise)(如低計數(shù)測量中的散粒噪聲或動態(tài)范圍有限的代理讀數(shù))和系統(tǒng)噪聲(systematic noise)(如用戶間的批次效應或不同實驗室累積的方案差異)。


分離這些主要的變異來源,使我們能夠更真實地代表生物樣本的多樣性,這對于現(xiàn)實世界的藥物發(fā)現(xiàn)任務(如預測不同患者群體的治療反應)至關(guān)重要。舉個具體的例子,我?guī)啄昵皩戇^一篇綜述文章,主題正是關(guān)于使用類器官真實模擬人類腫瘤樣本這一具體問題。


問題在于,我們在生物學中的所有測量都會引入技術(shù)噪聲和系統(tǒng)噪聲,其中一些我們了解得較少。通常,這些噪聲信號的強度足以掩蓋實際的生物信號,使其極易受到意外偏差的影響。幸運的是,技術(shù)噪聲在規(guī)模擴大時更容易被平均掉,但系統(tǒng)噪聲則不然。模型最終可能會將某些細胞表型與產(chǎn)生數(shù)據(jù)的實驗室、使用的儀器、甚至樣本是在孔板邊緣還是中心相關(guān)聯(lián),而不是學習真正區(qū)分它們的底層生物學特性。


例如,為訓練生物基礎(chǔ)模型而收集足夠的數(shù)據(jù),通常意味著將不同實驗室的相關(guān)數(shù)據(jù)集整理到一個集中的公共數(shù)據(jù)庫中(例如,用于細胞表達數(shù)據(jù)的CELLxGENE,用于分子生物活性的ChEMBL)。由于系統(tǒng)噪聲的存在,存在相當大的批次效應,這些效應會被融入模型對生物學的表征中;如果我們不小心,更多的數(shù)據(jù)可能會使這個問題更加突出。


語言數(shù)據(jù)與單細胞數(shù)據(jù)的比較特征。MLM:掩碼語言建模;CLM:因果語言建模;NLP:自然語言處理。來源:

https://www.biorxiv.org/content/10.64898/2025.12.19.695371v1


甚至有一項研究發(fā)現(xiàn),他們僅憑ChEMBL數(shù)據(jù)庫中的結(jié)構(gòu)數(shù)據(jù),就能訓練出一個分類器模型來預測是由哪位化學家合成了該分子。這是因為不同的實驗室往往會圍繞特定的特征支架(scaffolds)開展研究,從而在它們制造的分子中留下了可被識別的獨特印記。作者隨后表明,僅靠“化學家身份”這一個變量,對分子生物活性的預測準確度,就幾乎與包含完整結(jié)構(gòu)信息的模型不相上下。這有力地表明,模型完全可以學會通過這種方式來“作弊”,從而在沒有真正理解核心“結(jié)構(gòu)-活性關(guān)系”(SAR,Structure-Activity Relationship)的情況下,就能猜出分子的活性。



相比之下,用于生成和收集文本數(shù)據(jù)的技術(shù)近乎完美。我們可以聘請世界專家就新的主題領(lǐng)域撰寫報告,并使用網(wǎng)絡(luò)爬蟲工具提取現(xiàn)有的數(shù)字化文本。我們甚至擁有像自動更正和拼寫檢查這樣無處不在的工具,能在數(shù)據(jù)集進入訓練運行之前就實時對其去噪。此外,我上面提到的文本數(shù)據(jù)篩選工具依賴于已經(jīng)包含高質(zhì)量數(shù)據(jù)的現(xiàn)有大型數(shù)據(jù)集,而這在生物學領(lǐng)域并不總是成立。


多樣性


Diversity


當面對其訓練數(shù)據(jù)集分布內(nèi)(in-distribution)的任務時,目前的AI模型表現(xiàn)確實異常出色;然而,一旦要求模型泛化到這種分布之外,其性能就會顯著下降。因此,各領(lǐng)域的一個主要工作方向就是擴大訓練數(shù)據(jù)的多樣性,從而將盡可能多的相關(guān)樣本納入到分布之內(nèi)。


但數(shù)據(jù)多樣性并不僅僅指一件事。。它(粗略地)可以由兩個主要的子維度來代表:樣式多樣性(stylistic diversity)和語義多樣性(semantic diversity)。


對于文本數(shù)據(jù)而言,樣式多樣性是相同的基礎(chǔ)內(nèi)容以不同的方式表達—同一事實以隨意、正式、跨語言、冗長或簡潔的方式呈現(xiàn)。另一方面,語義多樣性描述的是基礎(chǔ)內(nèi)容擴展了數(shù)據(jù)集所代表的核心信息—不同主題下的不同事實(when the underlying content expands the core information represented by the dataset—different facts across different topics)。前者能確保模型是可引導的(steerable),不會死板地陷于某一種文章寫作風格或某一種特定的問題解法中;而后者則確保了模型能夠在更廣泛的子領(lǐng)域中都有良好的表現(xiàn)。


這些分類也大致適用于生物數(shù)據(jù):


生物學中的樣式多樣性:類似于用不同的方式去測定相同的生物學輸出—比如在兩個不同的實驗室里測定相同的結(jié)合親和力,或者分別利用X射線晶體學(crystallography)和冷凍電鏡(cryo-EM)來測定同一種蛋白質(zhì)結(jié)構(gòu)。


生物學中的語義多樣性:則通過測定完全全新的生物學特性或標注來擴展數(shù)據(jù)分布(Semantic diversity expands the data distribution by measuring completely new biology or annotations)—比如全新的蛋白質(zhì)序列或功能屬性(new protein sequences or functional attributes)。


與前文關(guān)于上下文匱乏的論點類似,我們目前數(shù)據(jù)集中所具備的生物學多樣性,遠比文本數(shù)據(jù)要匱乏得多。如果處理不當,這兩個子維度將會給生物模型的推進帶來各自獨特的風險。


例如,生物學中的樣式多樣性是一把雙刃劍。如果處理得當,增加跨實驗方案(protocols)或跨技術(shù)收集的數(shù)據(jù)多樣性,可能會提供有益的信號,從而讓底層模型對變異具備更強的魯棒性。但如果我們不夠謹慎,樣式多樣性就會與生物學噪聲形成特有的交織纏繞,并冒著引入批次效應(batch effects)的風險,這反而會削弱模型的泛化能力。


而由于以下幾個原因,現(xiàn)有數(shù)據(jù)集中的語義多樣性同樣一直處于匱乏狀態(tài):


我們許多體量最大的生物數(shù)據(jù)集都是從自然界存在的生物樣本中挖掘出來的(Many of our largest biological datasets are mined from biological samples that occur naturally)(例如UniProt中的蛋白質(zhì)序列、PDB中的蛋白質(zhì)結(jié)構(gòu)、GenBank中的基因組)。由于實際操作的原因,這些生物數(shù)據(jù)集仍然只代表了自然存在的一小部分,而自然存在本身又只是所有可能客觀存在的生物多樣性中非常小的一部分(these datasets still only represent a small slice of what naturally exists,which in itself is a very small slice of all possible biological diversity)。自然演化受限于幸存者偏差(survivorship bias),并未對所有可能的設(shè)計進行采樣。


這在生成式蛋白質(zhì)設(shè)計(generative protein design)等領(lǐng)域演變成了一種制約,因為許多我們想要研發(fā)的藥物分子,其結(jié)構(gòu)可能與自然界中發(fā)生過的任何東西都毫無相似之處(many drugs we want to develop may look nothing like what has occurred naturally)。


此圖直觀地展示了與總可能序列空間相比,經(jīng)實驗解出和計算預測的蛋白質(zhì)結(jié)構(gòu)以及已測序蛋白質(zhì)的數(shù)量相對較少。其中,“已測序”類別是根據(jù)UniProt和宏基因組目錄估算得出的?!袄碚摗鳖悇e以100個氨基酸的序列為邊界,代表了使用天然氨基酸所能達到的總搜索空間的上限。


除了自然演化帶來的偏差(evolutionary bias)之外,我們目前生物數(shù)據(jù)集的多樣性還受到科學興趣,以及哪些項目能獲得資金資助的嚴重偏置(scientific interest and what’s fundable)。人們在篩選和治理數(shù)據(jù)時,往往是為了試圖回答非常具體的生物學假設(shè),而不是為了給未來訓練機器學習模型做儲備(Data is often curated in an attempt to answer very specific biological hypotheses,rather than to future-proof for training ML models)。


合成數(shù)據(jù)生成(Synthetic data generation)是目前正在探索的、用以彌補數(shù)據(jù)多樣性不足的領(lǐng)域之一。其理念是,當模型的輸出達到高質(zhì)量時,這些輸出就可以用于生成其自身的訓練數(shù)據(jù)。Meta公司最近的一項研究發(fā)現(xiàn),用合成文本補充真實訓練數(shù)據(jù),其效果可以匹配甚至提升僅在真實數(shù)據(jù)上訓練的大型語言模型的性能。



但這是一條危險的道路。合成數(shù)據(jù)的質(zhì)量必須很高,并且過度依賴合成數(shù)據(jù)集可能導致模型坍塌,即性能顯著下降。


驗證損失(Validation loss)與訓練數(shù)據(jù)預算(數(shù)據(jù)量)的關(guān)系,對比了真實網(wǎng)絡(luò)數(shù)據(jù)(Common Crawl)與兩種合成數(shù)據(jù):(1)將真實網(wǎng)絡(luò)數(shù)據(jù)改寫(Rephrased)為更高質(zhì)量格式的文本(HQ和QA),以及(2)從頭開始生成的文本(Generated Textbook)。圖中展示了每種數(shù)據(jù)集單獨訓練以及與真實數(shù)據(jù)按不同比例混合訓練的結(jié)果。結(jié)果表明,基于真實文本改寫的合成數(shù)據(jù),其表現(xiàn)與真實數(shù)據(jù)基線持平甚至更優(yōu);而從頭開始生成的文本,其所占權(quán)重越高,模型表現(xiàn)就越差。這說明合成數(shù)據(jù)在錨定(依附于)真實數(shù)據(jù)時是有幫助的,但如果脫離了真實數(shù)據(jù),則會導致性能退化。(https://arxiv.org/abs/2510.01631v1)


正如你所料,合成文本與合成生物數(shù)據(jù)當前的效益開始出現(xiàn)分歧。


對于寫作等任務,合成生成的文本可以提供有價值的訓練信號,并且只要讀起來大致合理,它在本質(zhì)上就是“正確”的。人類(甚至大型語言模型本身)通常僅通過閱讀就能很容易地判斷合成文本的質(zhì)量是好是壞。


而對于驗證本身就極為困難的生物學來說,合成生物數(shù)據(jù)只有在與實驗室的實驗結(jié)果相符時才是“正確”且有意義的。我們可以輕松地使用生成模型設(shè)計出數(shù)百萬個看似合理的蛋白質(zhì)結(jié)構(gòu),但它們的真實功能或結(jié)合親和力在實驗室中實際測量之前仍然是未知的。任何生成的合成標簽都只會繼承生成它們的模型的偏差或批次效應;如果沒有持續(xù)的驗證,你就有可能是在使用有缺陷模型的偽影(artifacts)而非真實的生物信號上進行訓練。


當然,在一些非常特定的生物學應用中,我們已經(jīng)看到了合成數(shù)據(jù)生成所取得的早期成功。例如,AlphaFold 2在訓練中引入了“自蒸餾”(self-distilled)的合成數(shù)據(jù),這些數(shù)據(jù)是基于PDB數(shù)據(jù)庫中并不存在的未知序列生成的,從而成功提升了模型在這片外擴序列空間上的預測性能。這一策略之所以能奏效,是因為AlphaFold 2的結(jié)構(gòu)預測結(jié)果已經(jīng)達到了足以用于訓練的“質(zhì)量門檻”(quality bar),并且在需要時,人們有一套清晰明確的方法可以在濕實驗室(wet lab)中對這些結(jié)構(gòu)預測進行交叉驗證。


底層真實


Ground truth


這最后一個質(zhì)量指標是直接建立在前三個指標之上的。即便擁有了豐富的上下文、干凈的信號和多樣化的數(shù)據(jù),生物學在本質(zhì)上依然極其復雜,而且驗證其底層真實(ground truth)往往異常困難。


在任何領(lǐng)域中,可靠的輸出驗證都是完成數(shù)據(jù)反饋閉環(huán)(data feedback loop)、并通過強化學習(reinforcement learning)來提升模型性能的核心機制。正如我開頭所提到的,像編程這樣的領(lǐng)域往往原生自帶驗證機制(fields like coding often have verification baked in),這也是為什么編程智能體(coding agents)在過去一年的性能表現(xiàn)呈指數(shù)級增長的核心原因。


然而在生物學中,底層真實情況必須通過實驗手段來測定,這比執(zhí)行一段代碼要昂貴、復雜且耗時得多。這些測量結(jié)果也常常是我們試圖記錄的實際信號的代理(例如,用光子來測量熒光標記蛋白質(zhì)的表達),而且這些信號通常只在很小的動態(tài)范圍窗口內(nèi)呈線性(these signals are usually only linear in small windows of dynamic range)。同時,在藥物研發(fā)的應用場景中,我們對于這些測量結(jié)果對“人類臨床療效”的正向預測值(positive predictive value)到底有多少,也缺乏真正透徹的理解。


這些局限性促使該領(lǐng)域創(chuàng)造性地思考生物數(shù)據(jù)的規(guī)模化應該是什么樣子(to think creatively about what scaling biological data should look like)。最近一篇關(guān)于黑箱數(shù)據(jù)擴展的論文,為未來的框架提出了幾個令人信服的觀點。在該論文中,作者認為,我們不能依賴數(shù)據(jù)集的人類可讀性或啟發(fā)式方法,來達到訓練高性能生物基礎(chǔ)模型所需的規(guī)模。相反,數(shù)據(jù)源需要針對“機器消費而非人類直覺”進行優(yōu)化(data sources need to be optimized for“machine consumption rather than human intuition”)。



白盒數(shù)據(jù)與黑盒數(shù)據(jù)的對比。黑盒數(shù)據(jù)通過提升計算處理的復雜度,以犧牲可解釋性為代價,換取了更高的數(shù)據(jù)吞吐量。

https://pubs.rsc.org/en/content/articlelanding/2026/sc/d6sc01189f


盡管我在這篇文章中采用了這樣的敘述框架,但我認為我們最終仍會逐漸接納這一(黑盒規(guī)?;┑讓诱軐W。不過我的核心論點是:在此之前,我們必須保持平衡,同樣將重點放在建立一套能夠最大化數(shù)據(jù)質(zhì)量與生物學理解的“行動指南”(playbook)上。


一個極具代表性的例子,便是近年來興起的、基于轉(zhuǎn)錄組學數(shù)據(jù)訓練以預測細胞對擾動(perturbations)反應的“虛擬細胞”(virtual cell)模型。


這些模型的訓練數(shù)據(jù)通常局限在一個極窄的永生化癌細胞系(immortalized cancer cell lines)范圍內(nèi),向特定的組織類型嚴重傾斜,且僅僅捕捉了單一點的時間戳快照表達數(shù)據(jù);不僅如此,它們還將來自不同實驗方案、具備不同測序深度和噪聲特征的單細胞測序結(jié)果生硬地拼接在了一起。盡管這些數(shù)據(jù)集涵蓋了高達近1億個細胞的龐大體量,但多項獨立的基準測試表明,在與藥物研發(fā)最緊密相關(guān)的下游任務中,這些模型的表現(xiàn)依然難以超越一些簡單得多的傳統(tǒng)方法。




我的目的絕非粗暴地將整個子領(lǐng)域全盤否定。事實上,不同的虛擬細胞模型所使用的數(shù)據(jù)類型各不相同,且在推動這些模型向前發(fā)展的過程中,已經(jīng)沉淀了大量重要的基礎(chǔ)設(shè)施與前沿探索。但這個例子是一個有益的提醒:數(shù)據(jù)數(shù)量的規(guī)模化(scaling)往往會跑贏數(shù)據(jù)質(zhì)量的規(guī)?;?,而數(shù)據(jù)中的偏見(biases)與上下文的斷層(gaps in context),常常會以模型自身無法察覺的方式死死地烙印在模型之中。因此,如果沒有適當?shù)尿炞C、生物學洞察力或質(zhì)量控制,過快地進行規(guī)模化可能導致我們在渾然不覺的情況下,將黑盒模型向著“錯誤的方向”規(guī)?;?。而且,考慮到生物學中驗證循環(huán)的速度之慢,我們可能需要很長時間才能意識到這一點。


這對模型開發(fā)者和數(shù)據(jù)生成者的意義


What this means for model developers and data generators


上述四個方面的分析表明,與處理文本數(shù)據(jù)相比,收集和訓練生物數(shù)據(jù)需要一套經(jīng)過修正的方法。只追求規(guī)模而不密切關(guān)注質(zhì)量,是無法實現(xiàn)目標的。我們需要在以下三者之間建立一個緊密的閉環(huán):生成高質(zhì)量、與任務相關(guān)的訓練數(shù)據(jù)的方法;能夠準確驗證這些數(shù)據(jù)的評估體系;以及在生命科學領(lǐng)域真實任務中接受測試的模型(a tight loop between methods for generating high-quality,task-relevant training data,evals that can accurately validate that data,and models tested against real-world tasks across the life sciences)。理想情況下,這三者應結(jié)合成一個足夠快的飛輪,使每一輪驗證都能為下一輪的數(shù)據(jù)設(shè)計(next round of data design)提供信息。


這說起來容易做起來難。在模型開發(fā)和數(shù)據(jù)生成這兩方面—而且很多團隊兩者都做—有許多優(yōu)秀的團隊正朝著這些目標努力。以下是我認為對兩個陣營而言最具機遇的領(lǐng)域。


面向模型開發(fā)者


For model developers


正如我們在前沿大語言模型(LLM)中所看到的,生物模型開發(fā)者對新型訓練數(shù)據(jù)集的渴望也正變得愈發(fā)強烈,以期提升模型在基準測試(benchmarks)中的表現(xiàn)。隨著我們步入這一市場動態(tài)中,開發(fā)者應當重點思考三個日益重要的問題:(1)如何評估數(shù)據(jù)提供方的數(shù)據(jù)質(zhì)量?(2)如何驗證這些數(shù)據(jù)對現(xiàn)實世界基準測試的實際效果?(3)在資源有限的情況下,何時進行規(guī)?;瘮U張(scale)?


(1)在未來的這一趨勢中,數(shù)據(jù)采購將變得更像是一個科學同行評議(peer-review)的過程,而不僅僅是傳統(tǒng)的資本與資產(chǎn)的簡單交換。你購買了哪些數(shù)據(jù)固然重要,但關(guān)于這些數(shù)據(jù)是如何被收集和標注的元數(shù)據(jù)(metadata)也同樣關(guān)鍵。實驗方案級別的細節(jié)(protocol-level details)、一致性指標(consistency metrics)、批次結(jié)構(gòu)(batch structures)以及技術(shù)重復(replicates)的處理方式,共同構(gòu)成了一個更完整的數(shù)據(jù)包背景故事。這對于評估數(shù)據(jù)質(zhì)量以及訓練更可靠、更具上下文感知能力(context-aware)的模型至關(guān)重要。


鑒于生物學的極度復雜性,以及需要在高維坐標軸(high-dimensional axes)上對質(zhì)量進行度量,目前用于文本數(shù)據(jù)的質(zhì)量分類器、批次校正器和過濾工具,很可能無法直接移植到生物模型中。因此,開發(fā)生物學特異性的工具集應當成為模型開發(fā)者(甚至是介于模型開發(fā)者和數(shù)據(jù)生成方之間的第三方服務商)的一項核心任務,唯有如此才能實現(xiàn)這一流程的規(guī)模化。


我們已經(jīng)可以在實際生產(chǎn)中看到這樣的例子。例如scVI,這款最初專門為單細胞RNA測序(scRNA-seq)數(shù)據(jù)進行批次校正而開發(fā)的工具,現(xiàn)在也正在被用作一種質(zhì)量過濾器,用來檢測某個數(shù)據(jù)集中的信號究竟是由用戶的批次效應驅(qū)動的,還是由底層的基本生物學規(guī)律驅(qū)動的。


(2)模型開發(fā)者還需要通過評估來驗證性能,但鑒于上文討論的諸多問題,為生物模型構(gòu)建穩(wěn)健的評估體系本身就是一項挑戰(zhàn)。此外,留出的測試集通常與訓練數(shù)據(jù)存在相同的批次效應,這意味著基準性能往往反映的是學習到的"偽影",而非學習到的生物學特性(which means benchmark performance often reflects learned artifacts rather than learned biology)。



如今最常用的評測體系在設(shè)計上都在盡力去匹配模型的復雜度。例如,一個抗體設(shè)計模型很可能擁有一整套涵蓋親和力(affinity)、選擇性(selectivity)、功能性(functionality)、聚集傾向(aggregation)等多個維度的基準測試。然而,隨著模型的輸出變得越來越復雜,驗證這些輸出所需的手段也變得越來越定制化(bespoke),隨之而來的便是驗證時間和成本的急劇攀升。走到這一步,可能會有越來越多的模型開發(fā)者選擇在內(nèi)部自建濕實驗室(wet labs),或者與數(shù)據(jù)生成方建立更深度的戰(zhàn)略合作,從而在一個更受控、更垂直一體化的飛輪(verticalized flywheel)中縮短驗證周期。


我們必須開始將驗證環(huán)節(jié)推向盡可能貼近現(xiàn)實世界應用的前沿(pushing validation as close to the real-world applications as possible)。在LLM領(lǐng)域,Andon Labs就是一個極具啟發(fā)性的范例:他們讓AI智能體去實際運營Anthropic公司內(nèi)部的真實自動售貨機業(yè)務,以及位于舊金山的一家實體店。




andonlabs.com


在這里,對智能體成功與否的評判完全取決于最終的真實經(jīng)濟效益—這種硬指標可比那些人為設(shè)計的虛擬基準測試要難刷得多(where success is graded on actual economic outcomes that are much harder to game than an artificial benchmark)。


以下是來自Andon Labs的Vending-Bench 2評估結(jié)果的翻譯。人工智能模型被給予500美元的起始資金,來自主管理一個虛擬的自動售貨機業(yè)務。圖表展示了每個模型隨時間的現(xiàn)金余額變化。(https://andonlabs.com/evals/vending-bench-2)


對于生物模型而言,與此等價的閉環(huán)很可能就是藥物研發(fā)流程本身。模型的性能最終將由其輸出能否在臨床前(preclinical)和臨床(clinical)讀出結(jié)果中存活下來而決定。這里的核心挑戰(zhàn)在于“周期時間”:相比于自動售貨機或零售店每天或每周就能給出的經(jīng)濟效益反饋,藥物研發(fā)往往需要耗費數(shù)年的時間。盡管如此,兩者的核心初衷是一致的,而且將“臨床成功”作為終極衡量標準的終點線(goalposts)從未改變。


(3)設(shè)計一個能完美解決上述所有四個問題的分析方法或數(shù)據(jù)收集策略,很可能是不可能的。我們受到有限預算、短暫時間線和有限技術(shù)的約束(finite budgets,short timelines,and limited technologies)。在這樣的環(huán)境下,開發(fā)者需要理解,何時是推進數(shù)據(jù)收集方案的正確時機,以及何時應該擴大規(guī)模(developers need to understand when the right moment is to advance data collection protocols,and when to scale)。


這里沒有唯一的正確答案,但只有當開發(fā)者確信數(shù)據(jù)對于下游任務確實具有代表性時,規(guī)?;艖撻_始。例如,空間轉(zhuǎn)錄組學(spatial transcriptomics)比單純的單細胞RNA測序轉(zhuǎn)錄本計數(shù)提供了更多的上下文信息,但空間數(shù)據(jù)的收集比單細胞RNA測序要昂貴和耗時得多。如果你的主要應用場景依賴于理解組織內(nèi)細胞類型之間的定位,那么這種額外的上下文信息就是一個值得優(yōu)先考慮的權(quán)衡。


其他幾個重要的考量因素包括:(1)每個樣本中存在多少學習信號;(2)明確究竟是哪些噪聲源在數(shù)據(jù)收集中占主導地位,以及如何最好地去緩解它們;(3)獲取數(shù)據(jù)所需的時間和成本;(4)數(shù)據(jù)收集完成后,你能夠多快對其進行實驗驗證;(5)預測錯誤的代價有多大,以及一旦出錯,這項規(guī)模化投資的“可逆性”有多高(是否能及時止損)。


讓情況變得更加復雜的是,不同類型的數(shù)據(jù)毫無疑問需要截然不同的規(guī)模。在某些應用中,基于100例帶有明確臨床預后(clinical outcomes)標注的癌癥患者病例進行訓練,其效果可能遠好于基于10,000例僅帶有“代理生物標志物”(surrogate biomarkers)標注的病例——因為這些代理指標與真正的臨床終點(true endpoint)之間往往只有微弱的相關(guān)性。


這里存在著一個真正的“先有雞還是先有蛋”的悖論。不進行規(guī)?;覀兛赡芫蜔o法學到正確的生物學規(guī)律;但規(guī)模化跑得太快,又面臨著將模型死死錨定在錯誤或不完整的生物學認知上的風險。行業(yè)內(nèi)一個殘酷的真相是:在真正訓練出模型并開始摸索之前,你根本無法確切知道自己的數(shù)據(jù)到底有多好(you don’t know how good your data actually is until you train a model and start to find out)。這種內(nèi)在矛盾張力警示我們,必須從一開始就將“質(zhì)量”與“規(guī)?!狈旁谕戎匾奈恢蒙贤ūP考慮,而不是把質(zhì)量和生物學洞察僅僅當成是在粗放規(guī)?;?、可以簡單靠后期過濾就能解決的事情。


面向數(shù)據(jù)生成者


For data generators


生物基礎(chǔ)模型正變得越來越復雜,將需要比公開可用或模型開發(fā)者內(nèi)部能生成的更多數(shù)據(jù)。即使是地球上最有價值的制藥公司—擁有數(shù)十年數(shù)據(jù)積累的禮來公司—也已經(jīng)建立了一個數(shù)據(jù)共享平臺,以滿足開發(fā)藥物發(fā)現(xiàn)AI模型所需的高容量、多樣性和高質(zhì)量數(shù)據(jù)。



數(shù)據(jù)生成者有多種類型:(1)擁有高通量篩選平臺、能產(chǎn)生獨特生物學見解的生物技術(shù)公司;(2)致力于規(guī)?;袃r值實驗流程的自動化/機器人公司;(3)多年來為客戶精煉數(shù)據(jù)收集的合同研究組織(CRO);(4)甚至是專門為模型開發(fā)者優(yōu)化數(shù)據(jù)收集的新公司類別。


我的論點是,那些越來越專注于高質(zhì)量數(shù)據(jù)、并完善向模型開發(fā)者交付數(shù)據(jù)流程的參與者,將獲得最大的成功(those players who increasingly focus on high-quality data and who perfect the data handoff to model developers will be the most successful)。他們?yōu)樯鐓^(qū)提供的價值主張是多方面的,我將特別關(guān)注其中三點。


1.這是目前最直接、也最簡單的價值主張。這種獨特優(yōu)勢可以歸功于一種全新的篩選平臺,或者是將一個已被驗證的平臺推向了一個全新的治療生態(tài)位(therapeutic niche)。然而,這里最容易被外界忽視的環(huán)節(jié),其實是對數(shù)據(jù)集進行窮盡式的標注(exhaustive annotation),以及落地這一標注所需的基礎(chǔ)設(shè)施——這涵蓋了從特定數(shù)據(jù)屬性到精細至“究竟是哪位操作員在運行這一實驗”的每一個細節(jié)。平臺、數(shù)據(jù)以及這些精細的標注,共同構(gòu)成了公司的護城河(moat)。


如果沒有對注釋和必要基礎(chǔ)設(shè)施的大量投入,這種價值主張是短暫的(Without heavy investment in annotation and the required infrastructure,this value proposition is fleeting)。分析方法—即使是復雜的—往往會隨著時間被商品化,參與者可能會被新技術(shù)或他人技術(shù)的更新所超越(Assays—even complex ones—are often commoditized over time,and players can be leapfrogged by new technologies or updates to the techniques by others)。這些參與者也可能在早期憑借價格和數(shù)據(jù)獲取速度獲勝,但存在與競爭對手陷入低價競爭的很高風險。


2.隨著模型開發(fā)者在對生物數(shù)據(jù)機會進行盡職調(diào)查時變得越來越精明,生成高質(zhì)量數(shù)據(jù)的聲譽會為這種護城河增添價值。那些擁有可記錄、可追溯的實驗方案、機器可讀的元數(shù)據(jù)、恰當?shù)呐慰刂?、充分的重復測量以及一致注釋質(zhì)量的數(shù)據(jù)生成者,會成為該領(lǐng)域值得信賴的來源,這直接轉(zhuǎn)化為定價能力。無論底層生物數(shù)據(jù)多么有趣或獨特,糟糕的數(shù)據(jù)質(zhì)量和缺乏組織都會產(chǎn)生復合效應,而每一項質(zhì)量改進都能提供更大的杠桿作用。


3.第三個、也是最成熟的價值主張,開始徹底改變數(shù)據(jù)生成者與模型開發(fā)者之間的關(guān)系形態(tài)。如今,CRO的默認業(yè)務模式絕大多數(shù)是被動響應式(reactive)的:他們接收客戶發(fā)來的實驗需求,運行實驗、打包并交付數(shù)據(jù),然后收取服務費。這種商業(yè)模式往往被“哪家供應商能以最便宜的價格、在最短的時間內(nèi)滿足最低的質(zhì)量標規(guī)”所驅(qū)動—這又是一場逐底競爭。


事實上,數(shù)據(jù)生成者對當前模型的局限性有著獨特的洞察,而這些局限性往往是開發(fā)者自己都渾然不知的。當數(shù)據(jù)生成者開始采取以下兩項舉措時,這種洞察就將開始解鎖全新的價值:


  • 走向產(chǎn)業(yè)鏈上游(move upstream):主動去審視和界定哪些數(shù)據(jù)集最有可能提升模型的評測效果(evals)。


  • 構(gòu)建專屬的評測體系:親自制定評測基準,以在特定任務中證明自身數(shù)據(jù)的核心價值。


隨著高質(zhì)量數(shù)據(jù)成為模型開發(fā)者越來越強的護城河,這種關(guān)系將從簡單的“數(shù)據(jù)供應商關(guān)系”轉(zhuǎn)變?yōu)樯疃冉壎ǖ纳虡I(yè)戰(zhàn)略合作伙伴關(guān)系,這無疑將帶來更大且更持久的經(jīng)濟利益(lasting economics)。同時,我推測模型開發(fā)者未來會更傾向于獲得數(shù)據(jù)集的獨家授權(quán)許可(exclusive licenses),這使得從雙端共同培養(yǎng)這種更緊密的共生關(guān)系變得尤為重要。


結(jié)語


Parting thoughts


無論哪個子領(lǐng)域,訓練數(shù)據(jù)始終是人工智能進步的核心。對于具有自身獨特考量的生物基礎(chǔ)模型而言尤其如此(biological foundation models that come with their own unique considerations)。


顯然,我們?nèi)绾我?guī)模化并訓練生物基礎(chǔ)模型,不會有一個“一刀切”的方法,這應該受到行業(yè)和學界的歡迎。由于生物學極其恐怖的復雜性,每一個子領(lǐng)域都需要定制屬于自己的模型架構(gòu)、分詞/表征策略(tokenization strategies),以及去仔細權(quán)衡數(shù)據(jù)質(zhì)量與數(shù)據(jù)規(guī)模之間究竟該如何達成精準的平衡。


我在此處所闡述的任何觀點,都不是在反對“規(guī)?;保⊿cale),而是在為“高質(zhì)量、多樣化的數(shù)據(jù)”正名。如果只有規(guī)模而沒有質(zhì)量,或者只有質(zhì)量而沒有規(guī)模,我們都無法在生物學數(shù)字化(digitizing biology)的道路上取得實質(zhì)性的進展。在一個僅僅對我們“當前已知的生物學認知”進行盲目粗放規(guī)模化的世界里,我們將丟失掉那些人類甚至尚未發(fā)現(xiàn)、或還不知道該如何去測定的關(guān)鍵上下文背景;而在一個過度沉迷于把數(shù)據(jù)集打磨到毫無瑕疵的世界里,我們又會失去利用有意義的模型去推進當下藥物研發(fā)的能力。不要忘記,我們的終極目標,依然是盡快將有價值的資產(chǎn)(藥物/療法)傳遞到患者手中(The end goal is still translating meaningful assets to patients as soon as possible)。


我經(jīng)常聽到“數(shù)量本身就是一種質(zhì)量”(quantity is its own form of quality)這種說法,并且我大體上同意這個觀點,但我的意思是,這句話在生物學領(lǐng)域成立的前提是,數(shù)據(jù)首先要具有足夠高的質(zhì)量。隨著該領(lǐng)域開始為地球上一些最棘手的問題構(gòu)建更強大的生物模型,數(shù)據(jù)瓶頸的解決將不在于只關(guān)注“我們能收集多少數(shù)據(jù)?”,而在于“我們首先應該收集哪些數(shù)據(jù)?”。


原文鏈接:


https://research.dimensioncap.com/p/on-training-data-for-bio-ai-models

AI創(chuàng)投日報頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點僅代表作者本人,不代表虎嗅立場。
如涉及版權(quán)問題請聯(lián)系 hezuo@huxiu.com,我們將及時核實并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
万载县| 绥芬河市| 德阳市| 永新县| 陈巴尔虎旗| 沙河市| 岳阳市| 隆子县| 徐水县| 富裕县| 辽宁省| 长葛市| 郎溪县| 平湖市| 汤阴县| 台安县| 丰宁| 介休市| 博客| 子长县| 贵南县| 宁远县| 宜州市| 林口县| 马关县| 新密市| 霍山县| 曲水县| 桦南县| 衡阳县| 瑞金市| 乌拉特前旗| 桃园市| 文化| 连平县| 新余市| 会理县| 嘉定区| 商河县| 广州市| 两当县|