作者:胖胖的小橘
可三人在腦子裡把利害關係飛快地推演了一遍,愣是沒算出李東這麼做能圖他們什麼。
倒是數學圈裡一直流傳的那句話,不約而同地浮上了三個人的心頭。
李東,是一個純粹的學者。
看來,並不是空穴來風。
於是三人齊齊地衝李東點了點頭,凱利的聲音裡,帶上了幾分真盏母屑ぁ�
“謝謝您,李東教授,人類AI範式的躍遷,離不開您的貢獻。”
“不過,請您稍等我們一下,具體到底層咚阍头稚⑹郊軜嫷臇|西,我們還需要把公司的Chief Scientist(首席科學家)叫過來同您面談。”
朗和哈特也跟著點頭。
這種硬核的局,帶商務VP團隊來純屬白給,必須把各自家裡真正控盤預訓練、手搓CUDA咚阍拇笈U堖^來才行。
“那行。”李東痛快地站起身,“人到了,你們叫我,我先去和外面的同行們交流交流。”
三人一時沒反應過來,下意識地問了一句。
“李東教授,您要交流什麼?”
李東理所當然地說道:“當然是交流我那套降維演算法的工程適配呀。”
“畢竟,這也是為了推動全人類開源生態的發展嘛。”
說完他朝三人笑了笑,推門走出了休息室。
三個人花了足足兩秒鐘才反應了過來。
外面的大廳裡可全是競品同行呀。
“該死!”
凱利第一個掏出手機,幾乎是用吼的。
“雅各布?對,是我!你現在,立刻,馬上,飛首爾!”
“什麼叫沒排上商業航班?讓後勤直接把公司那架灣流G650推出來!當場報備航線,快!”
“我不管你卡上還掛著幾個千卡叢集的消融實驗,天塌下來也先給我把顯示卡全停了!”
另一邊,朗背過身去,語速快得像在搶答。
哈特那通電話表面上聲調平穩,握著手機的手都鼓起了青經。
三通電話,三個號碼,內容大同小異。
於是乎這一天的矽谷,發生了一樁極其罕見的事情。
三家巨頭公司的私人飛機,在同一個下午先後從灣區的跑道上拔地而起,它們的目的地都是……
韓國,首爾。
……
休息室外。
唐傑找了個沒人的電話,撥通了一個國內的號碼。
他把會場這邊剛剛發生的事,原原本本複述了一遍。
電話那頭沉默了幾秒,然後笑了。
“唐教授,把心放肚子裡。”
“你呀,還是不夠了解李東教授。”
唐傑握著手機,怔了一下。
“……行,我明白了。”
結束通話電話後,他抬起頭。
目光穿過大廳裡的人群,落在那個正談笑風生的年輕人身上,神情說不出的古怪。
……
展區的另一邊,獨角獸聯合展臺旁的咖啡臺。
兩個掛著參展商工牌的人,正端著咖啡閒聊。
其中一位是埃裡克·萬斯,矽谷一家AI獨角獸的聯合創始人,兼首席科學家。
他們家的招牌是Long Context與極速推理,兩年前靠一手“百萬級Context Window”的硬核絕活一戰成名,估值一路狂飆過百億美元大關,是這條細分賽道上跑得最快的黑馬。
下午唐傑領著李東在大廳裡寒暄的時候,萬斯就排在換名片的隊伍裡,還很鄭重地做過一番自我介紹。
此刻他正和一位歐洲基礎實驗室的研究員聊得起勁,餘光忽然瞥見一道身影朝這邊走了過來。
萬斯扭頭一看,整個人立刻精神了。
他連忙朝那位研究員抱歉地舉了舉咖啡杯,丟下一句“回頭再聊”,便快步迎了上去。
“李東教授!”
“萬斯博士。”李東笑著同他握了握手,連破冰的廢話都懶得鋪墊,開門見山。
“正好碰見你,我想問問你有沒有想過,把我那套降維演算法1.0,完完全全地適配到大模型的底層架構上去?”
萬斯臉上的笑容,僵住了。
隨後轉成了狂喜。
他不知道李東為什麼忽然問起這個。
可李東都這麼問了,這天下哪有不吃白食的道理?
萬斯深吸了一口氣說道。
“想過!李東教授,我們不光想過,還砸了真金白銀進去跑過消融實驗!”
“您的降維演算法裡的FFT網格的非線性展開,本質上是在做高維流形的低秩逼近,對吧?”
“我們就把這套思路端到了長文本的KV Cache上。”
“給Key-Value矩陣強做低秩投影,切掉尾部的奇異值,視訊記憶體開銷當場砍下去七成。”
“跑常規文本的Perplexity,指標很穩,PPL幾乎不掉點。”
“可一上NIAH的精確檢索評測,Recall就當場崩盤。”
“後來做視覺化才定位到,Attention矩陣的奇異值譜,是個極其極端的重尾分佈。”
“模型裡那幾個專司精確檢索的Attention Head,要在幾十萬個Token裡撈出那根‘針’,它們學到的特徵向量全擠在譜的尾巴上。”
“我們把尾巴這麼一刀切,等於直接把這幾個Head的眼睛給挖了。”
“李東教授,您那套演算法算zeta零點的時候,奇異值截斷比我們猛得多,憑什麼您的尖峰特徵就能無損保留?”
他說的問題,資訊密度高得嚇人。
周圍幾個豎著耳朵的參展商,已經不動聲色地朝這邊圍攏了過來。
李東慢條斯理地開了口。
“你這個問題,算是摸到門道了。”
“但你們的方向,從一開始就歪了。”
萬斯一怔:“錯在哪?”
“錯在你們想靠暴力的‘砍’去收斂邊界。”
“在我的理論框架裡,SVD譜截斷壓根不是C位,那只是工程落地時順手的後處理。”
“真正的殺招,是截斷前的那次非線性流形重排。”
“零點,是zeta函式的特徵指紋。”
“你說的精確檢索,是全域性序列的特徵指紋,指紋這東西脾氣很怪,選錯了基底,你給它留再高的Rank它也存不住,扔進正確的正交基底裡,Rank 1就足夠表達了。”
“所以,你們直接在KV的原始特徵空間裡強做低秩,純屬南轅北轍。”
……略
“等特徵重分佈做完,你再去切奇異值,Error Bound(誤差上界)自然就收斂了。”
萬斯聽得連呼吸都屏住了。
聽起來……數學邏輯上完全能閉環啊!
“那、那這個非線性重構咚阍撛觞N引數化?”他急切地追問。
“這就得看你們對自家資料分佈的先驗假設了。”李東高深莫測說道,“流形重構是同資料分佈強繫結的,我總不能越俎代庖替你們去定義你們自己的預訓練語料吧?”
萬斯重重地點頭。
有道理。
這話簡直不能更有道理了。
“不過,”
李東隨口地補了一句。
“我倒是好奇一件事。”
“你們費這麼大的勁,又是投影,又是重排,折騰來折騰去,無非是想把那坨越來越臃腫的Cache壓小一點,對吧?”
“那你們就沒想過,乾脆,把KV Cache徹底揚了?”
萬斯愣住了。
把Cache揚了?
Attention機制不帶Cache,那他媽還叫……
等等。
他的瞳孔,緩緩地放大了。
不知怎麼的,他腦子裡那些散落了快一年的拼圖碎片。
線性注意力(Linear Attention)的遞推範式,狀態空間模型(SSM)的隱狀態方程,還有上個月組會上被他親手斃掉的那份瘋狂的RNN變體提案,在這一瞬間,被一條邏輯鏈猛地串了起來。
如果,Hidden State不再是存放KV對的死倉庫,而是一個活的“學生”呢?
萬斯整個人,僵在了原地。
而站在他對面的李東,端著咖啡,笑眯眯地看著他。
與此同時,記憶宮殿。
大廳的正中央,憑空多出了一座臨時的小書架。
書架上,靜靜躺著一份嶄新的文獻。
李東走過去,把它翻開。
【將“記憶”從靜態的KV Cache,重構為動態更新的權重矩陣。】
【Hidden State不再是堆疊鍵值對的外部視訊記憶體,而是內嵌於Backbone中、在Inference階段同步迭代的微型模型。】
【序列建模等價於線上元學習(Online Meta-Learning)。】
【每自迴歸生成一個新Token,即向該微型模型輸入一條樣本,“檢索回憶”等效於一次Forward Pass,“上下文記憶”等效於一步Gradient Descent。】
【至此,Context Window長度徹底擺脫視訊記憶體牆(Memory Wall)的物理桎梏,僅受限於內層學習器的引數容量與遺忘門控。】
【資訊壓縮不再是暴力的有損截斷,而是一場由目標函式驅動的端到端表徵學習……】
【至於內層學習器的Loss Function該如何設計,其權重更新又該如何與外層Backbone的梯度反傳實現數學上的解耦……】
文獻到這裡,斷了。
李東合上這半截思路,眉毛輕輕挑了挑。
在Inference階段,依然持續做Training的模型?
把幾百萬的Context直接壓進權重裡?
好傢伙。
這幫AI極客腦子裡憋著的狠活,可比他們掛在arXiv上的水文,野得多了。
退出記憶宮殿,現實裡不過才過去了一兩秒。
上一篇:我家艺人太没上进心了
下一篇:挨打永久加防御,神魔都打不动我