我的學習群裡全是真大佬 第502章

作者:胖胖的小橘

再加上原生多模態和上百萬token的上下文,就差沒說老子就是全能了。

而OpenAI那邊,它們這次的GPT-6主打的是寫程式碼和智慧體。

SWE-bench Verified上那五百道程式碼工單,它解決了其中的86.3%。

甚至還說FrontierMath他們也幹到了48.7%。

FrontierMath是Epoch AI那群人專門搞出來折磨模型的研究級數學題,由易到難分作四級,最難的第四級一共五十道,道道都能讓數學博士發矇。

GPT的上一代旗艦最多也就幹到了35%而已。

至於Anthropic家的Claude Opus 5,則在那張幾乎被業內當成總成績單的Artificial Analysis智慧指數上,把綜合分一舉拉到了68,重新坐回了頭把交椅,長程的智慧體任務、程式設計,樣樣都令人咋舌。

他們交出這樣的答卷,幾家科技媒體自然是連夜趕出了長篇評測與盤點。

《AI的“iPhone時刻”又一次降臨》,《通用人工智慧或許真的不遠了》。

裡面都配上了那些一張張被重新整理了記錄的成績圖,看得讓人熱血沸騰的。

當然這些事最開心的就是華爾街了。

訊息出來那天,整個美股科技板塊跟著就大地震了。

納斯達克綜合指數單日跳漲 2.7%,盤中首次站上了 28000點,收報 28180點,再創歷史新高。

輝達股價一路飆升,市值盤中一度摸到 5.9萬億美元,眼看就要叩開 6萬億的大門了。

要知道就在幾年前,華爾街還在預測那一家公司能夠上萬億。

如今輝達直接將這個數字翻了六倍。

而那些做資料中心的,也跟著吃上了這波紅利。

從液冷供電到機櫃,但凡沾上一點“算力基建”邊的幾乎是清一色地放量飆漲。

維諦技術單日就拉了 11%,幾個做電源和散熱的中小盤股,盤中漲幅一度衝到 20%以上。

當然一級市場比起它們也不遑多讓。

某家明星實驗室剛放出新一輪融資的風聲,估值就被人一路推到了5000億美元,投資人拿著錢排著隊,生怕趕不上這趟車。

整個北美的人工智慧像是在過聖誕節一樣。

而華夏這邊的氣氛就要冷清太多了。

權威跑分一張張掛出來,那些榜單的前幾名,清一色被那三家輪流坐了莊。

國內最能打的幾家排著排著,就排到了讓人不太願意細看的位置了。

要放從前,某一家好歹還能時不時在某張推理榜上摸到個第三,驚豔眾人一回。

可這一次,連那點位置都守不住了。

差距,肉眼可見地被拉開了。

這種差距,落在跑分榜上,不過是幾個百分點的數字。

可落在那些用慣了國產模型、又眼睜睜看著別人一騎絕塵的普通人心裡,滋味就遠不止幾個百分點那麼輕巧了。

國內的網路上,很快就炸開了鍋。

抖音和b站上,一個接一個的科普博主下場,掰開了揉碎了地講,為什麼我們這邊的大模型,總要慢上人家一步。

算力、資料、人才、生態,一條條擺出來,講得頭頭是道,播放量自然也跟著水漲船高。

有講晶片被卡了脖子的,有講頂尖人才不斷外流的,也有翻出幾年前的舊賬,痛心疾首地復盤,我們究竟是從哪一步開始掉的隊。

道理大同小異,結論也大同小異。

差距,不是一天拉開的,我們想追回來,自然也不是一天的事。

而這些科普影片下面的評論自然也是一片唱衰

“對呀對呀,我們國產那個某包,就只會把我當胎盤哄。”

“問它點正經的,張口就給你編。”

“認錯倒是比誰都快,你一指出來,它立馬您說得對,是我的疏忽,然後扭頭就接著胡說。”

底下一串人附和,你一言我一語的,像是要把那點憋了許久的怨氣全部發洩出來。

當然也有幾個相對冷靜的聲音。

“其實國外那幾個大模型,也一樣會胡編亂造,這是大模型的通病跟國產進口真沒多大關係。”

“不是,我用的克勞德,雖然死貴死貴的,可它是真的值。”

輿論就這麼瘋漲著,也不知道什麼時候開始,抖音上開始出現了一批文案雷同的影片。

【作為普通人你一定要想辦法用上Claude。】

【我的API中轉站裡面的Claude為什麼這麼便宜,因為我是做資料給投資人看的。】

特麼的還是一套組合拳。

這些人說到底,就是為了製造焦慮而製造焦慮。

你今天不焦慮,他這影片可就沒法變現了。

第421章 未央

與此同時,國內某家大廠的會議室裡。

幾個人圍著長桌坐著,幕布上還顯示著那幾張有些刺眼的跑分榜圖。

“不得不承認,這一回他們是真上了個臺階。”

一位高管嘆氣說道。

“不是從前那種小修小補,是模型的能力比起上一代有了質的飛躍。”

桌上一時間沒人接話。

過了好一會兒,一個技術負責人才開口道。

“我聽說……之前李東教授好像和他們溝通過很久,時不時林東教授給他們指的路?”

這話一齣,好幾個人都看向了他。

“訊息準嗎?”

“傳得有鼻子有眼的。”

“反正這半年,他們進步這麼快,你要說背後一點說法都沒有我是不太信的。”

“要不……咱們也去請請李東教授?”另一個人試探著提議道,“咱也是華夏的本土企業,他總不能光顧著幫外人吧,再說了,真要談錢,咱給他一個合適的價格就是了,咱們又不差錢。”

這提議一齣口,在座的紛紛點頭。

事不宜遲,散了會,幾個人便各自動用起手裡的關係,變著法子去聯絡那位李東教授了。

……

而被聯絡的最多的自然就是北行的李總。

這兩天他這部手機就沒消停過。

“喂?……哎喲,這事啊,我手上真沒有李東教授的電話呀。”

“之前是聯絡過,可人家早換了號了”

“轉達?我上哪兒替你轉達去……”

接到第五六個的時候,李總直接就關機了。

他是真的服了。

這幫人,當他是傻子嗎?

他要是真能聯絡上李東,他自己會不聯絡?

北行又不是沒有大模型。

所以他是真的聯絡不上。

電話不是沒人接,就是不再服務區……

他甚至還託了燕大的幾個熟人去打聽。

得到的回答都是,最近沒見過李東的人。

沒見過人?這種回答騙騙別人還行,他怎麼可能信。

肯定是李東不願意見他們而已。

想到這裡李總只能獨自嘆了口氣,又看起了國外的科技新聞。

……

就在“國外AI即將統治世界”的言論愈演愈烈的時候。

某天,FrontierMath第四級的榜單,悄悄地重新整理了一下。

一個陌生的大模型出現在了榜單的首位,它的名字叫做——未央!

它背後跟著的數字是73.4%。

這是個什麼概念呢?

那個吹牛逼最厲害的gpt-6也才跑了48.7%。

這已經不叫領先了,這叫斷層。

前面那個一騎絕塵,後面一群人連它的影子都夠不著。

最開始,沒人把這個數字當真。

跑分榜上鬧烏龍,又不是頭一回的事。

多半是哪個新模型鑽了題庫的空子,要不就是評測指令碼出了岔子,再不然,就是有人在背後刷榜……

技術論壇裡清一色全是這類的猜測。

於是有好事者,拿著公開的那部分題目,自己動手復了一遍盤。

結果這個資料居然是真的!

緊接著,又有人在另外幾張榜單上,看見了未央這個名字。

PutnamBench,那六百七十二道用Lean形式化寫就的普特南競賽題,排在最前面的,從來都是那幾個燒錢燒到上千美元一道題的傢伙。

而未央掛上去的成績,是六百七十二道,全解。

一道不落,且每一道題後面,都有一份機器當場就能驗過的完整證明。

然後在大家吃驚的時候……

miniF2F上的四百多道奧賽級的形式化題目,也被它清了個乾乾淨淨。

這兩張榜,向來是機器證明這一脈的試金石。

它們的題目雖是公開的,證明卻必須一步一步由機器親自驗過,才算數。

在這種地方,你糊弄不了任何人,蒙也蒙不過去。

所以訊息很快就在AI圈和數學圈裡,一同傳開了。

誰也不知道這“未央”是打哪兒冒出來的,更想不通它憑什麼能在這幾張榜上,把所有人都甩出這麼遠。

不過這種公開的跑分的大模型到底是哪家的總是有辦法查到的。

所以很快就有人把它給扒了出來……這模型出自燕大。

燕大?

要知道,上一個從華夏的大學裡走出來還在國際上闖出過名號的大模型,還是智譜。

可如今這個未央看起來好像比智譜還要兇的樣子。

不過很快就有眼尖的人注意到,未央並非張張榜單都拔尖。

在那張衡量綜合智力的Artificial Analysis指數上,在比拼對話偏好的Chatbot Arena上,在考較程式設計的SWE-bench、考較多模態的那一類專案裡,這個未央要麼名次平平,要麼乾脆連個影子都找不著。