作者:胖胖的小橘
再加上原生多模態和上百萬token的上下文,就差沒說老子就是全能了。
而OpenAI那邊,它們這次的GPT-6主打的是寫程式碼和智慧體。
SWE-bench Verified上那五百道程式碼工單,它解決了其中的86.3%。
甚至還說FrontierMath他們也幹到了48.7%。
FrontierMath是Epoch AI那群人專門搞出來折磨模型的研究級數學題,由易到難分作四級,最難的第四級一共五十道,道道都能讓數學博士發矇。
GPT的上一代旗艦最多也就幹到了35%而已。
至於Anthropic家的Claude Opus 5,則在那張幾乎被業內當成總成績單的Artificial Analysis智慧指數上,把綜合分一舉拉到了68,重新坐回了頭把交椅,長程的智慧體任務、程式設計,樣樣都令人咋舌。
他們交出這樣的答卷,幾家科技媒體自然是連夜趕出了長篇評測與盤點。
《AI的“iPhone時刻”又一次降臨》,《通用人工智慧或許真的不遠了》。
裡面都配上了那些一張張被重新整理了記錄的成績圖,看得讓人熱血沸騰的。
當然這些事最開心的就是華爾街了。
訊息出來那天,整個美股科技板塊跟著就大地震了。
納斯達克綜合指數單日跳漲 2.7%,盤中首次站上了 28000點,收報 28180點,再創歷史新高。
輝達股價一路飆升,市值盤中一度摸到 5.9萬億美元,眼看就要叩開 6萬億的大門了。
要知道就在幾年前,華爾街還在預測那一家公司能夠上萬億。
如今輝達直接將這個數字翻了六倍。
而那些做資料中心的,也跟著吃上了這波紅利。
從液冷供電到機櫃,但凡沾上一點“算力基建”邊的幾乎是清一色地放量飆漲。
維諦技術單日就拉了 11%,幾個做電源和散熱的中小盤股,盤中漲幅一度衝到 20%以上。
當然一級市場比起它們也不遑多讓。
某家明星實驗室剛放出新一輪融資的風聲,估值就被人一路推到了5000億美元,投資人拿著錢排著隊,生怕趕不上這趟車。
整個北美的人工智慧像是在過聖誕節一樣。
而華夏這邊的氣氛就要冷清太多了。
權威跑分一張張掛出來,那些榜單的前幾名,清一色被那三家輪流坐了莊。
國內最能打的幾家排著排著,就排到了讓人不太願意細看的位置了。
要放從前,某一家好歹還能時不時在某張推理榜上摸到個第三,驚豔眾人一回。
可這一次,連那點位置都守不住了。
差距,肉眼可見地被拉開了。
這種差距,落在跑分榜上,不過是幾個百分點的數字。
可落在那些用慣了國產模型、又眼睜睜看著別人一騎絕塵的普通人心裡,滋味就遠不止幾個百分點那麼輕巧了。
國內的網路上,很快就炸開了鍋。
抖音和b站上,一個接一個的科普博主下場,掰開了揉碎了地講,為什麼我們這邊的大模型,總要慢上人家一步。
算力、資料、人才、生態,一條條擺出來,講得頭頭是道,播放量自然也跟著水漲船高。
有講晶片被卡了脖子的,有講頂尖人才不斷外流的,也有翻出幾年前的舊賬,痛心疾首地復盤,我們究竟是從哪一步開始掉的隊。
道理大同小異,結論也大同小異。
差距,不是一天拉開的,我們想追回來,自然也不是一天的事。
而這些科普影片下面的評論自然也是一片唱衰
“對呀對呀,我們國產那個某包,就只會把我當胎盤哄。”
“問它點正經的,張口就給你編。”
“認錯倒是比誰都快,你一指出來,它立馬您說得對,是我的疏忽,然後扭頭就接著胡說。”
底下一串人附和,你一言我一語的,像是要把那點憋了許久的怨氣全部發洩出來。
當然也有幾個相對冷靜的聲音。
“其實國外那幾個大模型,也一樣會胡編亂造,這是大模型的通病跟國產進口真沒多大關係。”
“不是,我用的克勞德,雖然死貴死貴的,可它是真的值。”
輿論就這麼瘋漲著,也不知道什麼時候開始,抖音上開始出現了一批文案雷同的影片。
【作為普通人你一定要想辦法用上Claude。】
【我的API中轉站裡面的Claude為什麼這麼便宜,因為我是做資料給投資人看的。】
特麼的還是一套組合拳。
這些人說到底,就是為了製造焦慮而製造焦慮。
你今天不焦慮,他這影片可就沒法變現了。
第421章 未央
與此同時,國內某家大廠的會議室裡。
幾個人圍著長桌坐著,幕布上還顯示著那幾張有些刺眼的跑分榜圖。
“不得不承認,這一回他們是真上了個臺階。”
一位高管嘆氣說道。
“不是從前那種小修小補,是模型的能力比起上一代有了質的飛躍。”
桌上一時間沒人接話。
過了好一會兒,一個技術負責人才開口道。
“我聽說……之前李東教授好像和他們溝通過很久,時不時林東教授給他們指的路?”
這話一齣,好幾個人都看向了他。
“訊息準嗎?”
“傳得有鼻子有眼的。”
“反正這半年,他們進步這麼快,你要說背後一點說法都沒有我是不太信的。”
“要不……咱們也去請請李東教授?”另一個人試探著提議道,“咱也是華夏的本土企業,他總不能光顧著幫外人吧,再說了,真要談錢,咱給他一個合適的價格就是了,咱們又不差錢。”
這提議一齣口,在座的紛紛點頭。
事不宜遲,散了會,幾個人便各自動用起手裡的關係,變著法子去聯絡那位李東教授了。
……
而被聯絡的最多的自然就是北行的李總。
這兩天他這部手機就沒消停過。
“喂?……哎喲,這事啊,我手上真沒有李東教授的電話呀。”
“之前是聯絡過,可人家早換了號了”
“轉達?我上哪兒替你轉達去……”
接到第五六個的時候,李總直接就關機了。
他是真的服了。
這幫人,當他是傻子嗎?
他要是真能聯絡上李東,他自己會不聯絡?
北行又不是沒有大模型。
所以他是真的聯絡不上。
電話不是沒人接,就是不再服務區……
他甚至還託了燕大的幾個熟人去打聽。
得到的回答都是,最近沒見過李東的人。
沒見過人?這種回答騙騙別人還行,他怎麼可能信。
肯定是李東不願意見他們而已。
想到這裡李總只能獨自嘆了口氣,又看起了國外的科技新聞。
……
就在“國外AI即將統治世界”的言論愈演愈烈的時候。
某天,FrontierMath第四級的榜單,悄悄地重新整理了一下。
一個陌生的大模型出現在了榜單的首位,它的名字叫做——未央!
它背後跟著的數字是73.4%。
這是個什麼概念呢?
那個吹牛逼最厲害的gpt-6也才跑了48.7%。
這已經不叫領先了,這叫斷層。
前面那個一騎絕塵,後面一群人連它的影子都夠不著。
最開始,沒人把這個數字當真。
跑分榜上鬧烏龍,又不是頭一回的事。
多半是哪個新模型鑽了題庫的空子,要不就是評測指令碼出了岔子,再不然,就是有人在背後刷榜……
技術論壇裡清一色全是這類的猜測。
於是有好事者,拿著公開的那部分題目,自己動手復了一遍盤。
結果這個資料居然是真的!
緊接著,又有人在另外幾張榜單上,看見了未央這個名字。
PutnamBench,那六百七十二道用Lean形式化寫就的普特南競賽題,排在最前面的,從來都是那幾個燒錢燒到上千美元一道題的傢伙。
而未央掛上去的成績,是六百七十二道,全解。
一道不落,且每一道題後面,都有一份機器當場就能驗過的完整證明。
然後在大家吃驚的時候……
miniF2F上的四百多道奧賽級的形式化題目,也被它清了個乾乾淨淨。
這兩張榜,向來是機器證明這一脈的試金石。
它們的題目雖是公開的,證明卻必須一步一步由機器親自驗過,才算數。
在這種地方,你糊弄不了任何人,蒙也蒙不過去。
所以訊息很快就在AI圈和數學圈裡,一同傳開了。
誰也不知道這“未央”是打哪兒冒出來的,更想不通它憑什麼能在這幾張榜上,把所有人都甩出這麼遠。
不過這種公開的跑分的大模型到底是哪家的總是有辦法查到的。
所以很快就有人把它給扒了出來……這模型出自燕大。
燕大?
要知道,上一個從華夏的大學裡走出來還在國際上闖出過名號的大模型,還是智譜。
可如今這個未央看起來好像比智譜還要兇的樣子。
不過很快就有眼尖的人注意到,未央並非張張榜單都拔尖。
在那張衡量綜合智力的Artificial Analysis指數上,在比拼對話偏好的Chatbot Arena上,在考較程式設計的SWE-bench、考較多模態的那一類專案裡,這個未央要麼名次平平,要麼乾脆連個影子都找不著。
上一篇:我家艺人太没上进心了
下一篇:挨打永久加防御,神魔都打不动我