AI說不出的隨機數,成了鑑別套殼大模型最好的照妖鏡。

數字生命卡茲克
數字生命卡茲克2026年7月21日
昨天看到了一篇論文,特別有意思,讓我連夜讀完了。
論文叫《One Token Is Enough》,翻譯過來叫《一個Token就夠了》,7月11號剛掛到arXiv上,來自布拉格經濟大學的研究員托馬什·布魯克納。
這哥們爲了解決被一些API中轉站掛羊頭賣狗肉的行爲(比如說是Opus 4.8結果賣你GLM 5.2,怒掙數倍利潤,很多使用者一時還真分辨不出來),然後做了一個有趣實驗,他對165個AI模型,反覆問同一個無聊透頂的問題。
就是:
“給我一個1到100的隨機數。”
就像這樣,比如我去試了一下,Claude Fable 5的回答,是73。
然後,每個模型問了30遍。

再把每個模型的回答統計了一下分佈。

結果出來以後,太好玩了。

GPT-4o,30次回答裏最愛說42、37和57,這三個數字佔了它大半壁江山,其他數字只是偶爾出現。
Claude Sonnet 5更離譜,30次回答裏瘋狂輸出47。
Llama 3.3,則多數是53。
然後最離譜的是Qwen3-Max,30次,全部是42,一次都沒有變過,無一例外。
隨機數嘛,按我們正常對這個東西的理解,那顧名思義,它應該是隨機的,1到100,每個數字被選中的概率應該是1%,分佈應該是純粹的均勻鋪開。
但實際上這些模型的回答分佈,其實完全可以說,跟隨機這兩個字,屁關係都沒有。
而且非常好玩的是,每個模型的執念都不一樣。
GPT-4o癡迷42和37,Claude偏愛47,Qwen死守42,Llama鍾情53。
就好像每個AI的靈魂深處,都藏着一個思想鋼印,只要讓你隨便說個數字,你腦子裏第一反應都是那個數字。
而且不光是數字,布魯克納還測了隨機顏色、隨機動物、隨機城市、拋硬幣等等,10類任務,總共往OpenRouter上發了32萬6千條請求。
結論都是一樣的,對於模型而言,根本沒有什麼隨機,一切都是確定的,就像有一個無形的大手,控制了他們所有的回答。
當然,如果是瞭解AI比較多的朋友,可能到這裏,會不屑一顧,說AI不會真隨機,這事大家不是早就知道了嗎,有啥可大驚小怪的啊。
確實沒毛病,2023年就有人做過LLM隨機數偏差的實驗,2024年也有人研究過LLM拋硬幣的序列偏差,發現模型不僅不隨機,還表現出跟人類類似的模式偏好,只是更極端。2025年更是有人已經發現不同模型有不同的幸運數字,跟語言和文化背景還有關,這些都是已知的學術發現。
但是大家,都把這些發現,歸爲了模型的一種特質,一種缺陷,然後就沒有然後了。
所以說,爲啥 布魯克納這哥們是個天才呢,他提出了一個很有意思的想法,如果這些所謂的缺陷,所謂的思想鋼印,多個組合起來,那豈不是,就成了每個模型的身份證了???
那每個模型如果有了自己的身份證,我們是不是就不需要被那些中轉站騙了?我們是不是可以讓模型輸出所謂的多個隨機的答案,來驗證這個身份證, 看看中轉站有沒有偷偷在我們買的模型裏摻水呢?
於是,在一系列的實驗以後,這篇論文面世了。
布魯克納管這個叫Behavioral Fingerprint,行爲指紋。
就像每個人的指紋獨一無二一樣,每個模型在這些隨機問題上的概率分佈也是獨一無二的。
只需要模型輸出一個 Token,就夠鎖定你是誰。
這玩意,真的對現在如此氾濫的中轉站、或者所謂的降智判斷,太有用了。

大家也都知道,國內用Claude、GPT這些模型,很多人走的都是中轉站,個人用戶掛魔法自己搞個訂閱還好說,但是對公司層面就更沒得選了,不可能給幾十上百號人一個個註冊海外賬號,基本都是自建或者接第三方中轉,統一走API。

上次Anthropic大面積封號的時候我也聊過這事。

但這個生態裏,有一個幾乎所有人都在默默忍受的問題。

你付了Claude Opus 4.8的錢,你收到了一段回覆。

但這段回覆到底是Opus 4.8生成的,還是中轉站偷偷給你換成了GLM-5.2甚至更便宜的貨,你根本無從驗證。

這個事是有實錘的,今年3月份的時候,在X上還鬧得沸沸揚揚。

那時候,一羣來自CISPA的研究人員就審計了17家中轉API。

他們用能力測試、統計檢驗和一套叫LLMmap的模型指紋技術,真的抓到了多個疑似偷換模型的端點。

有人賣給你GPT-5,指紋卻更像GLM-4或者DeepSeek-V3,有人賣DeepSeek Reasoner,背後跑的卻像普通DeepSeek Chat。

而且這事之所以這麼普遍,純粹是經濟結構決定的。

推理成本跟模型大小几乎線性掛鉤,700億參數和80億參數的模型推理成本差五到十倍,中轉站把你付費的大模型悄悄換成小模型或者量化到極致的版本,你在日常對話、翻譯、簡單問答這些場景下根本感知不出區別。比如你問今天天氣怎麼樣,70B和8B給你的回答可能一模一樣。

省下來的差價,就是純利潤。

只有在複雜推理、長文寫作、代碼這些場景下差距纔會冒出來,但那時候錢已經交了。

所以如何來辨別中轉站給你的API到底有沒有摻水,或者看看你買的API,到底是不是一個真正對應模型的API,就成了剛需。

但問題在於, CISPA 這套 LLMmap的 方法依然很重。

你要準備專門的測試題,收集完整回答,建立模型數據庫,還要訓練分類器,一般人根本用不起來。

布魯克納真正牛逼的地方就在這裏。

他把這套複雜的模型驗明正身,壓縮成了一件近乎荒誕的小事。

就問AI,給我一個隨機數,然後數它的回答。

而且這個方法有一個特別精妙的地方,就是中轉站拿它完全沒辦法。

傳統的對抗性探針有個致命弱點,就是Prompt太特殊了,你發一條精心構造的、一看就不像正常對話的請求過去,中轉站一旦發現你在探它,臨時給你切成真模型就完了。

但“說一個1到100的隨機數”這種話,放在任何聊天記錄裏都毫不起眼,跟你問天氣預報沒任何區別。

而且布魯克納的探測任務都是語義層面的,“說一個隨機數”“說一個隨機顏色”,這類問題可以用無窮多種方式改寫、翻譯,你用英文問和用阿拉伯語問測出來的是同一個模型的不同切面,但每個切面都帶着它的身份信息。

他把這整套方法設計成了一個類似生物特徵識別的協議,就類似於你用指紋解鎖手機一樣,先在可信的官方API上採集一份參考指紋,然後對你要驗證的端點採集待驗指紋,兩份之間算一個Jensen-Shannon散度(衡量兩個概率分佈差多少的指標),距離小於閾值就認證通過。

用全部40個探測單元跑完,驗證的準確率能到什麼程度呢。

大概相當於,你拿兩份指紋放在它面前,一份是真的一份是冒充的,它判斷錯誤的概率只有7.3%,就算只用8個單元(也就是大概120條請求),錯誤率也只有10.6%左右。

這個跟上文我們提到的 LLMmap的準確性已經差不多了,但是要簡單太多了。

而且165個模型跑完以後,布魯克納發現了一個相當勁爆的案例。

一個叫Palmyra X5的端點,在OpenRouter上以某公司自研旗艦的身份售賣。

但它的行爲指紋,跟通義千問的開源模型Qwen3-235B,幾乎一模一樣,差距只有0.141。

布魯克納的系統會給任意兩個模型的指紋算一個相似度分數,數字越小代表越像。

同一個模型在兩個不同供應商那裏各部署一套,因爲服務器環境不一樣,兩邊的指紋也不會100%一致,這種自己跟自己比的正常波動大概是0.140。

Palmyra X5跟Qwen3-235B的差距是0.141,和一個模型自己跟自己比的波動幾乎一模一樣。。。

這下事情就非常的尷尬了。。。

布魯克納在論文裏措辭很剋制,說這只是統計性觀察,不是對意圖的指控。

但是,數據和代碼全部公開,任何人都可以復現。

網址在此:https://zenodo.org/records/21278557

整套東西,非常有意思,而且不止數字,還有顏色等等等等,這個擴展性和上限,我覺得極高。

模型的隨機並不隨機,給了這種行爲指紋非常值得探索的空間。

我覺得比審計結果本身更好玩的,是一個更底層的問題。

AI爲什麼就是不能生成真正的隨機數。

之前幫影視颶風弄了個視頻,就聊過這個話題,在AI視頻裏拋硬幣,其實概率根本不是55開,是73開。

在這個 布魯克納的測試裏,也是一樣的。

1到100的隨機數這個任務的標準答案,所有人都知道,應該是均勻分佈,100個數字每個被選中的概率嚴格1%。

但165個模型,一個都沒做到。

論文裏用了一個叫熵的指標來衡量回答到底有多隨機,應該有無數人見過。

這玩意你可以簡單理解成不可預測程度,數字越高代表越難猜,越接近真正的隨機。如果1到100的分佈是完全均勻的,熵應該是6.64 bit,也就是你幾乎沒法猜到下一個數字是什麼。

但165個模型的中位數只有1.0 bit,差了五六倍。

AI回答隨機數的時候,信息量只有真隨機的六分之一,高度集中,高度可預測,高度非隨機。

其實這個事,心理學和行爲經濟學研究了很多年。

不光AI,人類也不會生成隨機數。

有一個經典實驗,讓一羣人閉上眼睛說一串隨機數字,結果呢,發現人類非常強烈的傾向避開重複、避開相鄰數字、偏好奇數。

你讓100個人說一個1到10的數,7被選中的概率遠遠高於10%,因爲人腦覺得7看起來比較隨機,而5和10看起來不夠隨機。

大家可以回想一下,自己是不是這樣。

我們看到的絕大多數隨機,可能只是隱藏因果關係在認知中的投影。

AI面臨的是一模一樣的困境,只不過原因不同。

真正的隨機,要求你是一張白紙。

但大模型恰恰是人類有史以來造出來的信息密度最高的非白紙。

訓練數據是數十萬億的token,幾千年文明的總和。

每一個權重參數都編碼着某種規律、某種偏好、某種從語料裏沉澱下來的肌肉記憶。

所以你讓它隨便說一個數,它根本沒法真正隨便。

它只能從自己見過的所有文本里,找到一個最像隨機數的答案。

42爲什麼被那麼多模型偏愛?

因爲它是《銀河系漫遊指南》裏“生命、宇宙以及一切問題的終極答案”。

7爲什麼總被人類選中?

因爲它在宗教、文化、文學和日常語言裏,被反覆賦予神祕、幸運和特殊的意義。

37、47、53這些數字爲什麼頻繁出現?

因爲它們是奇數,是質數,不圓整,不對稱,看上去更像一個沒有經過思考、隨手蹦出來的數字。

可恰恰因爲所有人都覺得它們更隨機,它們才變得最不隨機。

大模型只不過把人類潛意識裏的這種偏見,壓縮、放大,然後寫進了自己的概率分佈裏。

我們總覺得模型是一個冷冰冰的數學機器,每次回答都來自概率採樣,充滿不確定性。

但當你把幾十萬次回答遍歷回測,把那些看似隨意的選擇疊加在一起,你會發現它其實一點都不隨意。

它們也有自己的偏愛,有自己的執念。

參數可以被量化,系統提示詞可以被修改,名字可以被重新包裝,外面甚至可以套上一層完全不同的殼。

可它在億萬次訓練中形成的概率習慣,依然會從一個小小的Token裏漏出來。

愛因斯坦說過,上帝不擲骰子。

而AI,也不擲骰子。

它每一次以爲自己在擲骰子的時候。

擲出來的,都是自己。

以上,既然看到這裏了,如果覺得不錯,隨手點個贊、在看、轉發三連吧,如果想第一時間收到推送,也可以給我個星標⭐~謝謝你看我的文章,我們,下次再見。

>/ 作者:卡茲克

>/ 投稿或爆料,請聯繫郵箱: [email protected]