一、
大家關注衍生模型嗎?
說實話,我以前是不關注的。基於其他模型加工出來的模型,能力都由底層模型決定,給人一種仿製品和正品的感覺,好像沒啥可關注的。
但是,我最近遇到一個朋友,他讓我的想法發生了變化。
他說,不少前沿團隊其實都在探索“衍生模型”這條路子。在這些實驗室裏,大家甚至都認爲, 後訓練是目前創新最多的領域 。
因爲對於模型開發來說,開發衍生模型其實是更合理的行爲。 別人花了大價錢訓練出來的權重,免費開源出來,爲什麼不利用呢? 對於原始模型,做一些強化,以較小的代價獲取想要的結果,這很值得探索。
聽上去好像很有道理啊。
他進一步舉例,他們現在就在做強化學習模型,基於目前很紅的 GLM 5.2 打造出來了 Macaron V1 [1] (馬卡龍),做了後訓練和功能增強。
GLM 5.2 的評分已經很好了,他們修改以後,自己測了基準,分數還更高了。
上圖中,藍色柱子是 Macaron V1,綠色柱子是 GLM 5.2。
下面我就說說他們的做法,如何基於別人的模型進行開發。大家可以從中瞭解衍生模型是怎麼來的。
二、
他們採用的方法叫做 Mixture-of-LoRA(MoL)。
根據我的理解,MoL 架構大概就是下圖這個樣子。這是我畫的,不一定準確。
簡單說,就是額外增加一個路由層,下面掛載了四個 1B 參數的 LoRA 專家(微模型)。
LoRA 是 Low Rank(低序)的縮寫,表示這裏的專家比 GLM 5.2 內置的專家,級別要低。
路由層收到用戶輸入的內容,會在四個專家裏面挑選一個進行處理,再將專家的處理結果與原始模型 GLM 5.2 的結果進行加權融合,得到最終結果。
這種結構的好處,就是 專家是外掛的,可以根據需要進行增加,不會動搖已有知識 。不同的專家還可以組合。缺哪方面的行業專家,直接外掛一個就行了,不需要改變原始模型。
有些同學可能已經看出來了,這種 MoL 架構跟“混合專家模型(MoE)”很像。確實如此,我覺得原理是一樣的,不同之處是 MoE 是模型的內部專家,MoL 是模型的外部專家 。
三、
回到上面這張圖,可以看到 Macaron V1 掛載了四個外部專家。
• LoRA0:對話(chat)。 • LoRA1:智能體(agent),可以理解成對應 OpenClaw 的能力。 • LoRA2:編程(coding)。 • LoRA3:可視化渲染(UI4A)。
這就是它爲 GLM 5.2 優化的四個能力,目標是微調原始模型的行爲,讓它更符合用戶需求。
這種外掛專家,不僅可以加強能力,還能改變原始模型的很多參數。
比如,GLM 5.2 的上下文窗口是100萬 Token,但是 Macaron V1 加大到200萬 Token。他們將這種方法開源了,項目名爲 LongStraw [2] ,好像對於各種模型都適用,可以增大現有模型的上下文窗口。
讀到這裏,大家應該明白了, 衍生模型不是原始模型的簡單復刻,而是深度加工,可以改變行爲和增強功能 。
四、
我要來了 Macaron V1 的 API,測了一下,看看跟原始的 GLM 5.2 有沒有差異。
我主要測它外掛的專家,第一個就是測試對話和文本處理。
測試一:以一男一女對話的形式,介紹北京的生活。
Macaron V1
GLM 5.2
這兩段對話差異很大,一段是介紹老北京的生活,一段是介紹北京打工人的生活。但是從各方面看,文學性、內容豐富、閱讀感受等,還是前一段的結果更理想。
看來 Macaron V1 的外掛專家,對 GLM 5.2 的改變相當大。
五、
接下來,測試代碼能力。要求是生成一個 2D 的網頁遊戲《憤怒的小鳥》。
Macaron V1
GLM 5.2
首先,兩者的 UI 很相似,小鳥和磚頭的樣式都很接近,說明 Macaron V1 確實是基於 GLM 5.2 衍生的。
但是,Macaron V1 明顯實現得更好,不僅多出了磚頭上面的小豬,而且撞擊磚頭的效果也更生動,遊戲性更強,說明外掛的 Coding 專家也是起作用了。
我順便測了上週剛發佈的 Kimi K3,讓它也生成《憤怒的小鳥》。不知爲何,結果很不理想,小鳥甚至都彈不出去。
Kimi K3
六、
Macaron V1 還有一個 GLM 5.2 沒有的特色功能,就是 可視化渲染的專家 UI4A 。它能夠在 Web 窗口實時可視化展示模型的生成結果。
這個功能最好跟開源工具 macaron-artifacts [3] 配套使用。那是一個定製的大模型 Web 界面,裏面就實現了 UI4A 的可視化展示。
安裝以後,它會起一個本地服務
http://localhost:7878
,就是基於瀏覽器的大模型 Web 使用前端。
這個對話框的生成結果就是可視化展示,即對話結果會以圖形方式展示,用戶還能跟圖形互動。
舉例來說,你要求生成一個 3D 魔方,它就實時展示出來,你還可以在窗口直接操作魔方,請看視頻。
Macaron V1 UI4A
作爲對比,GLM 5.2 的 官方 Web 界面 [4] ,同樣的提示詞只會展示代碼和文字(下圖)。
七、
經過上面的簡單測試,可以看到,Macaron 的 Coding 表現要比 GLM 5.2 好一些,還加入了自己的特點,比如生活化對話、GUI、2M 長上下文等。
作爲 GLM 5.2 的衍生模型, Macaron V1 不僅具有 GLM 5.2 的功能和表現,還做了深化和拓展 ,優化了代碼的生成結果。
費用方面,兩者的定價是一樣的。
因此,個人的日常使用可以考慮這個模型。它相當於 GLM 5.2 + 外掛的四個專家,而且這四個專家都針對個人生活場景(對話、Agent、代碼和可視化渲染),實用性很強。
總之, 如果你要使用某個大模型,可以同時關注它的衍生模型,有時候可能是更好的選擇 。
(完)
References
[1]
Macaron V1:
https://macaron.im/mindlab/research/introducing-macaron-v1
[2]
LongStraw:
https://github.com/MindLab-Research/longstraw
[3]
macaron-artifacts:
https://github.com/mindverse-ltd/macaron-artifacts
[4]
官方 Web 界面:
https://bigmodel.cn/trialcenter/modeltrial/text?modelCode=glm-5.2