这次开源模型圈真有点电脑城组装机的味道了
Baseten 没有重练一个完整多模态模型,而是把 Kimi K2.6 的 MoonViT 视觉编码器,接到原本只会处理文字的 GLM-5.2 上。GLM 的 744B 主体没动,视觉塔也全部冻结,真正训练的只有中间约 4950 万参数的 PatchMerger
结果在 MMMU-Pro 做到约 55%,官方称接近 Claude 4.5 Haiku。换句话说,以后替开源模型增加视觉、语音或其他能力,可能真的不用每次都从头烧一遍训练费用,挑现成零件接起来就行
不过先别只看「4950 万参数很便宜」。这套权重约 466GB,完整 100 万上下文要 8 张 B200,跑 256K 也要 4 张。研发门槛确实下来了,部署账单可一点都不亲民
所以我觉得这件事对模型公司未必全是好消息,能力越来越容易被拼出来,真正继续收租的可能还是
$NVDA、推理平台和云端托管商。以后大家不只下载模型,可能还得先学会组装模型🤣
#Ourbit 不只 Crypto,全球熱門資產一站交易。