这次开源模型圈真有点电脑城组装机的味道了


Baseten 没有重练一个完整多模态模型,而是把 Kimi K2.6 的 MoonViT 视觉编码器,接到原本只会处理文字的 GLM-5.2 上。GLM 的 744B 主体没动,视觉塔也全部冻结,真正训练的只有中间约 4950 万参数的 PatchMerger
结果在 MMMU-Pro 做到约 55%,官方称接近 Claude 4.5 Haiku。换句话说,以后替开源模型增加视觉、语音或其他能力,可能真的不用每次都从头烧一遍训练费用,挑现成零件接起来就行
不过先别只看「4950 万参数很便宜」。这套权重约 466GB,完整 100 万上下文要 8 张 B200,跑 256K 也要 4 张。研发门槛确实下来了,部署账单可一点都不亲民
所以我觉得这件事对模型公司未必全是好消息,能力越来越容易被拼出来,真正继续收租的可能还是 $NVDA、推理平台和云端托管商。以后大家不只下载模型,可能还得先学会组装模型🤣
#Ourbit 不只 Crypto,全球熱門資產一站交易。
NVDA-0.83%
此页面可能包含第三方内容,仅供参考(非陈述/保证),不应被视为 Gate 认可其观点表述,也不得被视为财务或专业建议。详见声明
  • 赞赏
  • 评论
  • 转发
  • 分享
评论
请输入评论内容
请输入评论内容
暂无评论