
一个 8B「Transformer 混合专家」干三件事美团 LongCat 把「看图、生图、改图」塞进同一个 ViT 块里Hugging Face 每日论文2026-08-24 精选8 月 24 日 Hugging Face 每日论文榜第九名的位置是一篇来自美团 LongCat 团队的 UniSpacearxiv:2608.08676。它给出了一个 8B 参数的 Mixture-of-Transformer-Experts 模型让看图image understanding、生图text-to-image generation、改图instruction-based image editing三件事在同一个被冻结的视觉 ViT 里完成。最反常识的结论是原本被认为「只会做语义理解」的 ViT 块本身就具备保留细粒度视觉细节的能力——错的是参数化方式而不是模型。一个被默认的错ViT 的 token 只能做语义理解过去几年多模态视觉编码器CLIP、ViT、SigLIP 等的训练目标是「让最后一层 token 和文本语义对齐」。这种对齐把 ViT 推向了语义抽象——它能告诉你「图里有一只猫」但很难告诉你「猫的左耳尖有一道折痕」。后果就是想做生图或改图的研究者必须再搭一套独立的 VAE变分自编码器或者重建分支从图像像素出发单独编码细节。这等于视觉信息被「劈」成两份一份走语义通路给多模态理解用一份走像素通路给生图和改图用两条通路在训练时互相不通信最后只能在推理时拼到一起。这种「双通路」的设计是当前几乎所有统一视觉模型unified vision model的默认做法。UniSpace 的论文核心论点是这种「劈成两份」是不必要的。问题不在 ViT 本身问题是 ViT 的 patch 参数化把细粒度信息过滤掉了——它不是不能保留是参数化路径把它丢掉了。Patch Reparameterization换一种把图像「喂给」ViT 的方式论文给出的解法叫 Patch Reparameterization。它做的事非常直接在保留原有语义通路的同时再加一条「重建感知」的 patch embedding 通路把细粒度的视觉信息送到同一套被冻结的 ViT 块里。具体到结构上UniSpace 的 pipeline 是这样的图像进入模型时同时生成两份 patch embedding——一份走「语义版」沿用 ViT 的默认投影一份走「重建版」专门为像素级重建而训练两份 embedding 一起送进被冻结的 ViT Transformer 块模型在内部用 MoTEMixture-of-Transformer-Experts决定每条信息走哪几个专家输出的 token 既能服务语义任务看图又能服务像素任务生图、改图这套设计的精妙之处是原始 ViT 的权重被完全冻结。模型不需要重新训练一个 ViT而是在冻结的 ViT 外面再搭一套轻量的「再参数化通路」。这意味着任何已经训好的语义 ViT 都可以被零成本不重训地改造为 UniSpace——研究者只需要重训那套 patch embedding 和 MoTE 层。模块是否冻结训练成本作用ViT Transformer 块冻结0同时承载语义与重建信号语义 patch embedding可选冻结低提供原有语义通路重建 patch embedding训练中注入细粒度视觉信息MoTE 路由训练中决定不同任务走哪组专家8B MoTE让「三件事」共用一份表征UniSpace 的最终规模是 8B 参数采用 Mixture-of-Transformer-Experts 架构。这里的 MoTE 和常见的 MoEMixture-of-Experts有两个区别MoE 通常指「同一 Transformer 层里、FFN 部分切成多个专家」注意力层是共享的MoTE 指「整段 Transformer 块都被切成专家」不同任务可以在不同子专家里跑完整条前向这个区别对生图和改图特别重要——生图需要长时间跨 patch 的注意力扩散改图需要短时间精细化控制。两种计算模式如果共享注意力层就会互相干扰用 MoTE 切成两组独立子专家后它们可以并行跑而互不污染。8B 这个规模也不大不小——比 BLIP-2、InstructBLIP 这类多模态理解模型大比 SDXL、Flux 这类纯生图模型小。UniSpace 的设计哲学很明确把「视觉空间统一」这件事做扎实而不是在任何一个单项任务上追 SOTA。论文给出的实际能力文生图 指令式图像编辑论文在系统级评估里展示了 UniSpace 的两件实用能力文生图text-to-image给定一段文本模型从「一张空白潜变量」出发生成图像。和标准文生图模型相比UniSpace 的优势是「它同时也懂语义」所以在「文本 → 图像」的对齐上更稳定指令式图像编辑instruction-based editing给定原图 一段自然语言指令比如「把背景换成雪山」模型在原图基础上改写。UniSpace 的优势是「它同时有像素通路」所以改写后的图像在保留主体细节上更干净两个能力是同一份模型权重提供的推理时不必切换模型、不必切换数据集、不必切换 prompt 模板。这是「统一视觉空间」这个研究目标在 2026 年 8 月的一次明确回答不再需要语义 ViT 像素 VAE 两套并联而是把两件事塞回同一个 ViT 块。不再需要独立 VAE 通路这件事对工程意味着什么UniSpace 最值得工程团队关注的结论是「不需要独立 VAE 通路」。这件事的影响不止学术——它在工程上有两个直接好处第一部署成本下降。一份 8B UniSpace 取代「ViT VAE 生成器」三件套后推理服务的 GPU 显存峰值会显著降低模型并行策略也简单得多。这对在生产环境跑图像生成的团队是直接的工程收益。第二训练数据利用率上升。过去做生图和改图需要单独收集大量「图-文-图」三元组UniSpace 用同一份多模态理解数据集就能训练数据的边际效用被拉高。这对算力有限的中小团队尤其重要——他们可以用更少的数据得到「统一视觉空间」的能力。局限与未验证单一表征空间的代价论文也诚实地给出了几条边界。第一UniSpace 的生图与改图能力在单任务 SOTA 模型面前仍有差距。论文里给出的对比是「接近」而不是「超过」。这意味着如果你当前的任务只关心生图质量那 SDXL、Flux 这类专业模型仍然是更直接的选择UniSpace 的价值在「三件事都要做」的场景里。第二冻结 ViT 的选择是有代价的。ViT 一旦冻结整个模型就锁死在原 ViT 的归纳偏置上。如果原 ViT 训练数据偏向自然图像那 UniSpace 在医学图像、遥感图像、卫星图像等长尾领域的表现就需要重新评估。第三MoTE 的可扩展性还需要更多验证。当专家数从论文里的几组扩展到几十组、上百组时路由的训练成本、专家负载均衡、推理时的路由延迟都会变成新问题——这是「MoE 类架构通病」UniSpace 也不例外。为什么这篇论文值得现在就去看从研究脉络看UniSpace 给「统一视觉表征」这条路线补了一块关键拼图。过去研究者要么选「双通路并联」要么选「重训一整个多模态大模型」前者部署重、后者训练贵。UniSpace 用 Patch Reparameterization 走了一条「冻结 ViT 轻量再参数化」的中间路线为以后做统一视觉表征的研究者提供了一个低成本的起点。从工程视角看UniSpace 的代码和模型权重大概率会开源在美团 LongCat 的开源生态里。如果你的团队已经在做多模态产品、并且为「ViT VAE 生图器」三件套的部署头疼这是一篇可以直接对照实验的论文。读完这篇论文最值得记住的一点是「统一表征」不是一个必须把所有任务都打到 SOTA 才算赢的概念——它真正的价值是把「同一份视觉信号被反复处理」这件事在结构层面干掉。UniSpace 用 8B 参数和冻结 ViT 做到了这件事是 2026 年 8 月视觉多模态领域一个值得仔细读两遍的工作。