<?xml version="1.0" encoding="utf-8"?><?xml-stylesheet type="text/xsl" href="https://tech.meituan.com/rss.xsl"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <atom:link href="https://tech.meituan.com/rss.xml" rel="self" type="application/rss+xml"/>
    <title>美团 · 技术团队</title>
    <link>https://tech.meituan.com/</link>
    <description>美团技术团队|前端|后端|IOS|安卓|客户端</description>
    <language>zh-CN</language>
    <pubDate>Tue, 28 Jul 2026 07:19:00 GMT</pubDate>
    <lastBuildDate>Tue, 28 Jul 2026 07:19:00 GMT</lastBuildDate>
    <generator>@vuepress/plugin-feed</generator>
    <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
    <item>
      <title>美团正式发布 CatPaw：全场景 AI Agent，从个人提效到企业智能化</title>
      <link>https://tech.meituan.com/2026/07/28/CatPaw-LongCat.html</link>
      <guid>https://tech.meituan.com/2026/07/28/CatPaw-LongCat.html</guid>
      <source url="https://tech.meituan.com/rss.xml">美团正式发布 CatPaw：全场景 AI Agent，从个人提效到企业智能化</source>
      <description>搭载美团 LongCat 2.0 的全场景 AI Agent 平台 CatPaw 正式上线，我们将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。</description>
      <content:encoded><![CDATA[<p>本月，美团 LongCat 2.0 已<a href="https://tech.meituan.com/2026/07/12/LongCat-2.0-Open-source.html" target="_blank" rel="noopener noreferrer">正式开源</a>，总参数 1.6T，平均激活约 48B，动态范围 33B 到 56B，原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步，让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”，才是真正的考验。</p>
<p>现在，搭载 LongCat 2.0 的美团全场景 AI Agent 平台 <a href="https://catpaw.meituan.com/" target="_blank" rel="noopener noreferrer">CatPaw</a> 正式上线，将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。</p>
<p>不仅如此，依托美团十余年深耕本地生活的行业积累，CatPaw 将商家经营、服务履约与消费决策的深度认知融入其中，助力企业构建 AI 数字员工、推进业务智能化升级。</p>
<p>目前，CatPaw 已在美团内部大规模落地：累计覆盖 9 万员工、搭建 Agent 3 万个，并在多个真实业务场景中完成验证。</p>
<h2>全时段运行，多终端协作的 AI 智能工作台</h2>
<h3>01 移动/PC/云端，全时段多端协作</h3>
<p>提供独立的<strong>移动端 App 与 PC 客户端</strong>，双端任务实时同步、无缝协作。移动端支持随时发起任务、查看进度与远程确认关键决策；PC 端专注本地深度执行，具备文件操作、浏览器控制与终端命令等完整能力。</p>
<p>云端模式支持 <strong>7 × 24 小时不间断运行</strong>，即使本地设备关机或断网也不受影响。长程任务与定时任务于云端持续运转，完成后随时打开手机或电脑即可查看成果。</p>
<p><img src="https://p0.meituan.net/meituantechblog/a690ba49597fd8720f96ea56573b54cc151290.png" alt=""></p>
<h3>02 深耕本地生活，融合美团业务生态</h3>
<p>在全场景通用 AI Agent 能力的基础上，CatPaw 进一步融入了美团在本地生活领域的全链路行业认知。从门店经营、评价体系、营销转化到履约配送，这些深度积累已被封装为即装即用的<strong>专家与技能</strong>，覆盖门店评价诊断与优化、商品文案生成、营销物料设计评估、活动策划、经营数据分析等场景。</p>
<p>CatPaw 既是人人可用的<strong>全能 AI 助手</strong>，也是真正懂本地生活生意的智能搭档。</p>
<p><img src="https://p1.meituan.net/meituantechblog/864f86011bdcc6a2428f980323605284136476.png" alt=""></p>
<h3>03 专家与技能，丰富能力即装即用</h3>
<p>CatPaw <strong>支持 AI 专家</strong>，每位专家<strong>集成多项技能与子代理，高效完成特定领域的复杂任务</strong>。从专家广场<strong>一键安装</strong>即可使用，也可通过对话将自己的工作方式快速封装为专属专家，团队共享复用。</p>
<p>平台内置丰富的技能库，开箱即用。内嵌浏览器还<strong>支持操作过程一键录制</strong>，将日常高频流程自动生成专属技能，让个人与团队经验沉淀为可复用的数字化资产。</p>
<p>支持<strong>跨会话长期记忆</strong>，自动记忆用户的个性化偏好、操作习惯与历史上下文，跨设备、跨对话保持连续理解，越用越懂你。</p>
<p><img src="https://p0.meituan.net/meituantechblog/7f715c1d858cead54dad86e431e30153313940.png" alt=""></p>
<h3>04 对话即交付，多 Agent 自主协同</h3>
<p>只需明确最终目标，Agent 便会<strong>自主规划步骤并在授权范围内深度执行</strong>：读取文件、操作浏览器、运行终端命令，直接交付 Excel、可视化报告或代码等可用成果。</p>
<p>面对跨领域的复杂任务，系统动态进行任务拆解，<strong>调度多个具备专属工具的 Agent 并发处理</strong>，各 Agent 在独立环境中互不干扰，进度实时可见，结果自动汇总。</p>
<p><img src="https://p0.meituan.net/meituantechblog/2122a550b13a060033f2a0343680ccfa345379.png" alt=""></p>
<h2>从 AI 工作台到业务系统：Managed Agents</h2>
<p>CatPaw Managed Agents 是企业级 AI Agent 开发与托管平台，提供开箱即用的工程底座，<strong>无需从零搭建底层基建</strong>，即可快速构建、部署与管理专属 Agent。</p>
<h3>01 数字员工，扫码即用灵活配置</h3>
<p>数字员工是运行在飞书、企微等 IM 中的 AI 虚拟同事，@ 即可唤醒使用。<strong>平台预置多种角色模板，扫码即用</strong>；美团在本地生活领域的长期积累也已沉淀为专属模板，不只是通用的聊天机器人，而是理解业务的行业 AI 助手。</p>
<p>同时支持通过 <strong>AI 对话描述需求，快速生成专属数字员工</strong>。从 Agent 创建到环境部署、会话初始化，<strong>全程自动完成，无需手动配置</strong>。</p>
<p>提示词、知识库、凭证、工具均支持在线管理，团队可按业务场景灵活搭建。</p>
<p><img src="https://p0.meituan.net/meituantechblog/a4a4286eab88dc7a9fb8ad4a359f57d3202455.png" alt=""></p>
<h3>02 企业级安全，数据隔离可控</h3>
<p><strong>Agent 运行环境严格隔离</strong>，租户间数据互不可见。凭证集中托管，<strong>确保 Agent 全程零接触敏感资产</strong>。</p>
<p>支持<strong>分级权限管控</strong>与私有化部署，全面满足企业合规与安全审计要求。</p>
<p><img src="https://p0.meituan.net/meituantechblog/d8ea3582939d36764915e7b5f848790e478278.png" alt=""></p>
<h3>03 Agent 托管运行，持续在线</h3>
<p>支持<strong>按需配置运行环境</strong>，一键托管上线，<strong>资源动态扩缩</strong>。</p>
<p>沙箱环境轻量隔离，百毫秒级冷启动，闲时自动释放，兼顾响应速度与成本。</p>
<p><img src="https://p0.meituan.net/meituantechblog/1c65c6d75279f7085030ad763eeff3b2368282.png" alt=""></p>
<h3>04 可视化运维，全链路可观测</h3>
<p>提供统一的运维管理界面，<strong>会话记录完整留存可追溯</strong>，支持在线调试实时排查问题，<strong>模型调用量与消耗清晰可见</strong>。</p>
<p>多维度数据统计与分析，帮助团队持续评估 Agent 表现、优化运行效果。</p>
<p><img src="https://p0.meituan.net/meituantechblog/4344c5e90e47733d89ef9ee3d792f88f140185.png" alt=""></p>
<h2>从个人提效到组织智能化：与商家一起探索更多可能</h2>
<p>在全场景 AI 能力之上，CatPaw 提供<strong>组织级的管理与管控能力</strong>，满足商家**规模化落地 AI **的管理需求。</p>
<p>CatPaw 提供统一管理后台，支持团队账号体系。团队成员与权限集中管理，用量明细与消耗实时可查，成本清晰可控。AI 专家和技能支持按团队或角色集中配置与精准下发，一线员工开箱即用，AI 能力快速转化为实际生产力。</p>
<p>此外，CatPaw 还提供与<strong>美团业态深度关联的专属专家与技能</strong>，覆盖外卖、服务零售、医药健康等多个行业。以服务零售为例，美团商家运营专家整合了经营数据分析、评价管理、门店装修等核心场景，帮助商家实现智能化运营。</p>
<p>CatPaw 将持续深入行业场景，让 AI Agent <strong>真正成为驱动经营增长的数字化伙伴</strong>。更多能力陆续开放中，<strong>诚邀美团合作商家抢先体验</strong>。</p>
<p><strong>体验地址</strong>：<a href="https://catpaw.meituan.com/" target="_blank" rel="noopener noreferrer">https://catpaw.meituan.com/</a></p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/a690ba49597fd8720f96ea56573b54cc151290.png" type="image/png"/>
    </item>
    <item>
      <title>下一代搜索智能体评测基准！美团开源LoHoSearch，用知识图谱校准AI能力认知</title>
      <link>https://tech.meituan.com/2026/07/24/LongCat-LoHoSearch.html</link>
      <guid>https://tech.meituan.com/2026/07/24/LongCat-LoHoSearch.html</guid>
      <source url="https://tech.meituan.com/rss.xml">下一代搜索智能体评测基准！美团开源LoHoSearch，用知识图谱校准AI能力认知</source>
      <description>过去一年，我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上，顶尖模型准确率从最初的 30% 区间迅速攀升至 90% 以上。然而，当基准迅速饱和，其区分模型能力的价值也随之递减。</description>
      <content:encoded><![CDATA[<p>过去一年，我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上，顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而，当基准迅速饱和，其区分模型能力的价值也随之递减。</p>
<p><img src="https://p0.meituan.net/meituantechblog/69e86f1a417ef555aed62d74c1152c53108351.png" alt="图1：BrowseComp 准确率进展曲线"></p>
<p>BrowseComp 的题目由人工设计，局限在于只能基于标注者已知的实体和关系构思，无法站在全局知识网络视角判断：哪些条件真的难检索？哪些约束的候选空间足够大？正是这种局限，让我们开始思考另一种可能性：<strong>能不能让机器自己来出题？</strong></p>
<p>美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准，就是把这种可能性变成了现实。</p>
<h2>LoHoSearch 的核心"硬核"看点</h2>
<ul>
<li><strong>知识图谱自动化构造。</strong> 以覆盖762万维基百科实体的知识图谱为基础自动生成题目，替代人工出题。基准含544道经人工核验的题目，覆盖11个领域。</li>
<li><strong>双维度难度控制。</strong> 在生成中系统控制搜索空间与结构复杂度。构建出难度显著高于现有基准的挑战性问题。</li>
<li><strong>当前模型性能表现。</strong> 已评测模型中，GPT-5.5准确率为34.74%；现有上下文管理策略在LoHoSearch上提升幅度为6.8%，低于在BrowseComp上的14.03%。</li>
</ul>
<h2>01 设计原理：让机器出题，需要几部？</h2>
<p>机器出题的前提，是让机器拥有全局视野。整个构建流程可以分为四个环节：<strong>建图 → 控制难度 → 质量把关 → 数据概览</strong>。下面逐一展开。</p>
<h3>1.1 建图：搭建知识图谱，让机器获得全局视野</h3>
<p>LoHoSearch 的第一步，是从完整的英文维基百科出发搭建一张大规模知识图谱：</p>
<ul>
<li>762 万个实体（每个维基页面是一个实体节点）</li>
<li>2.65 亿条有向边（页面正文中指向其他维基页面的超链接）</li>
<li>每个实体的类型取自其 Wikidata P31 类别，实体热度用入度来衡量</li>
</ul>
<p>这张图谱为后续在全局视角下挑选"难题"提供了基础。</p>
<p><img src="https://p0.meituan.net/meituantechblog/158cf7d04a3fd9d5c8b5f171480db1ec450289.png" alt="图2：LoHoSearch 数据构造流程总览（知识图谱构建 → 子图采样 → QA 生成与验证 → 后置过滤与人工复核）"></p>
<p>有了图谱之后，下一个问题是：什么样的题目才算"难"？LoHoSearch 从两个维度来定义难度。</p>
<h3>1.2 控制难度：搜索空间和结构复杂度两个维度</h3>
<p>决定搜索难度的核心有两个维度，而它们恰恰是人工出题最难把控的：</p>
<ul>
<li><strong>搜索空间</strong>：满足一个条件的候选实体有多少。候选越多，排除成本越高。</li>
<li><strong>结构复杂度</strong>：要同时满足多少条件才能锁定答案。条件越多、咬合越紧，求解链条越长。</li>
</ul>
<p>针对这两个维度，LoHoSearch 设计了两种子图结构：</p>
<p><img src="https://p0.meituan.net/meituantechblog/da7dbb937aa30503321fa592d43b0123124986.png" alt=""></p>
<ul>
<li><strong>树结构</strong>主要通过放大"搜索空间"来制造难度。</li>
<li><strong>图结构</strong>则在巨大搜索空间之上，通过引入环形依赖和交叉约束，进一步叠加了"结构复杂度"。</li>
</ul>
<h3>1.3 质量把关：从生成到验证，层层把关</h3>
<p>子图采样完成后，还需要转换为可阅读的自然语言题目。整个转换与验证流程分为三层：</p>
<ul>
<li><strong>题目生成</strong>：从子图抽取维基描述，改写为自然语言问题。</li>
<li><strong>自动验证</strong>：检查问题是否完整覆盖子图关系，并由搜索智能体验证标准答案满足所有条件。</li>
<li><strong>筛选与复核</strong>：排除多答案题和易答题，再由人工审核。</li>
</ul>
<p>经过三层筛选，自动化流程的整体质量表现如下：75.5% 的题目直接通过人工复核，22.3% 经标注员微调后接受，仅有 2.2% 因严重问题被丢弃。</p>
<h3>1.4 数据概览：544道题目，11个主题领域</h3>
<p>LoHoSearch 最终收录 <strong>544 道</strong> 经人工核验的题目。对比树结构和图结构可以看出，图结构子图明显更稠密——节点更多、边数接近前者的两倍，这正对应它更高的结构复杂度。题目内容覆盖音乐、地理与地点、影视、体育等 11 个主题领域。</p>
<p><img src="https://p0.meituan.net/meituantechblog/9be937091fe5f30761bb06ea08a5c4e838213.png" alt="表1：LoHoSearch 数据统计"></p>
<p><img src="https://p0.meituan.net/meituantechblog/55f51f19edf66249bcb164c70a75adb3167617.png" alt="图3：LoHoSearch 的领域分布"></p>
<p><img src="https://p0.meituan.net/meituantechblog/2b54f0c184c018dbd27593bd90f40de0143825.png" alt="表2：各模型在 LoHoSearch 上的性能表现（%）"></p>
<p>最强模型 GPT-5.5 准确率仅 34.74%，DeepSeek-V4-Pro、Claude-Opus-4.6 和 Kimi-K2.6 集中在 15.53%–15.99%，其余模型均低于 14%。这与它们在 BrowseComp 上 80% 以上的表现形成鲜明对照——LoHoSearch 对当前最先进搜索智能体构成了实质挑战。</p>
<h3>洞察一：解一道题，平均工具调用从 35 次增至 61 次</h3>
<p>用 DeepSeek-V4-Flash 作为探针对比两个基准：同一模型在 BrowseComp 上准确率 58.84%，在 LoHoSearch 上仅 10.02%。</p>
<p><img src="https://p0.meituan.net/meituantechblog/234e605bbc7af2f8f7977c212bc62a8290841.png" alt="图4：BrowseComp 与 LoHoSearch 正确轨迹的工具调用次数分布"></p>
<p>解一道 LoHoSearch 题目，平均工具调用从 35 次增至 61 次（+74%），中位数从 26 次升至 59 次。图结构题目准确率仅 8.01%，远低于树结构的 11.89%，印证了结构复杂度是独立于搜索空间之外的额外难度来源。</p>
<h3>洞察二：重复采样收益可观，但天花板依然很低</h3>
<p>对 DeepSeek-V4-Flash 采样 16 个独立回答，结果如图 5 所示。</p>
<p><img src="https://p1.meituan.net/meituantechblog/a011a2b381eef5312e8281e8f32f7449129032.png" alt="图5：并行采样下 pass@N 及三种答案聚合策略的表现"></p>
<p>pass@N 从 N=1 的 9.3% 升至 N=16 的 38.3%，重复采样收益可观，但 38.3% 仍处低位。尝试 16 次仍有六成以上题目无法攻克。三种聚合策略中 best-of-N 表现最优（24.6%），远低于 pass@16 上界，说明模型在答案置信度校准上存在明显不足。</p>
<h3>洞察三：现有的上下文管理策略，在这里已失真</h3>
<p>以标准 ReAct 为基线，测试 Summary 和 Discard-all 两种策略，并加入 Verify 模块。</p>
<p><img src="https://p0.meituan.net/meituantechblog/f59c780873848c6d66609ad9eafc10d651431.png" alt="表3：基于 DeepSeek-V4-Flash 的上下文管理策略消融实验"></p>
<p>表现最佳的组合（Discard-all + Verify）将成绩从 10.02% 提至 16.82%，绝对提升仅 6.8 个百分点，而同一套策略在 BrowseComp 上可带来 14 个百分点的增益。收益收窄的原因在于 LoHoSearch 需要更长的推理链，简单的轨迹压缩或重启无法解决长程搜索中的信息丢失问题——这使其成为下一代上下文管理技术更有价值的试验场。</p>
<h3>洞察四：知识图谱是系统化构造高难度题目不可或缺的基础</h3>
<p>对比两个基准中"隐藏实体"的特征可以发现：</p>
<p><img src="https://p1.meituan.net/meituantechblog/682b8d4610aa31a2be89b70bc27a206a71835.png" alt="图6：隐藏实体分析(a) 隐藏实体的入度分布；(b) 相同流行度下关系搜索空间对比"></p>
<p>其一，BrowseComp 的隐藏实体流行度明显更高，人工出题难以精确控制实体知名度，导致实体偏易。</p>
<p>其二，即便将流行度控制在同一水平，LoHoSearch 的关系搜索空间仍显著更大，实体推断难度远高于 BrowseComp。</p>
<p>这说明人工构建存在系统性局限，知识图谱是系统化构造高难度题目不可或缺的基础。</p>
<h2>02 总结：为下一代智能搜索提供新标尺</h2>
<p>LoHoSearch 的价值体现在三项具体贡献上：</p>
<ul>
<li><strong>基于知识图谱的自动化构造流程。</strong> 以覆盖762万实体的知识图谱为基础自动生成题目，系统控制搜索空间与结构复杂度，突破人工出题的难度上限。</li>
<li><strong>更具区分度的评测标准。</strong> 最强模型 GPT-5.5 准确率仅 34.74%，正确轨迹所需工具调用次数是 BrowseComp 的 1.7 倍。LoHoSearch 为搜索智能体建立了更具区分度的评测标尺。</li>
<li><strong>面向上下文管理研究的挑战性平台。</strong> 最优策略仅带来 6.8% 的提升，远低于其在 BrowseComp 上 14.03% 的增益，表明 LoHoSearch 可成为推动下一代上下文管理技术研究的理想试验场。</li>
</ul>
<p>LoHoSearch 已全面开源，欢迎各大模型前来接受"长程搜索"大考。</p>
<h2>开源链接</h2>
<ul>
<li><strong>Paper</strong>: <a href="https://arxiv.org/abs/2606.12837" target="_blank" rel="noopener noreferrer">https://arxiv.org/abs/2606.12837</a></li>
<li><strong>HuggingFace</strong>: <a href="https://huggingface.co/datasets/meituan-longcat/LoHoSearch" target="_blank" rel="noopener noreferrer">https://huggingface.co/datasets/meituan-longcat/LoHoSearch</a></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/69e86f1a417ef555aed62d74c1152c53108351.png" type="image/png"/>
    </item>
    <item>
      <title>让AI离开温室，走向动态世界：MineExplorer揭示顶级多模态大模型被忽视的能力断层</title>
      <link>https://tech.meituan.com/2026/07/24/LongCat-MineExplorer.html</link>
      <guid>https://tech.meituan.com/2026/07/24/LongCat-MineExplorer.html</guid>
      <source url="https://tech.meituan.com/rss.xml">让AI离开温室，走向动态世界：MineExplorer揭示顶级多模态大模型被忽视的能力断层</source>
      <description>美团 LongCat 团队构建了 MineExplorer —— 首个在开放世界中做到分钟级长程任务的评测基准，系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。</description>
      <content:encoded><![CDATA[<p>假如你出生在一片未知的森林，太阳即将下山，饥肠辘辘，前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。</p>
<p>此时如果你按下暂停，把截图发给所有顶级的多模态大模型，它们都能完美回答你：“黄昏、有怪物，面临威胁。”</p>
<p>我们发现，多模态大模型能看懂图像、解析视频、在复杂场景里推理，然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么？</p>
<p>为了深入探索，美团 LongCat 团队构建了<strong>MineExplorer</strong>——<strong>首个在开放世界中做到分钟级长程任务的评测基准</strong>，系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。</p>
<p><strong>MineExplorer 核心看点：</strong></p>
<ul>
<li><strong>一个能直接跑的评测基准</strong>：813 个人工验证的高质量实例（1-hop 到 4-hop），配套规则化的里程碑自动评测框架。</li>
<li><strong>一套造题的方法论</strong>：多智能体数据合成流程的完整代码，可自动合成训练任务。</li>
<li><strong>一个可扩展的训练环境</strong>：基于 Minecraft 的沙盒，既能当考场，也能当练兵场。</li>
</ul>
<h2>01 MineExplorer设计解密：让AI离开温室，走向动态世界</h2>
<p>MineExplorer 不再是简单的看图问答，而是围绕一系列创新，构建了一个前所未有的评测体系。</p>
<p><img src="https://p1.meituan.net/meituantechblog/3415508a98cf053008ffb59af0ed592a421327.png" alt="图1：MineExplorer自动化数据合成和评测范式简介"></p>
<h3>1.1 创新设计：构建一个动态开放的世界</h3>
<p><strong>创新点一：构建一个具备完整物理规则、会动态演化的世界</strong></p>
<p>MineExplorer不是让模型看一张 Minecraft 截图做选择题，模型面对的是一个实时运行的3D沙盒世界。在评测中，每个任务实例会运行1800个环境步，每步执行 0.1 秒，对应一段3分钟的连续交互视频。也就是说在这3分钟时间里，环境一直在变：模型每做一个动作，世界状态就更新一次，它必须根据最新的画面不断调整策略。</p>
<p><strong>创新点二：隐藏前置条件的长程多跳任务</strong></p>
<p>这是 MineExplorer 最核心的设计，我们把任务按「跳数（hop）」分级，代表完成最终目标需要经过的隐藏前置步骤数量：</p>
<ul>
<li><strong>简单任务</strong>：目标明确的单跳任务，智能体不需要根据场景和任务描述推理出隐式的子任务。</li>
<li><strong>困难任务</strong>：由2-4跳任务组成的多跳推理任务。最终目标虽然给出，但要完成它，必须先推理并完成若干<strong>没有在指令里说明</strong>的前置子任务。</li>
</ul>
<p>我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ)：q 是自然语言指令，s₀ 是初始状态，Gτ 是任务之间的<strong>依赖图（DAG）</strong>，Mτ 是规则化的里程碑检查器。关键在于：**指令 q 并不会枚举依赖图里的所有节点，智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难，意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。</p>
<p><img src="https://p0.meituan.net/meituantechblog/1466cfe7ae29ef6beadf4bf8920b61b9117170.png" alt="图2：任务难度分布图"></p>
<p><strong>创新点三：知识解耦——我们测的是「通用探索」，不是「背 Minecraft Wiki」</strong></p>
<p>这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务，我们用LLM裁判判断其主要依赖的是通用世界常识，还是Minecraft专有机制，并过滤掉后者。换句话说：<strong>我们测的不是「AI 会不会玩 Minecraft」，而是「AI 能不能在一个动态物理世界里自主探索」。</strong></p>
<p><img src="https://p0.meituan.net/meituantechblog/27b8c5c7b9f9ae530adf7db2b37ee0d9117398.png" alt="图3：领域知识过滤图"></p>
<h3>1.2 构建方法：一套可复用的多智能体数据合成范式</h3>
<p>构建高质量的长程任务基准本身就是难题。我们的解法是让一组各有分工的 AI 协作来造题。MineExplorer 用一个多智能体协作流程，五个专业 Agent 在一个群聊里协作，由一个 orchestrator 控制发言顺序：</p>
<p><img src="https://p0.meituan.net/meituantechblog/033d32b59d8891664d7de8ed0c836918946656.png" alt=""></p>
<p>整个流程分初始化和辩论（debate）两个阶段，先生成初稿，再由专家和验证器找出问题并修订。</p>
<p>如<strong>下表所示</strong>，人工评估结果显示，多智能体流程把有效率拉高了约 30 个百分点，质量分提升约 0.5 分，在最难的4-hop任务上优势尤其明显。最终，我们保留了 813 个通过人工验证的高质量复合任务实例。</p>
<p><img src="https://p1.meituan.net/meituantechblog/92d0dc21970ca1a40a0386789f5a5256194522.png" alt="表1：Benchmark质量人工评估表"></p>
<h3>1.3 能力覆盖：MineExplorer 到底在测什么？</h3>
<p>MineExplorer 借鉴 ReAct 范式，把开放世界探索拆解成三大能力维度，共 14 项细粒度能力：</p>
<ul>
<li><strong>感知（Perception）：</strong> 空间、时序、实体、状态、资源。</li>
<li><strong>推理（Reasoning）：</strong> 常识、因果、关系。</li>
<li><strong>行动（Action）：</strong> 移动、跳跃、采集、放置、合成、攻击。</li>
</ul>
<p><strong>如图所示</strong>，最终的基准在三大维度上都有充足的覆盖，其中空间感知、移动、采集等基础能力出现频率最高，常识推理、因果推理也占了相当比例。</p>
<p><img src="https://p0.meituan.net/meituantechblog/5606f102fc399d300f8531427a08c4ef91444.png" alt="图4：能力覆盖分布图"></p>
<h2>02 核心洞察：18款顶级大模型测试，为何集体“考砸”了？</h2>
<p>MineExplorer不仅定义了考题，更给出了18个顶级模型的真实分数。<strong>如下表所示</strong>，这是横跨 Claude、GPT、Gemini 等八大家族的模型在整体任务成功率（TSR）上的排行榜。</p>
<p><img src="https://p1.meituan.net/meituantechblog/baa9165aab4bae0826f1a4f22315881b960739.png" alt="表2：主体评测结果表"></p>
<p>我们发现，即便是表现最好的 Claude-Opus-4.6，整体成功率也只有 41 分。</p>
<p><strong>| 洞察一：单跳尚可，多跳崩盘——问题就在隐藏前置条件</strong></p>
<p>如图所示，最强模型Claude-Opus-4.6的表现，从1跳任务的77分，一路下滑到4跳任务的12分。每增加一层隐藏的前置依赖，模型就掉一个台阶。</p>
<p><img src="https://p0.meituan.net/meituantechblog/423b7c12487a277cac27bcafb215841f1105129.png" alt="表3：分级评测结果图"></p>
<p><img src="https://p1.meituan.net/meituantechblog/0fe66c8cd12e6acd4b3273cb6e8999dd227554.png" alt="图5：不同任务难度下的任务成功率对比图"></p>
<p><strong>| 洞察二：会看，但不会想 —— 感知强于推理</strong></p>
<p>在几乎所有被测模型上，我们都观察到同一个规律：<strong>感知分数 &gt; 行动分数 &gt; 推理分数</strong>。如下图所示，以Claude-Opus-4.6为例，其整体感知分61.91，推理分54.71。瓶颈不在于看不见，而在于看懂了却无法串联成有效策略。</p>
<p><img src="https://p0.meituan.net/meituantechblog/e552dbd0ed03151c3750b43d75ad37ba836166.png" alt="图6：维度评测热力图"></p>
<p><strong>| 洞察三：近60%的失败原因，都是因为走不到目标</strong></p>
<p>我们对 Claude-Opus-4.6 的失败案例进行了归因分析。<strong>如下图所示</strong>，导航失败是最大的错误来源，占比近 60%。</p>
<p><img src="https://p0.meituan.net/meituantechblog/0e685670220ce485c94a8a8f5468218f163985.png" alt="图7：失败类型分布图"></p>
<p><strong>| 洞察四：给它更多步数、更多记忆，都不是解药</strong></p>
<p>我们进一步做了消融实验，发现模型失败并非因为资源不足。</p>
<ul>
<li><strong>步数</strong>：如图所示，能解的任务，模型在早期就解出来了；解不了的，给到 1800 步上限照样解不了。</li>
</ul>
<p><img src="https://p1.meituan.net/meituantechblog/4db113c30a91462928af6b6e28521ad8620229.png" alt="图8：平均完成步数图"></p>
<ul>
<li><strong>记忆</strong>：如图所示，增加历史画面帧数到一定程度后，性能反而会下降，因为过期的观察会干扰对当前局面的判断。</li>
</ul>
<p><img src="https://p0.meituan.net/meituantechblog/3db3e8f4aeb4dfb68dce40379b0df7a9355836.png" alt="图9：记忆帧数影响图"></p>
<p><strong>核心结论：瓶颈不在资源，而在模型没法把已有的信息和当前世界状态对齐。</strong></p>
<h2>03 总结：从看见世界到探索世界的鸿沟</h2>
<p>MineExplorer 揭示了一个被乐观情绪掩盖的能力断层：当前的多模态大模型，已经具备了不错的感知力，但严重缺乏在动态世界中持续行动的探索力。</p>
<p>这对正在快速升温的具身智能赛道有几个直接的启示：</p>
<ul>
<li>感知层基本就绪，规划层是瓶颈。 模型能看懂环境，但把感知转化成长程、含隐藏前置的行动计划，才是从能看到能做之间真正的鸿沟。</li>
<li>行业需要更接近真实复杂度的评测标准。在受控场景里跑通一个单步指令，不足以宣布AI能行动了。真实世界是动态的，充满未说明的前置条件，需要持续、长久化的探索。</li>
<li>我们不仅提供了评测，还开源了自动合成任务的方法和训练环境。MineExplorer交付的不是一套静态题库，它还带着一整套自动合成长程任务的流程，和一个能直接拿来训练的Minecraft环境。评测、造题、训练，用的是同一套基础设施。</li>
</ul>
<p>我们不是要给具身智能泼冷水。恰恰相反，把瓶颈定位清楚，比盲目乐观更有价值。MineExplorer提供的，正是这样一条诚实、可量化的能力基线。</p>
<p>看得见世界，不代表能探索世界。在一个会变化的世界里持续推理、持续行动——这才是AI走向真实世界，必须先跨过的那道门槛。MineExplorer 已全面开源，欢迎各大模型前来挑战开放世界。</p>
<p><strong>🚀 开源链接</strong></p>
<ul>
<li>
<p><strong>Paper</strong>：<a href="https://arxiv.org/abs/2605.30931" target="_blank" rel="noopener noreferrer">https://arxiv.org/abs/2605.30931</a></p>
</li>
<li>
<p><strong>GitHub</strong>：<a href="https://github.com/meituan-longcat/MineExplorer" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/MineExplorer</a></p>
</li>
<li>
<p><strong>HuggingFace</strong>：<a href="https://huggingface.co/datasets/meituan-longcat/MineExplorer" target="_blank" rel="noopener noreferrer">https://huggingface.co/datasets/meituan-longcat/MineExplorer</a></p>
</li>
</ul>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/3415508a98cf053008ffb59af0ed592a421327.png" type="image/png"/>
    </item>
    <item>
      <title>正式开源！美团 LongCat-2.0 同步开放国产卡推理代码</title>
      <link>https://tech.meituan.com/2026/07/12/LongCat-2.0-Open-source.html</link>
      <guid>https://tech.meituan.com/2026/07/12/LongCat-2.0-Open-source.html</guid>
      <source url="https://tech.meituan.com/rss.xml">正式开源！美团 LongCat-2.0 同步开放国产卡推理代码</source>
      <description>美团 LongCat-2.0 总参数 1.6T，平均激活约 48B，为真实的 Agentic Coding 任务而生，架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding，提升长上下文处理效率与 Token 级表示能力的同时，结合动态激活进一步强化了代码理解、生成以及执行的表现。</description>
      <content:encoded><![CDATA[<p><strong>本周，美团万亿参数大模型 LongCat-2.0 正式开源！</strong></p>
<p><a href="https://huggingface.co/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">HuggingFace</a> | <a href="https://github.com/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">GitHub</a> | <a href="https://www.modelscope.cn/collections/meituan-longcat/LongCat-20" target="_blank" rel="noopener noreferrer">ModelScope</a></p>
<p>作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型，LongCat-2.0 已全面开源。<strong>针对显存与带宽受限的国产算力芯片，我们在模型架构、芯片适配到部署策略上进行了深度协同优化，让万亿参数模型在存量卡上同样跑得稳、跑得快。</strong> 我们希望以真实 Agentic Coding 任务中的稳定表现为依托，通过开源将模型能力与推理优化成果完整开放，盘活更多存量国产算力，释放国产算力生态的长期价值。</p>
<p>美团 LongCat-2.0 总参数 1.6T，平均激活约 48B，为真实的 Agentic Coding 任务而生，架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding，提升长上下文处理效率与 Token 级表示能力的同时，结合动态激活进一步强化了代码理解、生成以及执行的表现。</p>
<h2>01 模型、芯片适配与部署三个方向逐一突破，实现了万亿参数模型的流畅推理</h2>
<p>面对显存、带宽和互联的多重限制，LongCat-2.0 结合国产芯片特性，<strong>从模型、芯片适配与部署三个方向逐一突破，实现了万亿参数模型的流畅推理：</strong></p>
<ul>
<li>
<p><strong>模型层面：</strong> Attention 通过 absorb 计算模式、Indexer 与 MLA prolog 并行处理以及 KVP 切分 KV-cache，有效缓解了超长上下文的 I/O 与显存压力。ScMoE 则利用国产芯片的控核能力，让 Dense 与 MoE 分支实现物理核心级并行执行，进一步压缩端到端延迟，实现了百万上下文在国产芯片上的高效推理；</p>
</li>
<li>
<p><strong>芯片适配层面：</strong> 通过 Super Kernel 减少算子数量以降低启动开销，并以 Weight Prefetch 将 I/O 延迟隐藏在前序计算中；同时基于高速片间互联完成 layer-wise 的 KV-cache 传输，TP/SP/KVP 均在 scale-up 互联域内完成，在受限的显存和带宽条件下将硬件利用率最大化；</p>
</li>
<li>
<p><strong>部署策略层面：</strong> 采用 PD 分离部署兼顾 TTFT 与 TPOT：Prefill 端通过缩小 Expert-Parallel 域与序列并行分担长序列计算压力，Decode 端以 KV-cache 切分与高并行度降低单卡显存占用，配合异步化 Expert-Parallel Load Balancing 解决大 EP 度下的负载不均。上述并行方案均已适配 constrained decoding、multi-step scheduling 和 MTP 等推理优化特性，实现了万亿参数模型在国产算力上的稳定服务。</p>
</li>
</ul>
<p>LongCat-2.0 验证了国产芯片承载复杂大模型任务的成熟能力，并希望通过开源为行业提供一条可复现的技术路径，推动存量算力在真实场景中的应用价值。</p>
<h2>02 模型全面升级，会执行、会推理、懂交互</h2>
<p>LongCat-2.0 沿用了 LongCat-Flash 的整体设计，并围绕 LongCat-2.0 在长上下文、代码任务和智能体场景中的进一步升级，做了三项关键优化：</p>
<h3>2.1 LongCat 稀疏注意力机制，提升上下文处理效率</h3>
<p>面向智能体任务中的长输入场景，LongCat-2.0 引入 LongCat 稀疏注意力机制（LSA），通过流感知索引、跨层索引和层级化索引三项策略减少碎片化访存和重复索引计算，在保持模型质量的前提下，加速百万级长上下文的训练与推理。</p>
<p><img src="https://p1.meituan.net/meituantechblog/368b1cd0634db5c41b127242d8feee08118728.png" alt=""></p>
<h3>2.2 引入 N-gram Embedding，提升参数利用效率</h3>
<p>LongCat-2.0 在 MoE 专家之外引入 N-gram Embedding 作为新的参数扩展路径。在 MoE 稀疏度已接近 97% 的情况下，将 135B 参数投入 N-gram Embedding 的收益远超继续扩充专家。该模块占比控制在总参数 10% 以内，兼顾了参数收益与结构稳定性。</p>
<p><img src="https://p1.meituan.net/meituantechblog/84d46b968d89efb8fd1bb66d3005680c29580.png" alt=""></p>
<h3>2.3 通过 MOPD 架构在国产算力集群上无缝融合，让模型会执行、会推理、懂交互</h3>
<p>后训练阶段，LongCat-2.0 采用多教师在线蒸馏，将专家分为 Agent、推理和交互三类，分别聚焦自主执行、自适应推理和安全对齐等核心能力。最终通过 MOPD 架构在国产算力集群上无缝融合，使模型兼具深度推理、自主执行与精准交互的综合表现。</p>
<p><img src="https://p0.meituan.net/meituantechblog/7e5f64947ed21d4b1c24d3e94d855844154812.png" alt=""></p>
<h2>03 开源开放</h2>
<p>LongCat-2.0 的开源，是一次技术路径的公开，也是一次生态邀约。</p>
<p>本次开源同步提供 BF16、FP8 以及 INT8 等多精度版本，全面覆盖不同算力平台的部署需求。同时，我们深度拥抱开源社区，将针对国产算力极致优化的推理成果同步开源。这意味着，即使手上没有最新算力，也能基于现有硬件将 LongCat-2.0 稳定跑起来。</p>
<p>我们希望通过这套开箱即用的推理栈，让更多的国产卡包括老卡，都能流畅部署万亿大模型推理服务，在真实生产力场景发挥更大价值。</p>
<h3>🚀 开源链接</h3>
<p><strong>Tech Blog：</strong> <a href="https://longcat.ai/blog/longcat-2.0/" target="_blank" rel="noopener noreferrer">https://longcat.ai/blog/longcat-2.0/</a></p>
<p><strong>Model Weights：</strong></p>
<ul>
<li>HuggingFace: <a href="https://huggingface.co/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">https://huggingface.co/meituan-longcat/LongCat-2.0</a></li>
<li>GitHub: <a href="https://github.com/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/LongCat-2.0</a></li>
<li>ModelScope: <a href="https://www.modelscope.cn/collections/meituan-longcat/LongCat-20" target="_blank" rel="noopener noreferrer">https://www.modelscope.cn/collections/meituan-longcat/LongCat-20</a></li>
</ul>
<p><strong>Inference Code:</strong></p>
<ul>
<li>GPU: <a href="https://github.com/sgl-project/sglang/pull/30042" target="_blank" rel="noopener noreferrer">https://github.com/sgl-project/sglang/pull/30042</a></li>
<li>NPU: <a href="https://github.com/meituan-longcat/SGLang-FluentLLM/tree/npu" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/SGLang-FluentLLM/tree/npu</a></li>
</ul>
<p><strong>API Platform：</strong></p>
<ul>
<li><a href="https://longcat.chat/platform/product" target="_blank" rel="noopener noreferrer">https://longcat.chat/platform/product</a></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/368b1cd0634db5c41b127242d8feee08118728.png" type="image/png"/>
    </item>
    <item>
      <title>直播回放·含 ACL&amp;apos;26 杰出论文 | 美团 AI 顶会论文 32 篇精讲</title>
      <link>https://tech.meituan.com/2026/07/11/2026-meituan-32-papers.html</link>
      <guid>https://tech.meituan.com/2026/07/11/2026-meituan-32-papers.html</guid>
      <source url="https://tech.meituan.com/rss.xml">直播回放·含 ACL&amp;apos;26 杰出论文 | 美团 AI 顶会论文 32 篇精讲</source>
      <description>如果你正在关注 AI 前沿，这篇内容值得收藏。2026 年，美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇，进行了 5 大专场直播。</description>
      <content:encoded><![CDATA[<p>🏆 近日，ACL 2026 杰出论文奖在圣地亚哥揭晓，全球仅 18 篇入选，美团履约技术团队的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》上榜啦，一键直达视频回放👉🏻 <a href="https://www.xiaohongshu.com/discovery/item/6a3b54740000000006030031?source=webshare&amp;xhsshare=pc_web&amp;xsec_token=ABh2ziW0cX7XYIsQ1VpYHUl5aZzXTt2-o0yyamYge4z-4=&amp;xsec_source=pc_share" target="_blank" rel="noopener noreferrer">小红书</a> | <a href="https://www.bilibili.com/video/BV1v7jc6BENd/?spm_id_from=333.1387.upload.video_card.click&amp;vd_source=8dac43659650af56650d7a9bc5f083d3" target="_blank" rel="noopener noreferrer">B站</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/f434c8979e7670cd0402c7719141eb91178306.png" alt="图2"></p>
<p>如果你正在关注 AI 前沿，这篇内容值得收藏。</p>
<p>2026 年，美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇，进行了 5 大专场直播。</p>
<p>内容涵盖了大模型推理、智能体记忆与自进化、代码智能、多模态交互、超高清视频生成、本地生活搜索等方向——既有底层能力的突破，也有贴近生活服务的落地探索。</p>
<p>如果你错过了直播，或者想再看一遍👇 五场回放都在这里啦，找到你感兴趣的议题，随时开始。</p>
<p>特别感谢所有讲师与筹备团队的倾力支持！也感谢每一位关注美团技术成长的你！❤️</p>
<h2>专场一：ACL'26 综合专场</h2>
<p>👉 直播回放入口→ <a href="https://www.xiaohongshu.com/collection/item/6a4b729b0de8000000000001?xhsshare=CopyLink&amp;appuid=6a3262ca000000000f03b001&amp;apptime=1783330950&amp;share_id=e51dd478f4b34506aed7a49ca74b9113" target="_blank" rel="noopener noreferrer">小红书</a> ｜ <a href="https://space.bilibili.com/18937923/lists/8321546?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782776&amp;idx=3&amp;sn=77c72b469a871b499a46fe06be73225f&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/fe16b3191f6276cdf692c76bb2b04308356559.png" alt=""></p>
<h2>专场二：ACL'26 履约团队前沿技术专场</h2>
<p><strong>出品人｜</strong> Jichong Gao 美团高级技术专家、Jun Xu 美团高级技术专家</p>
<p>👉 直播回放入口→ <a href="https://www.xiaohongshu.com/collection/item/6a4b72d90de6000000000001?xhsshare=CopyLink&amp;appuid=6a3262ca000000000f03b001&amp;apptime=1783331038&amp;share_id=ca3358c821584b34a480efd8350ed035" target="_blank" rel="noopener noreferrer">小红书</a> ｜ <a href="https://space.bilibili.com/18937923/lists/8370607?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782810&amp;idx=2&amp;sn=aeb92a7c0c0bcf2befa7a201f1d4ece9&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/87835a72dafb62eb0c93a17fdab075ca674240.png" alt=""></p>
<h2>专场三：搜推 ASX 团队专场</h2>
<p><strong>出品人｜</strong> Guojun Yin 美团研究员</p>
<p>👉 直播回放入口→ <a href="https://www.xiaohongshu.com/collection/item/6a4b72f50e97000000000001?xhsshare=CopyLink&amp;appuid=6a3262ca000000000f03b001&amp;apptime=1783478239&amp;share_id=196398bf22d742bda21e83ee981f6615" target="_blank" rel="noopener noreferrer">小红书</a> ｜ <a href="https://space.bilibili.com/18937923/lists/8427999?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782896&amp;idx=2&amp;sn=ce2cb30b2d2b0e9ea12d03561124dd05&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/6498214ebe581bcea5541619c1cd145d359417.png" alt=""></p>
<h2>专场四：ICML'26 通用 Agent 前沿技术专场</h2>
<p><strong>出品人｜</strong> Qi Gu 美团研究员</p>
<p>👉 直播回放入口→ <a href="https://space.bilibili.com/18937923/lists/8471639?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782940&amp;idx=2&amp;sn=4456ee2f95bf8b1016981539d760253f&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/247700c227d0b4f4c7f88bb02adecdbe344171.png" alt=""></p>
<h2>专场五：ICML'26 综合专场</h2>
<p>👉 直播回放入口→ <a href="https://space.bilibili.com/18937923/lists/8485771?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782940&amp;idx=2&amp;sn=4456ee2f95bf8b1016981539d760253f&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/cbd47f8df818779808c61e614f6087f7351215.png" alt=""></p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/f434c8979e7670cd0402c7719141eb91178306.png" type="image/png"/>
    </item>
    <item>
      <title>美团 LongCat-2.0 正式发布：在国产算力集群上完成全流程训练与推理的万亿参数模型</title>
      <link>https://tech.meituan.com/2026/06/30/LongCat2.0.html</link>
      <guid>https://tech.meituan.com/2026/06/30/LongCat2.0.html</guid>
      <source url="https://tech.meituan.com/rss.xml">美团 LongCat-2.0 正式发布：在国产算力集群上完成全流程训练与推理的万亿参数模型</source>
      <description>作为业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型（总参数 1.6 T，平均激活约 48 B，动态范围 33B~56B），LongCat-2.0 从零开始预训练，原生支持 1M 超长上下文，其架构设计自始至终围绕一个核心目标：让模型在真实的 Agentic Coding 任务中，更高效、更稳定地完成代码理解、生成与执行。</description>
      <content:encoded><![CDATA[<p>6月30日，美团正式发布新一代万亿参数大模型 LongCat-2.0，并将对外开源。</p>
<p>作为<strong>业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型</strong>（总参数 1.6 T，平均激活约 48 B，动态范围 33B~56B），LongCat-2.0 从零开始预训练，原生支持 1M 超长上下文，其架构设计自始至终围绕一个核心目标：<strong>让模型在真实的 Agentic Coding 任务中，更高效、更稳定地完成代码理解、生成与执行</strong>。</p>
<p>正式版发布前，LongCat-2.0预览版本已通过 OpenRouter 平台和<a href="https://longcat.ai/" target="_blank" rel="noopener noreferrer">longcat.ai</a>面向全球开发者开放调用——截至目前该模型<strong>已跻身 OpenRouter 全球大模型调用量前三</strong>，月调用量在 Hermes、Claude Code 和 OpenClaw 分列全球第一、第二和第三位，<strong>成为最受全球 Agent 开发者欢迎的模型之一</strong>。</p>
<iframe frameborder="0" src="https://s3plus.meituan.net/ddfile/2026-06-30%2011_20_15.mp4" allowfullscreen="true" height="720" width="1280" style="display: block; margin: 0 auto;"></iframe>
<h2>01 国模国芯全栈协同：完成万亿参数 MoE 模型在国产算力上的稳定训练</h2>
<p>LongCat 团队对国产算力的探索始于 2023 年，三年来，团队从千卡起步，逐步攻克算子适配、通信优化、分布式稳定性等基础难题，最终在五万卡集群上完成万亿参数模型的全流程训练与推理。</p>
<p>LongCat-2.0 预训练数据规模超过30Ttokens，覆盖中文、英文、多语言和代码等多类数据；面对万卡级训练中的硬件故障、通信异常、显存压力与数值波动，LongCat 团队从<strong>稳定性、正确性和效率</strong>三方面攻克国产算力训练难题。</p>
<ul>
<li>在<strong>稳定性</strong>上，通过卡间通信异常处理、弹性扩缩卡和自动故障恢复，将月均日故障率降低70%以上；</li>
<li>在<strong>正确性</strong>上，通过自研设计确定性算子、Bitwise 一致性验证和参数检测，保障训练结果的可靠，同时基于实践提升关键模块计算精度、优化 Reduce 逻辑；</li>
<li>在<strong>效率</strong>上，通过流水线调度、显存优化和算子级控核，训练 MFU 提升 1.5 倍。</li>
</ul>
<p><strong>最终，LongCat 实现稳态日吞吐超过1T tokens/day，完成万亿参数 MoE 模型在国产算力上的稳定训练。</strong></p>
<p>在推理阶段，LongCat-2.0 围绕模型、算子和框架进行协同优化：通过大规模专家并行聚合访存带宽，支撑万亿参数 MoE 模型的低延迟解码；将零计算专家机制融入专家并行通信流程，使路由到零专家的 token 真正避免不必要的传输与计算；并针对通信、Attention、GEMM 等核心算子优化调度，结合提前下发与权重预取等框架机制，进一步降低推理链路中的等待开销。</p>
<p><strong>从稳定训练到低延迟推理，LongCat-2.0 验证了我们已具备在国产算力集群上进行大规模模型训练的能力。它不只是“能训出”万亿参数模型，还让万亿参数模型能够在真实任务中稳定运行。</strong></p>
<h2>02 让模型在真实 Agentic Coding 任务中更高效、更稳定地完成代码理解、生成与执行</h2>
<p>LongCat-2.0 的架构设计始终围绕一个核心目标：<strong>让模型在真实 Agentic Coding 任务中更高效、更稳定地完成代码理解、生成与执行</strong>。</p>
<p><strong>1M超长上下文，让 Agent 看见整个项目。传统模型在处理超过 100K 上下文后就开始“遗忘”前面的内容</strong>。LongCat-2.0 采用<strong>LongCat Sparse Attention（LSA）稀疏注意力机制</strong>，在处理长文本时不再“逐字逐句地看”，而是智能筛选关键信息，将计算量从平方级降至线性级。这使得模型在 100 万 Token 的超长上下文中，依然保持精准的信息定位与理解能力。</p>
<p><strong>零计算专家 + ScMoE，让算力用在刀刃上</strong>。代码任务中不同 token 复杂度差异巨大——定义变量名和推导递归算法对算力的需求完全不同。LongCat-2.0 通过零计算专家实现 token 级动态激活（33B~56B），简单 token 不消耗算力，复杂 token 自动获得更多计算资源。</p>
<p><strong>MOPD 多专家融合，一个模型同时擅长写代码、做推理、懂交互</strong>。LongCat-2.0 通过 MOPD 架构融合 Agent、Reasoning、Interaction 三组专家能力——Agent Experts 专攻工具调用与自主纠错，Reasoning Experts 深耕数学与 STEM 推理，Interaction Experts 优化指令遵循与交互体验。推理时由门控网络根据任务类型动态调度最擅长的专家，而非简单合并参数。得益于此，模型在编程、推理、交互等维度均表现突出。</p>
<p><strong>LongCat-2.0 通过精细的架构设计，让万亿参数模型在实际任务中更高效、更稳定地发挥能力。</strong></p>
<p><img src="https://p1.meituan.net/meituantechblog/ef19600fdb0e6868a3574c4a8c7ff746220482.png" alt=""></p>
<h2>03 在编程能力、真实办公场景的复杂任务处理方面表现优异</h2>
<p>综合评测结果显示，LongCat-2.0 凭借卓越的综合性能与稳定的任务表现，<strong>在 Code 和 General Agent 场景表现优异</strong>。</p>
<p><img src="https://p0.meituan.net/meituantechblog/9d8da6909183ad1a8e591186849c0947457784.png" alt=""></p>
<ul>
<li><strong>在编程能力方面</strong>，LongCat-2.0 展现出扎实的综合实力：在考察深层工程能力的 SWE-bench Pro 中获得 59.5，领先Gemini 3.1 Pro（54.2）、GPT-5.5（58.6）和 Claude Opus 4.6（57.3）；在 SWE-bench Multilingual 中取得 77.3 的成绩，与 Claude Opus 4.6（77.8）保持在同一水位；此外，在真实终端指令交互评测 Terminal-Bench 2.1 中取得 70.8，体现了其在真实运维与开发终端任务中的稳定执行与纠错能力。</li>
<li><strong>在真实办公场景的复杂任务处理方面</strong>，LongCat-2.0 表现均衡：在搜索智能体评测集RWSearch中获得 78.8，在生产力场景评测集 FORTE 中获得 73.2 ，在 BrowseComp 中获得 79.9，均达到或接近前沿闭源模型水平，证明了其在多步骤任务规划、复杂工具调用及长程检索执行上的高可靠性，能够较好的契合企业级 Agent 的落地需求。</li>
</ul>
<h2>04 在真实工作场景中，成为大家可靠的“工作伙伴”</h2>
<p>内测期间，我们面向真实工作场景征集了大量真实的用户任务需求，这些来自一线的真实“工作单”，可以看出 LongCat-2.0 在用户的真实工作场景中正在成为他们可靠的“工作伙伴”。</p>
<p><strong>Agent 搭建：一问即得，全闭环交付</strong></p>
<p>通过 LongCat-2.0 搭建的 AI SQL Agent，业务人员可以直接用自然语言查询数据。LongCat-2.0 自动完成全链路闭环——理解问题意图、规划查询步骤，并将数据结果转化为清晰的业务洞察。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>代码库迁移：读懂老代码，重构新架构</strong></p>
<p>给 LongCat-2.0 一个旧版插件代码库和一份新版SDK文档，它能自行分析整体架构、梳理核心逻辑，再将整个插件重构为符合新API的实现——保留全部原有功能，修复潜在隐患，编译一次通过。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>完整应用开发：从一句话到可运行产品</strong></p>
<p>描述一个“儿童AI游戏训练场”的创意，LongCat-2.0 会逐步生成技术选型、页面架构、游戏逻辑与视觉细节——从首页到三个完整可玩的游戏页面，全部代码一次产出，开箱即用。从一句话到可用的产品，将灵感轻松实现。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>3D交互演示：一句话，生成一个3D世界</strong></p>
<p>通过一句话描述，LongCat-2.0 即可生成完整 Three.js 3D 演示：透明烧瓶、荧光液体、泡沫喷发、液面下降和堆积效果全部可交互呈现。所有代码封装在一个 HTML 文件中，打开即用，让创意快速转化为可交互的3D体验。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>AI 小说工厂：从单点灵感到商业变现</strong></p>
<p>基于 LongCat-2.0 构建的“AI小说工厂”，将创意写作升级为自动化内容流水线。用户输入灵感后，系统编排多个 Agent，自动完成世界观构建、并行章节生成、质量评估与回流修订。并通过长上下文能力保障百万字级设定一致性。最终内容可自动适配多平台发布，并由 Web 面板实时监控生成进度与质量状态，实现持续稳定的连载输出。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>立即体验</strong></p>
<ul>
<li><strong>API 开放平台：<a href="https://longcat.chat/platform/product" target="_blank" rel="noopener noreferrer">https://longcat.chat/platform/product</a></strong></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/ef19600fdb0e6868a3574c4a8c7ff746220482.png" type="image/png"/>
    </item>
    <item>
      <title>ICML 2026 | 美团技术团队学术论文精选</title>
      <link>https://tech.meituan.com/2026/06/29/ICML-2026.html</link>
      <guid>https://tech.meituan.com/2026/06/29/ICML-2026.html</guid>
      <source url="https://tech.meituan.com/rss.xml">ICML 2026 | 美团技术团队学术论文精选</source>
      <description>ICML是机器学习领域最具影响力的国际顶级学术会议之一。大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题，并通过征集和评估具有重要理论价值和实际影响的前沿研究成果，推动领域发展并引领未来研究方向。</description>
      <content:encoded><![CDATA[<p>ICML（International Conference on Machine Learning，国际机器学习大会）是机器学习领域最具影响力的国际顶级学术会议之一。大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题，并通过征集和评估具有重要理论价值和实际影响的前沿研究成果，推动领域发展并引领未来研究方向。2026年，ICML共收到全球篇论文23918投稿，最终6352篇被接收，接收率约为26.6%。本文解读了美团技术团队被收录的13篇论文，覆盖智能体推理、强化学习训练、复杂任务生成、智能体基准测试、监督微调等技术方向。</p>
<h2>01 MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning</h2>
<p><strong>MemOCR：面向高效长程推理的版面感知视觉记忆机制</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2601.21468" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/53ce71427cc5fb26c883af36a738b10569202.webp" alt=""></p>
<p><strong>论文简介</strong>：长时间跨度的智能体推理需要将不断增长的交互历史有效压缩到有限的上下文窗口中。现有的大多数记忆系统将历史序列化为文本，其中token级别的开销是均匀的，且与长度线性增长。为此，我们提出了MemOCR，一种多模态记忆智能体，通过视觉布局实现自适应信息密度的记忆空间分配，从而在紧张的上下文预算下提升长时间跨度推理能力。在长上下文多跳和单跳问答基准测试中，MemOCR优于强文本基线方法，并在极端预算条件下实现了更有效的上下文利用。</p>
<h2>02 ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training</h2>
<p><strong>ScaleEnv: 从零开始构建可扩展的环境合成系统用于通用交互式工具使用智能体的训练</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.06820" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/ccceeac77d665e5ffea65436222decc7118744.webp" alt=""></p>
<p><strong>论文简介</strong>：为智能体配备交互式环境和可验证任务以进行自我探索，对于培养能够适应多样化场景的通用智能体至关重要。我们提出了ScaleEnv，一个完全从零开始构建全交互式环境和可验证任务的框架。ScaleEnv通过程序化测试确保环境的可靠性，通过工具依赖图扩展和可执行动作验证来保证任务的完整性和可解性。在未见过的多轮工具使用基准测试上展示了显著的性能提升，突显了强大的泛化能力。</p>
<h2>03 V_0: A Generalist Value Model for Any Policy at State Zero</h2>
<p><strong>V_0：一种适用于任意策略在初始状态下的通用价值模型</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.03584" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/78419c635c8bc694f07882566afb116176626.webp" alt=""></p>
<p><strong>论文简介</strong>：大语言模型的强化学习训练中的价值模型面临耦合困境：它们需要与更新中的策略同步训练。我们提出了V_0，一种通用价值模型，通过将任务重新定义为上下文学习来预测未见策略的性能，从而将价值估计与特定策略参数解耦。实验结果表明，V_0在GRPO训练过程中追踪策略演化方面优于耦合价值模型，能够优化冷启动预算分配，并在推理路由中逼近性能-成本的帕累托前沿。</p>
<h2>04 Learning to Self-Verify Makes Language Models Better Reasoners</h2>
<p><strong>学习自我验证使语言模型成为更好的推理者</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.07594" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/75add83935b72c67529dc96ae4b6a9b268520.webp" alt=""></p>
<p><strong>论文简介</strong>：近期的大语言模型在为复杂任务生成有前景的推理路径方面表现出色，但在验证自身答案方面仍然薄弱。我们发现学习自我验证能够有效提升生成性能，产生更高效的推理轨迹。我们提出了一个多任务强化学习框架，将生成和自我验证作为两个独立但互补的目标进行联合优化。实验表明，该方法在生成和验证能力上均优于仅进行生成训练的方法。</p>
<h2>05 AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition</h2>
<p><strong>AgentNoiseBench：噪声条件下工具使用型大语言模型智能体的鲁棒性基准评测</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2602.11348" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/31e3e86e970c5c79e9b4d762b09326dd118430.webp" alt=""></p>
<p><strong>论文简介</strong>：随着基于大语言模型的智能体越来越多地部署在实际工作流程中，现有的智能体基准测试不足以刻画智能体在不完美用户指令和不可靠工具反馈下的鲁棒性。我们提出了AgentNoiseBench，一个用于系统评估大语言模型智能体交互式噪声鲁棒性的框架。该基准建模了用户侧指令噪声和工具侧结果噪声两种主要噪声来源，提供模块化噪声注入管道和多维度评估指标。通过对25个工具使用模型的评估，发现工具侧噪声通常比用户侧噪声引起更大幅度的性能下降。</p>
<h2>06 AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation</h2>
<p><strong>AJ-Bench：面向环境感知评估的智能体裁判基准</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2604.18240" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/2b3544e8ab174ad18492a3a6c98ed6b9127010.webp" alt=""></p>
<p><strong>论文简介</strong>：随着强化学习不断推动基于大语言模型的智能体训练规模化，在复杂环境中可靠地验证智能体行为变得日益困难。现有方法依赖基于规则的验证器或 LLM-as-a-Judge 模型，但这些方法难以泛化到狭窄领域之外。Agent-as-a-Judge 通过主动与环境和工具交互以获取可验证的证据来解决这一局限性，但其能力仍未得到充分探索。 我们提出了一个基准测试 AJ-Bench，用于系统性地评估"智能体充当评判者"在三个领域——搜索、数据系统和图形用户界面——中的表现，涵盖155个任务和516条标注轨迹。该基准全面评估了评判智能体在信息获取、状态验证和过程验证方面的能力。实验表明，相比 LLM-as-a-Judge 基线方法，该方法取得了稳定的性能提升，同时也揭示了基于智能体的验证中仍存在的重大开放性挑战。</p>
<h2>07 LUVE : Latent-Cascaded Ultra-High-Resolution Video Generation with Dual Frequency Experts</h2>
<p><strong>LUVE：基于双频率专家的潜空间级联超高分辨率视频生成</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.11564" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/adcdda2e2386d052a06f76362ffc24df164210.webp" alt=""></p>
<p><strong>论文简介</strong>：为解决超高分辨率视频生成中连贯性与算力难以兼顾的难题，该论文提出了基于双频专家的潜空间级联框架LUVE。该框架创新性地采用三阶段架构：先通过低分辨率生成保障运动一致性；接着利用潜空间上采样直接提升分辨率，大幅降低内存与计算开销；最后融合高低频专家细化高分辨内容，全面增强全局语义与局部细节。实验表明，LUVE展现出了卓越的逼真度与内容保真度，其核心思想现已成功应用于美团LongCat-Video模型中。</p>
<h2>08 Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory</h2>
<p><strong>Infinite-World：通过无位姿层次化记忆将交互式世界模型扩展至1000帧</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.02393" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/7e37532eff0ab36936a1b9cd21f869e7119212.webp" alt=""></p>
<p><strong>论文简介</strong>：Infinite-World 是面向真实场景中的长程交互式世界模型，其目标是在 1000+ 帧生成中保持稳定的视觉记忆和动作响应。针对真实视频中位姿噪声大、视角回访稀少的问题，论文提出三点创新：用无位姿层级记忆压缩器将历史 latent 压缩为固定预算记忆，降低长程建模成本；用不确定性感知动作标注提升噪声轨迹下的动作学习；再通过高回访数据微调增强 loop closure 能力。整体上，它让世界模型更适合从真实视频学习长时空一致性。</p>
<h2>09 WildActor: Unconstrained Identity-Preserving Video Generation</h2>
<p><strong>WildActor：无约束身份保持视频生成</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2603.00586" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/24933777ccb49e8a29a709b287221cd8309446.webp" alt=""></p>
<p><strong>论文简介</strong>：本文提出 WildActor，一种面向无约束身份保留的视频生成新框架，旨在应对现有方法在动态长镜头和视角剧烈切换时面临的全身体态不一致、面部漂移及姿态僵死伪影。在机制层面，WildActor 构建了含1.6M视频和18M多视角图像的大规模数据集 Actor-18M，有效解决原始数据中的正脸偏置；同时引入非对称身份保留注意力（AIPA）解耦身份与运动生成，并结合身份感知3D旋转位置编码（I-ROPE）显式分离时空 Token，配合视角自适应蒙特卡洛采样实现了鲁棒的任意视角条件控制。实验表明，WildActor 在新构建的 Actor-Bench 连贯叙事与泛化测试中，不仅全身一致性与文本对齐度显著超越现有开源及商业大模型，还验证了其在复杂现实场景下保持物理恒常性的优越性。</p>
<h2>10 Navigating the Pareto Frontier of Alignment: Spectrum-Adaptive Fine-Tuning for LLMs</h2>
<p><strong>SAFT：面向大语言模型的谱自适应微调方法</strong></p>
<p><strong>论文下载</strong>：<a href="https://github.com/sjtu-scx/SAFT/blob/main/SAFT.pdf" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/f7b88b332a240ef7176c970b7c6879cd170832.webp" alt=""></p>
<p><strong>论文简介</strong>：监督微调常用交叉熵作为目标函数，虽然学习高效，但它并非正确率的光滑近似，还会因为特别关注预测概率低的样本从而容易对噪音过度拟合并过度自信。DFT则在梯度层面等同优化正确率的光滑近似函数，在保持训推一致性的同时提升了鲁棒性，但也会削弱对可学习的难样本的学习效率。因此，SFT 与 DFT 构成效率—鲁棒性两个端点，而真实数据应选择哪种折中取决于其未知的内在 SNR。我们提出轻量的 pre-test protocol：用少量训练数据分别训练 SFT/DFT 并在验证集比较表现，SFT 更优则判定为高 SNR 并选择几何插值Geo-SAFT，DFT 更优则判定为低 SNR 并选择调和插值Har-SAFT。相比仍保留低置信梯度发散的线性插值，SAFT 通过数据自适应的几何/调和非线性插值匹配不同噪声 regime，从而获得更优的鲁棒性—效率 Pareto trade-off。</p>
<h2>11 TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios</h2>
<p><strong>TRIP-Bench：真实场景中长时域交互式智能体的基准评测</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2602.01675" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/99f9fc23599da395c9ace3cba6c7d90787516.webp" alt=""></p>
<p><strong>论文简介</strong>：本论文提出了 TRIP-Bench，一个面向长程交互式 Agent 的旅行规划评测基准。它基于真实世界数据构建，包含 18 个工具和 40 多类旅行约束，重点考察模型在多轮对话中保持全局约束、调用工具、处理用户需求变化和方案反复修改的能力。其困难任务最长可达 15 轮用户交互、150 次以上工具调用，甚至超过 20 万 tokens 上下文。实验表明，现有先进模型在该基准上仍表现有限。论文进一步提出 GTPO 多轮强化学习方法，通过奖励归一化和轮次级奖励差分提升模型鲁棒性，使 Qwen2.5-32B-Instruct 在评测中超过 Gemini-3-Pro。</p>
<h2>12 InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution</h2>
<p><strong>InfVSR：面向一致性驱动的流式生成视频超分辨率</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2510.00948" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/8120868b5fc25080dc2c2986f2323c5468146.webp" alt=""></p>
<p><strong>论文简介</strong>：本文提出了 InfVSR，一种面向一致性驱动的流式生成视频超分辨率新框架，旨在解决扩散式视频超分方法在长视频场景中存在的推理效率低、显存占用大和时序不一致问题。其核心机制包括：将预训练视频 DiT 改为因果流式架构，引入滚动 KV 缓存以维持局部过渡平滑性；设计联合视觉引导通过交叉注意力注入全局语义锚点，抑制累积误差漂移。训练阶段结合分块像素监督与跨块分布匹配，双重约束时序一致性，并将扩散过程蒸馏为高效单步推理。实验表明，InfVSR 在多项基准上取得 SOTA 性能，时序一致性显著领先，推理速度提升 58 倍且长序列显存占用恒定。</p>
<h2>13 DRIVE: Distributional and Retrieval-Augmented Bidding with Value Evaluation</h2>
<p><strong>DRIVE</strong>：基于混合分布与检索增强的价值评估出价策略</p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2606.14192" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/3c5da2f5bb1f05cb0e55acd180e633f544634.webp" alt=""></p>
<p><strong>论文简介</strong>：针对标准Decision Transformer (DT)在复杂竞价环境中的三大痛点（“平均动作”陷阱、长尾幻觉、缺乏推理优化），提出“生成—检索—评估”闭环框架：1）用高斯混合模型替代确定性输出，解决多模态策略坍缩问题；2）引入检索机制增强长尾场景记忆，避免参数化模型幻觉；3）通过IQL Critic实现闭环择优，对生成动作与历史动作进行实时评估。该方案显著提升决策鲁棒性。</p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/53ce71427cc5fb26c883af36a738b10569202.webp" type="image/webp"/>
    </item>
    <item>
      <title>LongCat 开源 VitaBench 2.0：长期动态智能体基准新标杆</title>
      <link>https://tech.meituan.com/2026/06/29/LongCat-VitaBench-2.0.html</link>
      <guid>https://tech.meituan.com/2026/06/29/LongCat-VitaBench-2.0.html</guid>
      <source url="https://tech.meituan.com/rss.xml">LongCat 开源 VitaBench 2.0：长期动态智能体基准新标杆</source>
      <description>VitaBench 2.0 是首个真实生活场景下面向长期动态用户建模的智能体评测基准，它系统性地评测大语言模型在长期、真实、动态的用户互动中个性化与主动性的能力。</description>
      <content:encoded><![CDATA[<p>一个经常加班的白领，一个带着孩子出游的父亲，你的AI助理能分清他们需要什么样的服务吗？</p>
<p>现实是，它常常分不清。</p>
<p>AI能执行你明确的指令，却很难记住那些藏在场景和身份背后的真实需求。它们是真的无法理解，还是“情商”不够高呢？</p>
<p>自去年10月发布了 <strong>VitaBench 1.0</strong>，首次定义了生活场景下智能体任务的复杂度，美团 Longcat 团队再次推出 VitaBench 2.0，它不再仅仅关注任务有多难，而是将目光投向了更深层次的挑战。</p>
<p><strong>VitaBench 2.0 是首个真实生活场景下面向长期动态用户建模的智能体评测基准，它系统性地评测大语言模型在长期、真实、动态的用户互动中个性化与主动性的能力</strong>。</p>
<p><strong>VitaBench 2.0 的 核心“硬核”看点</strong>：</p>
<ul>
<li>高难度业界首创：首次将智能体场景与丰富用户生态相结合，打造面向长期动态用户建模的智能体基准。其包含56名真实特征用户、819个复杂任务、超2000个动态偏好及66个可执行工具。</li>
<li>超长跨度动态追踪：平均每位用户包含 2093 个交互事件，平均时间跨度长达 1580 天，严格按时间线向 Agent 暴露，真实还原用户偏好的演进与漂移。</li>
<li>统一评测生态：针对长文本上下文学习（In-context learning）与智能体记忆策略（Memory Strategy）的统一评测平台。</li>
</ul>
<h2>01 设计原理：VitaBench 2.0的三维解构</h2>
<p>能得出这些结论，得益于VitaBench 2.0的核心设计。它不再是简单的问答，而是围绕三大创新构建了一个前所未有的评测体系。</p>
<p><img src="https://p0.meituan.net/meituantechblog/ecfdc52ee4ab7253a877d5df75217f21127484.webp" alt="图1：VitaBench 2.0 概览图"></p>
<h3>1.1 搭建“人生副本”：让AI在真实用户轨迹中接受考验</h3>
<p>不同于一次性的问答，VitaBench 2.0为56位虚拟用户，在送餐、到店、差旅等多个真实领域中，构建了包含2000多种动态偏好、跨度长达数年的生活轨迹。</p>
<p>这背后是庞大而真实的数据支撑。如下图所示，这些图表直观地展示了我们构建的用户画像和偏好分布的真实性与复杂性。</p>
<p><img src="https://p0.meituan.net/meituantechblog/54c8ca3a15f23f55b88d079885aedf63148034.webp" alt="图2：VitaBench 2.0 用户画像统计图"></p>
<p><img src="https://p0.meituan.net/meituantechblog/765450b81465c59972ae583ca0946e64149788.webp" alt="图3：VitaBench 2.0 用户偏好统计图"></p>
<p>具体来说，这个数据生态包含：</p>
<ul>
<li>56个拟真用户，每个用户都拥有基于真实世界统计数据构建的独特身份、习惯和需求。</li>
<li>819个可执行任务，贯穿于用户的整个生命周期。</li>
<li>用户的偏好不是静态标签，而是会随着时间、事件而动态演变，平均每个用户的偏好会发生超过48次动态变化。</li>
</ul>
<p>这些偏好被巧妙地嵌入到碎片化的互动历史中，包括对话记录和行为日志（如浏览、搜索、下单）。智能体必须像侦探一样，从这些混杂着“信号”与“噪音”的线索中，持续对用户进行理解。</p>
<h3>1.2  引入“时间标尺”：将持续理解作为核心目标</h3>
<p>传统的Agent评测关注“单个任务是否完成”，而VitaBench 2.0的核心目标是评测<strong>智能体是否在持续理解一个动态的人</strong>。</p>
<p>为此，我们将评测的时间轴拉长到了前所未有的尺度，用户的平均交互周期长达<strong>1580天（约4.3年）</strong>，最长甚至达到&nbsp;<strong>2,974</strong> 天。在这漫长的时间线里，智能体需要不断地<strong>提取、利用、并更新</strong>对用户的理解，才能在后续的任务中做出正确决策。这从根本上改变了评测的焦点，从单次任务的成功，转向了对用户偏好的考核。</p>
<h3>1.3  设立“记忆擂台”：对决AI的两种记忆模式</h3>
<p>为了探究记忆在长期用户建模中的作用，VitaBench 2.0搭建了首个真实用户场景下的统一长期智能体评测平台，通过可扩展的接口，让两种代表性机制在此对决：</p>
<ul>
<li><strong>智能体记忆</strong>： AI自己决定记住什么、忘记什么，主动维护一个精炼的用户档案。</li>
<li><strong>RAG记忆</strong>： 像一个外部搜索引擎，根据当前任务检索最相关的历史片段。</li>
</ul>
<p>通过对比这两种模式，我们可以清晰地看到不同记忆架构，以及同架构下的不同设计对个性化决策的真实影响，从而回答“AI应该如何记忆”这一关键问题。同时，为了考验AI的“眼力劲”，我们还设计了主动性任务。在这些任务中，AI必须意识到信息不足并主动提问，而不是盲目决策。</p>
<h2>02 核心洞察：用数据看清模型的短板</h2>
<p>VitaBench 2.0不仅给出了总分，更用数据揭示了模型们犯错的具体原因。如表1所示，这是主要模型在不同记忆设置下的性能排行榜。</p>
<p><img src="https://p1.meituan.net/meituantechblog/521cabb68ee8fad43452344cba3bb4a1649960.webp" alt="表1：主要模型在不同记忆设置下的性能表现"></p>
<p>从排行榜（表1）可以看出，即使在能看到全部历史记录的“开卷”模式下，最强的模型Claude-Opus-4.6的平均分也刚过0.5，说明从海量信息中准确提炼偏好本身就比较困难。而一旦切换到更真实的记忆模式，模型的表现出现了不同程度的下滑。</p>
<p><strong>洞察一：时间越长，AI忘得越快</strong></p>
<p>如下图所示，随着任务序列索引增加（即时间推移），所有模型的平均性能都在下降。这说明，无论是处理超长上下文的能力，还是记忆模块的累积误差，都严重限制了AI的长期服务能力。</p>
<p><strong>更关键的是，记忆并没有成为解药</strong>。对比实验结果发现，大部分模型在接入Agentic Memory或RAG Memory后，性能反而低于直接使用全历史记录的场景——<strong>记忆不是装上就好</strong>，如何正确更新、检索和利用，才是真正的挑战。</p>
<p><img src="https://p1.meituan.net/meituantechblog/212aa3a638a9bcacbbcadea7718d77d628306.webp" alt="图4：模型性能随任务序列（时间）的衰减分析"></p>
<p><strong>洞察二：高“智商”不等于高“情商”</strong></p>
<p>一个常见的假设是，开启模型的“思考模式”能提升其表现。然而，VitaBench 2.0 的实验结果给出了相反的答案：<strong>开启思考模式，在个性化任务上并不总是有帮助</strong>。</p>
<p>下图展示了模型在开启/关闭思考模式下的性能与效率关系。横轴是完成任务所需的交互轮数（越少越好），纵轴是平均性能（越高越好），理想的模型应位于左上角。可以看到，开启思考模式的点并没有稳定地比关闭模式更优越。</p>
<p><img src="https://p0.meituan.net/meituantechblog/5e633bfcc648e2d8d5b34eaaa9469a7048792.webp" alt="图5：开启/关闭思考模式下的模型性能与效率"></p>
<p><strong>洞察三：AI普遍缺乏“主动沟通”的意愿</strong></p>
<p>模型普遍缺乏在信息不足时主动提问的“眼力见”。所有模型家族在需要主动提问的任务上，得分都出现了“断崖式”下跌。例如，Claude家族的平均分从46.0骤降至27.4。这表明，AI倾向于“想当然”，而不是在不确定时“多问一句”。</p>
<p><img src="https://p0.meituan.net/meituantechblog/dc9b1835d1107a759336fabf3ba6870074674.webp" alt="图6：模型在主动性任务上的性能表现"></p>
<p><strong>洞察四：就算“喂到嘴边”，AI也未必会吃</strong></p>
<p>为了分离“提取偏好”和“利用偏好”这两个难题，我们直接把真实用户偏好告诉模型。虽然性能有所提升，但仍有很大进度空间。<strong>即便把真实偏好直接告诉模型，多数模型仍然失败</strong>。这说明，即使拥有了准确的用户画像，在高压、多约束的决策中正确应用这些偏好，本身就是一个巨大的挑战。</p>
<p><img src="https://p1.meituan.net/meituantechblog/cf75832fa9983f74bb404bf899cac91223446.webp" alt="图7：在提供真实偏好下的模型性能"></p>
<p><strong>洞察五：从“工具失误”到“情商不足”的瓶颈转移</strong></p>
<p>我们对模型的失败原因进行了分类统计。在由<strong>66个真实工具</strong>构成的复杂生活服务场景中，早期模型更多地犯下工具使用错误（A类），例如选错API或填错参数。而更强的模型（如DeepSeek-V4-Pro）虽然工具用得更好了，但在偏好理解和应用（B类）上的失败却成了主要矛盾。这表明随着模型基础能力的提升，<strong>个性化已是当前 Agent 的最大瓶颈</strong>。</p>
<p><img src="https://p1.meituan.net/meituantechblog/8cdd5784d215584793d4eabed47c184f59698.webp" alt="图8：模型失败模式分析（DeepSeek家族为例）"></p>
<h2>03 总结：定义下一代智能体评测范式</h2>
<p>VitaBench 2.0清晰地揭示了，当前AI在成为“高情商助理”的路上，依然任重道远。</p>
<p>它的核心价值，在于推动了评测范式的演进：<strong>从单点任务到长期陪伴，从被动执行到主动沟通，从黑盒到透明</strong>。这使得VitaBench 2.0成为一座连接技术与产品的“桥梁”，它用可量化的数据回答了“我的AI为什么不够好用”的问题，并为开发者指明了模型在“服务于人”这一终极目标上的具体短板。</p>
<p>我们希望，VitaBench 2.0能成为一个起点，激发更多研究关注智能体的个性化、记忆和主动性，共同推动AI从一个强大的“工具”进化为一个有温度的“伙伴”。</p>
<p><strong>VitaBench 2.0 已全面开源，欢迎各大模型前来接受“情商”大考</strong>。</p>
<p><strong>开源地址</strong></p>
<ul>
<li><strong>项目主页</strong>： <a href="https://vitabench2.github.io/" target="_blank" rel="noopener noreferrer">https://vitabench2.github.io/</a></li>
<li><strong>论文链接</strong>： <a href="https://arxiv.org/abs/2605.27141" target="_blank" rel="noopener noreferrer">https://arxiv.org/abs/2605.27141</a></li>
<li><strong>GitHub</strong>： <a href="https://github.com/meituan-longcat/vitabench-2.0" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/vitabench-2.0</a></li>
<li><strong>HuggingFace</strong>：<a href="https://huggingface.co/datasets/meituan-longcat/VitaBench-2.0" target="_blank" rel="noopener noreferrer">https://huggingface.co/datasets/meituan-longcat/VitaBench-2.0</a></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/ecfdc52ee4ab7253a877d5df75217f21127484.webp" type="image/webp"/>
    </item>
    <item>
      <title>美团技术团队顶会论文分享：搜索推荐ASX专场</title>
      <link>https://tech.meituan.com/2026/06/18/2026-ASX.html</link>
      <guid>https://tech.meituan.com/2026/06/18/2026-ASX.html</guid>
      <source url="https://tech.meituan.com/rss.xml">美团技术团队顶会论文分享：搜索推荐ASX专场</source>
      <description>美团业务研发平台/搜推 ASX (Agentic System X)团队聚焦构建大模型为基础的 Agent 技术体系，在大模型后训练、Agentic 强化学习以及多模态理解等核心前沿方向持续深耕，已在 ICLR、NeurIPS、CVPR、AAAI 等 AI 领域的国际顶会发表数十篇高质量研究成果。本文精选了6篇进行解读，希望对大家有所帮助或启发。</description>
      <content:encoded><![CDATA[<p>美团业务研发平台/搜推 ASX (Agentic System X)团队聚焦构建大模型为基础的 Agent 技术体系，在大模型后训练、Agentic 强化学习以及多模态理解等核心前沿方向持续深耕，已在 ICLR、NeurIPS、CVPR、AAAI 等 AI 领域的国际顶会发表数十篇高质量研究成果。本文精选了6篇进行解读，希望对大家有所帮助或启发。</p>
<h2>01 Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards</h2>
<p><strong>上下文轨迹老虎机：面向可验证奖励的强化学习</strong></p>
<p>论文下载：<a href="https://arxiv.org/abs/2602.08499" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/b59c0ffafdeba4539136582e0271b740362659.png" alt=""></p>
<p><strong>论文简介</strong>：现有基于规则奖励的强化学习后训练通常直接使用最近一轮 rollout 进行策略优化，其中，低质量样本会引入噪声，高质量样本又常在单次使用后被丢弃，导致训练不稳定、样本利用不足。本文提出在线样本调度算法 CBS，将样本选择建模为上下文多臂老虎机问题，把每个候选样本视为 arm，并以训练后带来的性能增益作为奖励；通过轻量神经网络预测样本价值，并结合在线反馈动态调度。实验表明，CBS 可与多种策略优化方法结合，在 6 个数学推理数据集上稳定提升性能和训练效率。</p>
<h2>02 ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning</h2>
<p><strong>ResRL：通过负样本投影残差强化学习提升大语言模型推理能力</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2605.00380" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/c3dfb092a8e1937a69abc1722d9331f0509496.png" alt=""></p>
<p><strong>论文简介</strong>：本文提出 ResRL，一个负样本强化学习的新算法，旨在解决RLVR 提升LLM推理能力却损伤了输出多样性的问题。我们发现根因是惩罚负样本时误伤了正负样本共享的有效语义。ResRL 用 SVD 正确子空间 +投影残差，让惩罚只打在“真正的错误方向”上--数学超 NSR 9.4%、代码刷新 CodeForces SOTA、ALFWorld 超 PPO 7.8%，且 Pass@1 与 Pass@k 兼得。</p>
<h2>03 CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling</h2>
<p><strong>CDRRM：对比驱动的评分准则生成以实现可靠且可解释的奖励建模</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2603.08035" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/8847ebcc0f8b9e40bc4e27cf77c58e83700241.png" alt=""></p>
<p><strong>论文简介</strong>：本文提出 CDRRM，一个对比驱动的评分准则生成与奖励建模框架，旨在提升LLM对齐中奖励模型的可靠性、可解释性与数据效率。传统奖励模型是“黑箱”且依赖昂贵标注；现有准则方法存在冗余与偏见。CDRRM采用“对比-聚合”流程：先对比好/差回答定位关键差异，再聚合为简洁的任务相关准则，指导评判模型。实验表明，CDRRM在三个基准上达最先进水平，缓解话痨、位置等偏见，且仅用3千样本让未微调模型超越全量微调基线，兼具高效与可解释性。</p>
<h2>04 LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services</h2>
<p><strong>LocalSearchBench:真实本地生活服务中的智能体搜索基准评测</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2512.07436" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/169201562bedc76379b2721360d481a3524305.png" alt=""></p>
<p><strong>论文简介</strong>：本文针对本地生活服务领域智能体搜索的研究空白，构建LocalSearchBench评测基准。该基准涵盖国内 9 座城市、6 大服务品类，包含超 134 万商户数据与 900 道用户多跳问答任务，同时配套交互环境 LocalPlayground 与商户检索工具 LocalRAG。实验测评 16 款主流大语言推理模型后发现,当前模型在此类任务表现不佳，最优模型 DeepSeek-V3.2 答题正确率仅 35.60%，普遍存在信息完整性、可信度不足等问题。研究还剖析了模型工具调用、多跳推理等典型缺陷，为本地生活服务场景下智能体搜索的模型训练和基准测试提供了重要支撑。</p>
<h2>05 DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain</h2>
<p><strong>DiningBench：饮食领域感知与推理的层次化多视角基准</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2604.10425" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/147fffac098126cce65e2db924ae00c0336417.png" alt=""></p>
<p><strong>论文简介</strong>：本论文提出 DiningBench，一个面向饮食领域的层次化多视角 VLM 评测基准，旨在弥补现有数据集任务单一、视角有限和营养标注不足的问题。该基准包含细粒度分类、营养估计和视觉问答三类任务，覆盖 3,021 道菜品和多视角图像。通过评测 29 个主流VLM模型，揭示现有模型在细粒度识别、营养推理和多视角融合上的不足。</p>
<h2>06 Mem²Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation</h2>
<p><strong>Mem2Evolve：通过协同进化能力扩展与经验蒸馏实现自进化智能体</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2604.10923v1" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/383439ef9a174a64e2bb1775919ae3c3476454.png" alt=""></p>
<p><strong>论文简介</strong>：本文提出 Mem2Evolve，一个面向大语言模型智能体的自进化框架，通过 Asset Memory 与 Experience Memory 双记忆机制，协同实现能力扩展与经验积累。该框架可在任务执行中动态复用或创建工具与专家智能体，并从成功和失败轨迹中蒸馏可迁移经验。实验覆盖 6 类任务、8 个基准，结果表明 Mem2Evolve 显著优于普通 LLM 及单一进化策略，展现出更强的持续学习与任务泛化能力。</p>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/b59c0ffafdeba4539136582e0271b740362659.png" type="image/png"/>
    </item>
    <item>
      <title>美团海报生成 AIGC 技术创新与实践</title>
      <link>https://tech.meituan.com/2026/06/18/AIGC-poster.html</link>
      <guid>https://tech.meituan.com/2026/06/18/AIGC-poster.html</guid>
      <source url="https://tech.meituan.com/rss.xml">美团海报生成 AIGC 技术创新与实践</source>
      <description>美团智能创作团队围绕海报生成 AIGC 构建了完整技术体系，打造「生成-编辑-评判」技术闭环，目前在美团外卖、品牌 IP 等场景落地，已全部开源。</description>
      <content:encoded><![CDATA[<p>一张商业海报，对设计师来说可能是半天工作；对百万中小商家来说，却可能是一道迈不过去的门槛。外包一张专业海报，少则数百、多则数千元；临时促销要求分钟级交付，传统设计流水线却要1到3天；好不容易批量生产出来，质量又参差不齐——这是美团平台上数百万商家每天都在面对的真实困境。AIGC 给了我们一个新的答案，但「生成一张看起来还行的图」和「生成一张真正可用的商业海报」之间，横亘着精准文字渲染、和谐版式布局、多任务统一支持、质量可量化评估等多项相互交织的技术挑战。过去两年，美团智能创作团队围绕这一问题，构建了覆盖「能生成、能编辑、能评判」的完整技术体系：</p>
<ul>
<li>PosterCraft（ICLR 2026）：摒弃模块化流水线，端到端统一优化文字、视觉与版式，在文字渲染准确率上接近Top级别的闭源商业系统；</li>
<li>PosterOmni（CVPR 2026）：单一模型覆盖扩图、补全、比例调整、风格迁移等六类设计任务，更接近"基于参考稿工作的智能设计助手"；</li>
<li>PosterReward（CVPR 2026）：首个专门面向海报质量评估的奖励模型，在专项评测基准上达到 86% 准确率，远超现有基线，既驱动生成模型持续进化，也承担线上质检把关。</li>
</ul>
<p>三者形成「生成-编辑-评判」的技术闭环，相互支撑、持续自我进化。目前三项工作均已全部开源于&nbsp;MeiGen-AI&nbsp;仓库，并在美团外卖套餐图生成、品牌 IP 袋鼠团团、点评信息流治理等多个真实业务场景中完成落地。本文将系统拆解这套技术体系的核心思路、关键创新与实战经验。</p>
<h2>一、背景与挑战</h2>
<h3>1.1 业务背景：百万商家的"创意平权"难题</h3>
<p>美团连接数百万商家与数亿消费者，海报作为核心视觉营销载体，贯穿商家日常运营全场景。然而，百万商家普遍面临四重困境：</p>
<ul>
<li><strong>设计资源匮乏</strong>：专业营销海报外包动辄数百至数千元，中小商家难以承受；即便是大型连锁品牌，面对多城市、多门店的差异化营销需求，设计师团队同样捉襟见肘。</li>
<li><strong>时效性要求苛刻</strong>：天气突变、突发热点、临时促销等本地生活场景要求海报"分钟级"交付，传统设计流水线 1–3 天的周期已严重脱节。</li>
<li><strong>内容同质化严重</strong>：大量商家依赖固定模板做简单文字替换，海报千篇一律，在信息爆炸时代难以触达消费者，营销转化率持续走低。</li>
<li><strong>批量生产质量失控</strong>：从精雕细琢转向规模化生产后，如何保证每张海报达到商业可用标准，成为新的运营难题。</li>
</ul>
<h3>1.2 技术挑战：高质量海报生成的多维难题</h3>
<p>AIGC 为上述问题提供了新思路，但<strong>高质量海报生成</strong>远非简单的文生图任务，面临五大相互交织的技术挑战。</p>
<p><strong>挑战一：精准的文字渲染</strong></p>
<p>海报文字要求"零容错"——任何错误、缺失或模糊都导致整张海报不可用。主流扩散模型在多行文字、中文字符和小字号文本上仍有明显短板，中文场景下难度尤甚。</p>
<p><strong>挑战二：和谐的版式布局</strong></p>
<p>优秀海报遵循对比、重复、对齐、亲密性等设计原则，这种"设计感"难以规则化，更多依赖对大量优秀作品的隐式学习，是一个开放性难题。</p>
<p><strong>挑战三：统一的美学风格</strong></p>
<p>色彩和谐、视觉层次、品牌调性等多维度共同构成美学判断，且不同行业标准迥异：餐饮要"食欲感"，美妆要"精致感"，科技要"未来感"。模型需在保持整体美学水准的同时适配多样化风格需求。</p>
<p><strong>挑战四：多任务场景的统一</strong></p>
<p>真实设计需求横跨"局部编辑"（文字排版叠加、局部填充）和"全局创作"（风格迁移、版式重组）两大范畴，如何在单一模型中同时支持所有场景，是模型设计和训练策略上的重大挑战。</p>
<p><strong>挑战五：质量评估的可量化</strong></p>
<p>现有图像质量指标（FID、IS 等）无法捕捉海报特有的排版质量、文字准确性和设计规范性，而人工评估成本高昂且难以规模化。我们需要一套既能驱动模型优化（作为 RL 奖励信号），又能承担线上质检的自动化评估体系。</p>
<h3>1.3 我们的解法：构建"生成-编辑-评判"技术闭环</h3>
<p>面对上述挑战，我们团队围绕海报生成构建了一套完整的技术体系，覆盖<strong>基础模型能力提升</strong>、<strong>多任务统一模型融合</strong>和<strong>质量评估模型</strong>三大核心环节，形成了"能生成、能编辑、能评判"的技术闭环。</p>
<ul>
<li><strong>能生成</strong>：端到端高美感海报生成，精准文字渲染；技术方案→ <a href="https://arxiv.org/pdf/2506.10741" target="_blank" rel="noopener noreferrer">PosterCraft</a>｜<a href="https://github.com/MeiGen-AI/PosterCraft" target="_blank" rel="noopener noreferrer">Code</a>（ICLR 2026）</li>
<li><strong>能编辑</strong>：六大任务统一，局部编辑与全局创作融合；技术方案→ <a href="https://arxiv.org/pdf/2602.12127" target="_blank" rel="noopener noreferrer">PosterOmni</a>｜<a href="https://github.com/MeiGen-AI/PosterOmni" target="_blank" rel="noopener noreferrer">Code</a>（CVPR 2026）</li>
<li><strong>能评判</strong>：真实海报结构化解析 + 生成海报偏好评估；技术方案→营销海报结构化 + <a href="https://arxiv.org/pdf/2603.29855" target="_blank" rel="noopener noreferrer">PosterReward</a>（CVPR 2026）</li>
</ul>
<p>三者相互支撑、协同进化：评估驱动生成优化，生成拓展编辑边界，编辑反哺评估标准，共同构成一个持续自我进化的后训练系统。相关工作已产出三篇顶级学术会议论文，并全部开源于<a href="https://github.com/MeiGen-AI" target="_blank" rel="noopener noreferrer">MeiGen-AI仓库</a>。</p>
<h2>二、技术体系全景</h2>
<p>我们的海报生成技术体系遵循一个清晰的演进路径：</p>
<p><img src="https://p0.meituan.net/meituantechblog/861434cef3a148ae0093da6666e149361816826.png" alt=""></p>
<p>各层相互支撑：<strong>PosterCraft</strong> 奠定端到端生成基础；<strong>PosterOmni</strong> 在此之上拓展至多任务统一编辑；质量评估层构建"双线并行"体系——<strong>营销海报结构化</strong>面向线上存量海报，提供构图、配色、氛围感的结构化解析与美学评分；<strong>PosterReward</strong> 面向 AI 生成内容，提供偏好评估信号，既驱动生成模型持续进化（RL 奖励函数），也承担工业化生产的质检把关。</p>
<h2>三、端到端高美感海报生成：PosterCraft（ICLR 2026）</h2>
<h3>3.1 核心思想</h3>
<p>过去的海报生成方法大多采用<strong>模块化设计</strong>——先由视觉语言模型规划布局，再将文字叠加到单独生成的背景上。这种流水线方案存在根本性缺陷：美学一致性难以保证，视觉质量受限于各模块的短板拼接。</p>
<p>PosterCraft 的核心思路是：<strong>摒弃模块化流水线，让模型端到端地自由探索视觉连贯的设计组合</strong>。渐进式的组件级改进不足以带来美学层面的质的飞跃，需要一套统一框架来协同优化文字、视觉和版式。</p>
<h3>3.2 四阶段级联优化工作流</h3>
<p>PosterCraft 设计了四阶段训练流程，每个阶段针对一个关键瓶颈：</p>
<p><img src="https://p0.meituan.net/meituantechblog/1f7bf60eec315936b2067365a7c074d31158073.png" alt=""></p>
<p><strong>阶段一：大规模文字渲染优化</strong></p>
<p>构建 <strong>Text-Render-2M</strong> 数据集（200 万样本，涵盖多样文字内容、大小、位置和旋转角度）。通过 Flow Matching 微调，显著提升文字渲染准确率，有效解决基础模型常见的文字缺失、重复和错误问题。</p>
<p><img src="https://p1.meituan.net/meituantechblog/ca634a457456cbb9a9cf9f1cd5f84649110870.png" alt=""></p>
<p><strong>阶段二：高质量海报微调 + 区域感知校准</strong></p>
<p>构建 <strong>HQ-Poster-100K</strong>，经多级管线筛选超过 10 万张高质量海报。关键创新是区域感知校准（Region-Aware Calibration）机制，对不同区域差异化加权：非文字区域（1.0）、主要文字区域（0.6）、次要文字区域（0.2），在保持文字准确的同时更注重整体艺术性。</p>
<p><strong>阶段三：美学-文本强化学习</strong></p>
<p>构建 <strong>Poster-Preference-100K</strong>：对每个 prompt 生成 5 张海报，用 HPSv2 打分结合 Gemini 验证文字准确性，筛选出 6000 个高质量偏好对。采用 Best-of-N 偏好优化（DPO），让模型学习色彩和谐、版式平衡等高阶美学偏好。</p>
<p><strong>阶段四：视觉-语言反馈精炼</strong></p>
<p>构建 <strong>Poster-Reflect-120K</strong>：对每个 prompt 生成 6 张海报，由 Gemini 选择最优并生成结构化反馈建议。利用 InternVL-3-8B 微调为 VLM 评论家，在推理时提供迭代式反馈优化。</p>
<h3>3.3 核心成果</h3>
<p>PosterCraft 在文字召回率、F-score 和准确率上<strong>显著超越所有开源基线</strong>，接近 SOTA 闭源商业系统（如 Gemini 2.0-Flash-Gen）的水平，证明了统一端到端框架在海报生成任务上的巨大潜力。</p>
<p><img src="https://p0.meituan.net/meituantechblog/da0ef43ee67c6680870a987f778393fd4129254.png" alt=""></p>
<h2>四、多任务统一的图像到海报创作：PosterOmni（CVPR 2026）</h2>
<h3>4.1 核心思想：从 Text-to-Poster 到 Image-to-Poster</h3>
<p>不少 AI 海报生成方法将输入设定为文本提示（Text-to-Poster），但真实设计场景中，更常见的起点是<strong>一张参考图、旧版海报或产品主视觉</strong>——设计目标不是完全重做，而是在保留核心主体的基础上完成扩图、补全、比例调整、风格迁移和版式重组。</p>
<p>PosterOmni 的核心定位：</p>
<blockquote>
<p><strong>A unified open model for versatile multi-task image/poster-to-poster generation.</strong></p>
</blockquote>
<p>它通过一个统一的开源模型覆盖多类设计需求，既能处理局部编辑，也能完成风格重塑和版式重构——更接近一个"<strong>基于参考稿工作的智能设计助手</strong>"，而非"编辑模块 + 生成模块"的简单拼接。</p>
<p><img src="https://p0.meituan.net/meituantechblog/d5db45749034556fffac53e65fd393991778168.png" alt=""></p>
<h3>4.2 统一"图到海报"范式：单一模型覆盖六类典型设计需求</h3>
<p>PosterOmni 将 image/poster-to-poster 场景中的常见需求整理为 <strong>6 类任务</strong>，统一由一个模型完成：</p>
<p><img src="https://p0.meituan.net/meituantechblog/64f8c774a7d1659fac7c754a1d85ea4d223570.png" alt=""></p>
<p>这些能力共同对应了一个真实的设计流程：</p>
<p><img src="https://p0.meituan.net/meituantechblog/734a4d8143a2ed82fefb9955ee99e57e1995735.png" alt=""></p>
<h3>4.3 核心难点：多任务冲突的缓解</h3>
<p>多任务统一建模的核心难点在于<strong>任务间的相互干扰</strong>：局部编辑强调像素级一致性和自然过渡，全局创作则关注风格抽象和大幅度重构。直接混合训练容易导致模型"什么都会一点"，但整体不稳定。</p>
<p>PosterOmni 采用"数据—蒸馏—奖励"闭环：</p>
<ol>
<li>分别训练局部编辑和全局创作两类专家模型。</li>
<li>通过任务蒸馏整合为统一学生模型（PosterOmni-SFT）。</li>
<li>加入统一奖励与强化学习，对齐审美偏好、编辑准确性和指令遵循能力。</li>
</ol>
<h3>4.4 方法论：四阶段训练流水线</h3>
<h4>阶段 1：自动化数据构建（PosterOmni-200K）</h4>
<p>构建 <strong>PosterOmni-200K</strong>，形成完整数据闭环：创意描述生成 → 候选图生成 → 多模态筛选 → 任务配对整理。</p>
<p><strong>（1）提示词与基础图生成：贴近真实设计 brief</strong></p>
<p>组合主体/品类/场景/风格标签，借助 VLM（GPT、Qwen3）扩展为带版式约束的结构化描述，再用强 T2I 模型（Qwen-Image 等）渲染候选图，并过滤主体缺失、文字崩坏等不合格样本。</p>
<p><strong>（2）多模态过滤：噪声控制是合成数据的真正瓶颈</strong></p>
<p>对于合成数据而言，真正的瓶颈往往不在数量，而在噪声控制。我们设计了一套分层过滤机制：</p>
<ul>
<li><strong>训练集</strong>：PaddleOCR 检查文本可读性 + jina-clip-v2 图文一致性判断。</li>
<li><strong>评测集</strong>：额外引入 Gemini 2.5 Flash 评估"任务匹配度"。</li>
<li><strong>结构信号</strong>：SAM 2 生成分割区域，为补全、扩图等任务提供 mask 级监督。</li>
</ul>
<p><strong>（3）六类任务配对构建</strong></p>
<p>基于经过过滤的"文本→海报"基础数据，进一步构造六类 image/poster-to-poster 训练任务。每一类任务对应一个模块化的数据生成器：</p>
<ul>
<li><strong>Extending / Filling</strong>：SAM2 构造局部 mask。</li>
<li><strong>Rescaling</strong>：借鉴 BrushNet，构建"比例变化→内容重排"监督对。</li>
<li><strong>ID-driven</strong>：PaddleDet 提取主体 + 增强编辑器构造"主体不变、其余可调"样本。</li>
<li><strong>Layout / Style-driven</strong>：prompt-controlled rerendering，继承布局或风格但不直接复制。</li>
</ul>
<p>最终覆盖商品、美食、活动/旅行、自然、教育、娱乐六大海报主题，产出超过 <strong>20 万个高质量配对样本</strong>。</p>
<p><img src="https://p0.meituan.net/meituantechblog/94e267f5110d845ebdeb3e6d46053e7c2588744.png" alt=""></p>
<h4>阶段 2：任务蒸馏——先拆开学，再合到一起</h4>
<p>如果直接把六类任务混在一起联合训练，最容易出现的问题就是任务冲突：局部任务强调像素对齐与细节保真，全局任务则更关注构图重组与风格抽象，两者在同一个参数空间中往往会互相拉扯。为了解决这个问题，PosterOmni 采用：<strong>先训练专家，再蒸馏成统一学生模型</strong>。</p>
<p><strong>（1）专家训练：</strong></p>
<ul>
<li><strong>局部编辑专家</strong>：负责 Extending / Filling / Rescaling / ID-driven，学习主体一致性与可控编辑能力。</li>
<li><strong>全局创作专家</strong>：负责 Layout-driven / Style-driven，学习版式组织逻辑与风格协调性。</li>
</ul>
<p>同时加入辅助文本渲染训练信号，保证文字可读性。</p>
<p><strong>（2）蒸馏到单一学生：PosterOmni-SFT</strong></p>
<p>最终的统一模型不是简单做"参数拼接"，而是训练一个学生网络去逼近专家模型的速度场/预测行为。整体损失由两部分组成：</p>
<div class="language-text line-numbers-mode" data-highlighter="prismjs" data-ext="text"><pre><code><span class="line">L_total = L_text_render (辅助文本渲染损失，保证文字稳定清晰)</span>
<span class="line">        + λ · L_distill  (任务蒸馏损失，复现专家输出)</span>
<span class="line"></span></code></pre>
<div class="line-numbers" aria-hidden="true" style="counter-reset:line-number 0"><div class="line-number"></div><div class="line-number"></div></div></div><p>PosterOmni-SFT 同时具备"局部精修的稳定性"和"全局创作的生成性"，不再依赖多个模型串联。</p>
<p><img src="https://p0.meituan.net/meituantechblog/ae87c984e187bfb13cfa2fc65c738c871590352.png" alt=""></p>
<h4>阶段 3：统一奖励模型训练（<span v-pre="" class="katex"><span class="katex-mathml"><math xmlns="http://www.w3.org/1998/Math/MathML"><semantics><mrow><msub><mi>R</mi><mrow><mi>o</mi><mi>m</mi><mi>n</mi><mi>i</mi></mrow></msub></mrow><annotation encoding="application/x-tex">R_{omni}</annotation></semantics></math></span><span class="katex-html" aria-hidden="true"><span class="base"><span class="strut" style="height:0.8333em;vertical-align:-0.15em;"></span><span class="mord"><span class="mord mathnormal" style="margin-right:0.0077em;">R</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.3117em;"><span style="top:-2.55em;margin-left:-0.0077em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight">o</span><span class="mord mathnormal mtight">mni</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.15em;"><span></span></span></span></span></span></span></span></span></span>）</h4>
<p>SFT 使模型"会做"，但难以进一步学会"做得更美观"。我们训练统一奖励模型 <span v-pre="" class="katex"><span class="katex-mathml"><math xmlns="http://www.w3.org/1998/Math/MathML"><semantics><mrow><msub><mi>R</mi><mrow><mi>o</mi><mi>m</mi><mi>n</mi><mi>i</mi></mrow></msub></mrow><annotation encoding="application/x-tex">R_{omni}</annotation></semantics></math></span><span class="katex-html" aria-hidden="true"><span class="base"><span class="strut" style="height:0.8333em;vertical-align:-0.15em;"></span><span class="mord"><span class="mord mathnormal" style="margin-right:0.0077em;">R</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.3117em;"><span style="top:-2.55em;margin-left:-0.0077em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight">o</span><span class="mord mathnormal mtight">mni</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.15em;"><span></span></span></span></span></span></span></span></span></span>，<strong>同时输出通用审美质量与任务完成度的综合分数</strong>。</p>
<p><strong>偏好数据构建：</strong> PosterOmni-SFT 生成多个候选，Gemini-2.5-Pro 初筛后由标注者选优。关键创新是 <strong>negative-pair 策略</strong>：将"输入参考图"记为 rejected、"编辑后输出"记为 chosen，显式强化"有效修改本身有价值"的认知，防止模型在 layout/style 任务中直接拷贝参考图投机。</p>
<p><strong>模型结构：</strong> 基于 Qwen3-VL 编码器 + 轻量 MLP head，编码"视觉质量 + 指令 + 任务类型"，采用 Bradley-Terry 目标优化排序损失 <span v-pre="" class="katex"><span class="katex-mathml"><math xmlns="http://www.w3.org/1998/Math/MathML"><semantics><mrow><msub><mi>L</mi><mrow><mi>B</mi><mi>T</mi></mrow></msub></mrow><annotation encoding="application/x-tex">L_{BT}</annotation></semantics></math></span><span class="katex-html" aria-hidden="true"><span class="base"><span class="strut" style="height:0.8333em;vertical-align:-0.15em;"></span><span class="mord"><span class="mord mathnormal">L</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.3283em;"><span style="top:-2.55em;margin-left:0em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight" style="margin-right:0.0502em;">B</span><span class="mord mathnormal mtight" style="margin-right:0.1389em;">T</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.15em;"><span></span></span></span></span></span></span></span></span></span>。最终，<span v-pre="" class="katex"><span class="katex-mathml"><math xmlns="http://www.w3.org/1998/Math/MathML"><semantics><mrow><msub><mi>R</mi><mrow><mi>o</mi><mi>m</mi><mi>n</mi><mi>i</mi></mrow></msub></mrow><annotation encoding="application/x-tex">R_{omni}</annotation></semantics></math></span><span class="katex-html" aria-hidden="true"><span class="base"><span class="strut" style="height:0.8333em;vertical-align:-0.15em;"></span><span class="mord"><span class="mord mathnormal" style="margin-right:0.0077em;">R</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.3117em;"><span style="top:-2.55em;margin-left:-0.0077em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight">o</span><span class="mord mathnormal mtight">mni</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.15em;"><span></span></span></span></span></span></span></span></span></span> 学到的不只是"什么更好看"，还有"对这个任务来说什么算做对、什么算偷懒"。</p>
<h4>阶段 4：Omni-Edit 强化学习</h4>
<p>沿用 <strong>DiffusionNFT</strong> 思路，在正向扩散过程中直接优化，用对比式 Diffusion Loss 将速度预测器推向高奖励行为：从旧策略 <span v-pre="" class="katex"><span class="katex-mathml"><math xmlns="http://www.w3.org/1998/Math/MathML"><semantics><mrow><msub><mi>v</mi><mrow><mi>o</mi><mi>l</mi><mi>d</mi></mrow></msub></mrow><annotation encoding="application/x-tex">v_{old}</annotation></semantics></math></span><span class="katex-html" aria-hidden="true"><span class="base"><span class="strut" style="height:0.5806em;vertical-align:-0.15em;"></span><span class="mord"><span class="mord mathnormal" style="margin-right:0.0359em;">v</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.3361em;"><span style="top:-2.55em;margin-left:-0.0359em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight">o</span><span class="mord mathnormal mtight" style="margin-right:0.0197em;">l</span><span class="mord mathnormal mtight">d</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.15em;"><span></span></span></span></span></span></span></span></span></span> 构造隐式正/负策略，用奖励 <span v-pre="" class="katex"><span class="katex-mathml"><math xmlns="http://www.w3.org/1998/Math/MathML"><semantics><mrow><mi>r</mi><mo>∈</mo><mo stretchy="false">[</mo><mn>0</mn><mo separator="true">,</mo><mn>1</mn><mo stretchy="false">]</mo></mrow><annotation encoding="application/x-tex">r \in [0,1]</annotation></semantics></math></span><span class="katex-html" aria-hidden="true"><span class="base"><span class="strut" style="height:0.5782em;vertical-align:-0.0391em;"></span><span class="mord mathnormal" style="margin-right:0.0278em;">r</span><span class="mspace" style="margin-right:0.2778em;"></span><span class="mrel">∈</span><span class="mspace" style="margin-right:0.2778em;"></span></span><span class="base"><span class="strut" style="height:1em;vertical-align:-0.25em;"></span><span class="mopen">[</span><span class="mord">0</span><span class="mpunct">,</span><span class="mspace" style="margin-right:0.1667em;"></span><span class="mord">1</span><span class="mclose">]</span></span></span></span> 对目标加权，同时做归一化以稳定训练尺度。</p>
<p>将 DiffusionNFT 适配到 image-to-poster 条件输入（输入图 + 指令 + 任务类型），在统一机制下同时处理局部编辑和全局创作。</p>
<p><strong>与通用 VLM 奖励的关键区别</strong>：通用 VLM 打分不理解 poster 任务的完成标准，容易出现"看起来像但任务没做对"的投机解。<span v-pre="" class="katex"><span class="katex-mathml"><math xmlns="http://www.w3.org/1998/Math/MathML"><semantics><mrow><msub><mi>R</mi><mrow><mi>o</mi><mi>m</mi><mi>n</mi><mi>i</mi></mrow></msub></mrow><annotation encoding="application/x-tex">R_{omni}</annotation></semantics></math></span><span class="katex-html" aria-hidden="true"><span class="base"><span class="strut" style="height:0.8333em;vertical-align:-0.15em;"></span><span class="mord"><span class="mord mathnormal" style="margin-right:0.0077em;">R</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.3117em;"><span style="top:-2.55em;margin-left:-0.0077em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight">o</span><span class="mord mathnormal mtight">mni</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.15em;"><span></span></span></span></span></span></span></span></span></span> 给出 <strong>task-aware</strong> 分数，使 RL 优化方向不仅是"更好看"，也是"更像完成了这个任务"。</p>
<h3>4.5 PosterOmni-Bench：统一评测基准</h3>
<p><strong>PosterOmni-Bench</strong> 是首个面向多任务设计场景的统一测试基准：</p>
<ul>
<li><strong>规模</strong>：中英文共 <strong>1020 条</strong>测试指令（540 中文 + 480 英文）。</li>
<li><strong>覆盖</strong>：六类核心任务 × 六大海报主题，同时覆盖单/多参考图输入。</li>
<li><strong>评测</strong>：Gemini-2.5-Pro 打分，1–5 分范围内综合评价审美质量与任务完成情况。</li>
</ul>
<p>这个 Benchmark 测的不是"能不能生成一张图"，而是"能不能像设计师一样完成海报修改与再设计"。</p>
<h3>4.6 实验结果</h3>
<p><strong>定量结果：六项任务全面领先</strong></p>
<p>在 PosterOmni-Bench 上对比主流开源方法（Qwen-Image-Edit、FLUX.1 Kontext、BAGEL、UniWorld-V2 等）及闭源系统（Seedream 系列）：</p>
<ul>
<li><strong>PosterOmni 在全部六类任务上均取得开源模型最佳表现</strong>，整体评分超过部分闭源模型。</li>
<li>提升来自"局部精修 + 全局创作"两类能力的<strong>同时增强</strong>，而非集中于某一子任务。</li>
<li>相较 Qwen-Image-Edit：在 Layout-driven / Style-driven 上增幅最大，说明模型真正学到了布局与风格背后的生成规则。</li>
<li>相较 Seedream-4.0：整体平均已实现反超，单一开源模型已具备处理复杂设计需求的实际可用性。</li>
</ul>
<p><img src="https://p0.meituan.net/meituantechblog/d3043c6dd6453d62e3d2566d8ccbeefd334071.png" alt=""></p>
<p><strong>定性对比：学风格/学布局 ≠ 直接 copy</strong></p>
<p><strong>Style-driven 的常见失败</strong>：很多 baseline 会把参考图的局部元素直接"贴"过来。PosterOmni 更偏向学习配色、材质感、字体气质等"风格本质"，再迁移到新主体上。</p>
<p><strong>Rescale / Layout-driven 的常见失败</strong>：很多系统只做裁剪/拉伸。PosterOmni 更像在做"改比例→重排版"：标题层级、留白、元素间距随之调整，主体也更稳定。</p>
<p><img src="https://p1.meituan.net/meituantechblog/c09df87d809bdcc92683b549f1423c843511341.png" alt=""></p>
<h2>五、海报质量评估：PosterReward（CVPR 2026）</h2>
<p>海报评估是整个技术体系的"质量守门人"，沿两条互补路线展开——核心差异不在于处理对象，而在于<strong>质量信号的来源方式</strong>：</p>
<ul>
<li><strong>真实海报的结构化评估</strong>：面向线上运营海报素材，以<strong>专业设计规范的显式标准</strong>为锚，通过多维度结构化解析实现智能质检与规范管理</li>
<li><strong>生成海报的奖励模型</strong>：面向 AI 生成内容，以<strong>用户主观偏好对齐</strong>为驱动，通过端到端学习提供精准质量信号，驱动生成模型持续进化</li>
</ul>
<p>两者共同构成"存量评估 + 增量优化"的完整评估体系。</p>
<p><img src="https://p0.meituan.net/meituantechblog/face43475149dfc38233ca2e0badef5e1945335.png" alt=""></p>
<h3>5.1 真实海报的结构化评估：营销海报图像结构化</h3>
<h4>5.1.1 问题定义</h4>
<p>营销海报是"人工制作"的信息载体，具有明确的信息要素和规则搭配，简单的整图美学评分存在显著局限。</p>
<p>我们提出<strong>营销海报图像结构化</strong>解析方案：将海报从多维度拆解分析，把视觉信息转换为规范化的结构化描述，并输出各维度量化美学评分。整套方案围绕三大核心维度展开：<strong>排版构图、色系搭配、氛围风格</strong>。</p>
<p><img src="https://p0.meituan.net/meituantechblog/cf3831dceb0c82644d32de0051c4c3802491234.png" alt=""></p>
<h4>5.1.2 排版构图解析</h4>
<p>营销海报设计遵循页面排版四大基础原则：<strong>对比、重复、对齐、亲密性</strong>。要理解海报构图的好坏，首先需要对海报内容元素做精准解析。</p>
<p><strong>内容定位算法</strong></p>
<p>构建营销海报内容定位模型（准确率 90%+），定位 <strong>12 种常见元素</strong>：</p>
<blockquote>
<p>文案、价格、修饰、卡通动漫、美团Logo、其他Logo、人像、美团IP、红包、菜品、商品</p>
</blockquote>
<p>模型对任意输入的海报图，返回各元素在图中的位置坐标及对应类别，覆盖不同类型、不同尺寸的营销海报。</p>
<p><img src="https://p0.meituan.net/meituantechblog/c9b31b0191c8275ead99023af304ade92117053.png" alt=""></p>
<p><strong>构图美学评价算法</strong></p>
<p>基于元素定位结果，通过 CNN 回归模型拟合设计师主观评价，输出量化构图美学分数：</p>
<ul>
<li>5 分制构图得分误差仅 <strong>0.3794</strong>（归一化误差 0.0759）。</li>
<li>近 <strong>90%</strong> 的图片得分误差控制在 1 分以内。</li>
</ul>
<p>算法可判断海报构图手法（上下/左右/居中构图等），并评估主体占比、布局紧凑度、画面留白等维度。</p>
<p><img src="https://p0.meituan.net/meituantechblog/f7105bd1f74cbaf157f97c44bbe1197c969668.png" alt="营销海报构图人机打分差异"></p>
<h4>5.1.3 色系搭配识别</h4>
<p>色彩是营销海报传达情感的重要介质。不同业务类型适配不同的色系——粉色系营造浪漫/女生氛围，绿色系迎合健康环保调性，黑色系打造科技感或高端奢华风格。</p>
<p><strong>主色系识别算法</strong></p>
<p>模型准确率96.2%，支持识别 <strong>11 种色系</strong>：</p>
<blockquote>
<p>粉色系、绿色系、黑色系、白色系、橙黄系、蓝色系、银灰系、红色系、紫色系、棕色系、多色系</p>
</blockquote>
<p>同时输出各色系置信度，对多色系海报也有良好理解能力。</p>
<p><img src="https://p0.meituan.net/meituantechblog/23f462713dff153b7cbb319fca6a8a0c1469655.png" alt="海报主色系识别算法结果展示"></p>
<p><strong>色彩解析算法</strong></p>
<p>支持 12 种基础颜色的占比识别，以及基于 HSV 色彩空间的冷暖色调判断，为色彩和谐度评估提供基础数据。</p>
<p><img src="https://p0.meituan.net/meituantechblog/36981484e1059d142e51f3739374ff4c488816.png" alt="海报色彩解析算法结果展示"></p>
<p><strong>色彩美学评价</strong></p>
<p>将色彩美学拆解为<strong>色彩饱和度</strong>和<strong>颜色和谐度</strong>两个维度，通过深度学习拟合设计师主观评价，输出量化色彩美学分值。</p>
<p><img src="https://p0.meituan.net/meituantechblog/29ef0ea5ed74ebf86230b06dabfc94ce1306535.png" alt="色彩美学评价得分展示"></p>
<h4>5.1.4 氛围感风格识别</h4>
<p>一张优秀的营销海报需要告别千篇一律的模板感，让消费者感受到身临其境的独特氛围——这也是海报从"能看"到"吸引人"的关键跃迁。</p>
<p><strong>风格识别算法</strong></p>
<p>模型准确率91.50%，支持识别 <strong>12 种常见海报风格</strong>：</p>
<blockquote>
<p>节日、卡通、简洁、多彩、科技、柔美、素雅、促销、撞色、实拍、标准、其他</p>
</blockquote>
<p>海报风格与文案/商品内容无关，由海报模板及装饰元素营造的<strong>整体氛围感</strong>决定。</p>
<p><img src="https://p0.meituan.net/meituantechblog/2102cc97980395624f9cba2a4d638bdb1862841.png" alt="营销海报常见风格定义"></p>
<h4>5.1.5 整体美学综合评价</h4>
<p>在构图、色彩、氛围感等主观维度，以及清晰度、分辨率等客观维度的基础上，综合输出<strong>整体美学评分</strong>，基本拟合设计师的主观评价标准。</p>
<p><img src="https://p0.meituan.net/meituantechblog/e5cb33dbf135c193a5882ae45f723b0c1261786.png" alt="海报整体美学得分展示"></p>
<h3>5.2 生成海报的奖励模型</h3>
<h4>5.2.1 核心思想</h4>
<p>PosterReward 是<strong>首个专门面向海报质量评估的奖励模型</strong>，集成结构布局、文字渲染准确性和美学表达三个维度的统一评分能力。现有通用奖励模型主要关注全局图像美学，忽略了海报特有的排版质量和文字渲染维度，加之领域偏好数据极度稀缺，生成海报评估长期是制约生成质量提升的核心瓶颈。PosterReward 的评估维度继承了结构化评估的实践经验——构图、色彩、整体美学在两套方案中形成概念对齐与技术递进。</p>
<h4>5.2.2 AI 偏好数据集自动构建（Poster-Preference-70K）</h4>
<p><img src="https://p0.meituan.net/meituantechblog/97c08edd5d0c4542353c48e491b4e1d8892964.png" alt=""></p>
<p>高质量偏好数据是训练奖励模型的基石。我们设计了一套自动化偏好数据构建管线：</p>
<p><strong>数据来源</strong>：Seedream 3.0、Seedream 4.0 和 Qwen-Image-Lightning 生成的海报池（覆盖影视类和非影视类两大场景）。</p>
<p><strong>级联式过滤</strong>：</p>
<ul>
<li>影视海报：HPSv3 初筛 → Kendall's W 一致性筛选 → 轻量闭源模型多轮排序 → 最终多模型验证。</li>
<li>非影视海报：同尺寸过滤 → CLIP+DINOv3 差异性筛选 → 多模型最终验证。</li>
</ul>
<p><strong>最终多模型验证</strong>：四个开源模型（CLIP、DINOv3、HPSv3、GLM-4.5V）和三个闭源模型（Gemini-2.5-Flash-Lite、Gemini-2.5-Pro、GPT-5）进行多维度共识判定，最终产出 <strong>7万高质量海报偏好对</strong>，覆盖文字渲染、布局设计、美学价值、指令一致性等多个维度。</p>
<h4>5.2.3 级联式多阶段训练</h4>
<p><img src="https://p1.meituan.net/meituantechblog/6289aff1230af0e3fc1da9b0844c3fd41016894.png" alt=""></p>
<p>PosterReward 采用四阶段级联训练策略：</p>
<p><strong>阶段一：联合监督微调（Joint SFT）</strong> 双任务并行——单图分析 + 配对比较，使用 24.6万 单图分析样本 + 16万 配对偏好样本微调 Qwen3-VL-8B。</p>
<p><strong>阶段二：联合拒绝采样微调（Joint RSFT）</strong>
每个 prompt 采样三个回答，由 Gemini-2.5-Flash-Lite 选择最高质量响应精炼。</p>
<p><strong>阶段三：评分模块训练（Score Module Training）</strong>
训练判别式评分模块（Qwen3-VL-8B + 两层 MLP），采用 Bradley-Terry 损失优化。</p>
<p><strong>阶段四：强化学习精炼（GRPO）</strong>
以冻结的评分模块为奖励函数，通过 GRPO 对分析模块进行强化学习微调。</p>
<h4>5.2.4 多变体适配</h4>
<p>为适应不同应用场景，PosterReward 提供三种变体：</p>
<p><img src="https://p1.meituan.net/meituantechblog/f8633fc74396af81573ebd9eaf8ddbc0157579.png" alt=""></p>
<h4>5.2.5 评测基准与核心成果</h4>
<p>我们发布了两个评测基准：<strong>PosterRewardBench</strong>（Basic + Advanced 两个难度级别，评估奖励模型偏好判断准确性）和 <strong>PosterBench</strong>（评估文生图模型的海报生成能力）。</p>
<p>在 PosterRewardBench-Advanced 上，PosterReward 达到 <strong>86.0% 准确率</strong>，远超现有基线（大多在 40%–53% 之间）。<strong>PosterReward-Pairwise</strong> 在 pairwise 评测中保持强竞争力，位置偏置更小，平衡式数据构造和顺序交换策略有效提升了判断稳定性。</p>
<p><img src="https://p0.meituan.net/meituantechblog/dcc87144886a18086ef2e796ceeac72f116735.png" alt=""></p>
<p><img src="https://p0.meituan.net/meituantechblog/4f4db6535bd77ebf92f82afb51630a32129708.png" alt=""></p>
<h3>5.3 评估体系的演进逻辑</h3>
<p>回顾整个评估体系的建设路径，可以看到一条清晰的技术演进线：</p>
<p><img src="https://p0.meituan.net/meituantechblog/acdfb97a94f12c35dd61412d0aff9741196537.png" alt=""></p>
<p>结构化评估积累的维度定义经验（构图、色彩、氛围感）为 PosterReward 的多维度分析模块提供了领域知识参照；PosterReward 的端到端学习能力则克服了传统结构化评估在泛化性和可优化性上的瓶颈。两者的融合是未来评估体系演进的方向。</p>
<h2>六、技术闭环：各模块如何协同？</h2>
<p>整个技术体系并非独立存在的几块工作，而是构成了一个<strong>自我进化的后训练系统</strong>：</p>
<p><img src="https://p0.meituan.net/meituantechblog/a810a1f3854bc8468b49dc94d5a0bb281739540.png" alt=""></p>
<ol>
<li><strong>PosterCraft</strong> 建立端到端生成的基础能力，四阶段工作流已引入奖励模型驱动的美学优化。</li>
<li><strong>PosterOmni</strong> 在 PosterCraft 基础上拓展至多任务场景，其统一 Reward 模型是 PosterReward 理念的任务特化。</li>
<li><strong>营销海报结构化</strong> 从构图、配色、氛围感等维度提供可解释的设计规范标准，为生成链路的评估维度提供领域知识支撑。</li>
<li><strong>PosterReward</strong> 将设计知识内化为端到端奖励信号，既驱动生成模型持续进化（RL 奖励函数），也承担线上"质检线"的品质保障。</li>
</ol>
<h2>七、落地实践</h2>
<p><strong>实际案例 1：与美团设计师合作上线美团品牌IP（PosterCraft生成能力）</strong></p>
<blockquote>
<p>生图 prompt（下左）：给我设计一张袋鼠团团的大寒的节日节气海报。</p>
</blockquote>
<p><img src="https://p0.meituan.net/meituantechblog/3a32d65cc8fea6d91dc99487a3ba284b2230619.png" alt=""></p>
<blockquote>
<p>生图 prompt（上右）：袋鼠团团三维C4D风格，2026年马年新年主视觉，整体节日氛围浓厚，主色调为红色与金色。画面中央是袋鼠团团骑着白马（红色的马鞍，无马缰绳，马蹄上有金和红穗子配饰点缀，呼应生肖主题，活力精神的马年生肖，），面带开心、喜庆的表情，角色主体有柔和的轮廓光，氛围强，作为画面核心主体。画面中点缀烟花、红灯笼等新年元素。背景为中国唐代风格的古建筑群，具有浓厚的东方传统节日氛围。整体画面呈现热闹、喜庆、隆重的新年庆祝场景。主标题： “马年大吉”顶部居中，毛笔创意字体金色，笔触流畅设计感强，大师字体，副标题：“Happy New Year 2026”主标题下面。</p>
</blockquote>
<p><strong>实际案例 2：图生商品海报（PosterOmni 的主体保持能力）</strong></p>
<p><img src="https://p1.meituan.net/meituantechblog/bae54b0cde7b24ce35d25b170098db603218537.png" alt=""></p>
<h2>八、总结与展望</h2>
<p>我们通过 PosterCraft、PosterOmni 和 PosterReward 三项工作，构建了覆盖"<strong>基础生成能力 → 多任务统一融合 → 精准质量评估</strong>"的完整技术体系，三项工作全部开源，期待推动海报/图形设计生成领域的共同发展。</p>
<p><strong>未来，我们将继续探索：</strong></p>
<ul>
<li><strong>更强的可控性</strong>：支持更精细的设计意图传达。</li>
<li><strong>更广的场景覆盖</strong>：从静态海报延伸至动态视觉内容，从零售电商拓展到酒旅、丽人等服务电商场景。</li>
<li><strong>更深的评估维度</strong>：将结构化设计规范知识持续注入奖励模型，实现"可解释 + 可优化"的统一。</li>
<li><strong>更紧的产业闭环</strong>：让规范标准与奖励模型的 RL 信号深度融合，直接驱动生成模型自我进化。</li>
</ul>
<p>从效率到效能，从"能用"到"好用"，AIGC 海报生成正在重新定义百万商家的创意生产方式。</p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/861434cef3a148ae0093da6666e149361816826.png" type="image/png"/>
    </item>
  </channel>
</rss>