<?xml version="1.0" encoding="utf-8"?><?xml-stylesheet type="text/xsl" href="https://tech.meituan.com/rss.xsl"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <atom:link href="https://tech.meituan.com/rss.xml" rel="self" type="application/rss+xml"/>
    <title>美团 · 技术团队</title>
    <link>https://tech.meituan.com/</link>
    <description>美团技术团队|前端|后端|IOS|安卓|客户端</description>
    <language>zh-CN</language>
    <pubDate>Thu, 20 Aug 2026 07:07:12 GMT</pubDate>
    <lastBuildDate>Thu, 20 Aug 2026 07:07:12 GMT</lastBuildDate>
    <generator>@vuepress/plugin-feed</generator>
    <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
    <item>
      <title>美团搜索3.0：LLM 语义表征在排序模型的探索与应用</title>
      <link>https://tech.meituan.com/2026/08/20/01-meituan-Query-3.0.html</link>
      <guid>https://tech.meituan.com/2026/08/20/01-meituan-Query-3.0.html</guid>
      <source url="https://tech.meituan.com/rss.xml">美团搜索3.0：LLM 语义表征在排序模型的探索与应用</source>
      <description>美团搜索团队正依托团垂融合新架构与生成式大模型新技术，全面重构本地生活搜索底座。本系列技术博客将持续介绍美团搜索 3.0 的技术探索，本文聚焦 LLM 语义表征在服务零售排序场景上的三期实践——从单点特征验证到系统性表征体系构建，再到跨场景迁移复用，探索语义匹配信号在搜索排序中的应用路径。</description>
      <content:encoded><![CDATA[<blockquote>
<p>在大语言模型（LLM）技术的深刻影响下，搜索引擎正经历第三次范式跃迁：从 1.0 时代的“关键词文本匹配”，到 2.0 时代的“行为统计与个性化搜索”，再到&nbsp;3.0&nbsp;时代向“复杂意图理解与认知决策”的全面进化。</p>
<p>美团搜索团队正依托团垂融合新架构与生成式大模型新技术，全面重构本地生活搜索底座。本系列技术博客将持续介绍美团搜索 3.0&nbsp;的技术探索，本文聚焦 LLM 语义表征在服务零售排序场景上的三期实践——从单点特征验证到系统性表征体系构建，再到跨场景迁移复用，探索语义匹配信号在搜索排序中的应用路径。</p>
</blockquote>
<h2>一、背景与动机</h2>
<p>服务零售是将服务销售给最终消费者的商业活动，与之对应的概念为商品零售。服务零售和商品零售是美团零售业务的两个主要组成部分。</p>
<p>在美团搜索场景下，相较于到家和其他到店业务，服务零售具有以下显著特点：</p>
<ul>
<li><strong>品类丰富</strong>：覆盖丽人、休闲娱乐、家政、进场零售等众多细分行业。</li>
<li><strong>搜索需求类型丰富</strong>：交易型、信息型、留资型并存。</li>
<li><strong>供给非标准化程度高</strong>：交易内容的多维组合性（e.g. 券、时间、位次、场次、空间、技师等）以及基于"人"和"场所"进行履约，共同促使供给的个性化和非标准化。</li>
</ul>
<p>传统精排模型的语义建模高度依赖文本匹配，但这类特征构建成本高、泛化能力弱，在面对服务零售大量长尾品类、复杂 Query 意图时尤为明显。例如，"宠物 SPA+洗澡"这个 Query 对应的商品名称可能是"萌宠清洁护理套餐"、"春节大扫除"这个 Query 对应的商品名称可能是"深度保洁服务套餐"，在这些 Case 中，搜索词和供给在文字上几乎没有重叠，但语义上是高度相关的。</p>
<p>这类语义 Gap 在美团服务零售搜索场景（生活服务、休闲娱乐等）尤为突出。服务零售的品类长尾分散、商品描述非结构化、Query 意图复杂多样，传统特征工程难以覆盖。而大语言模型（LLM）在语义理解方面的能力成熟度正在快速提升，给我们带来了新的解题思路。</p>
<p>从 2025 年 Q4 到 2026 年 Q2，服务零售搜索排序团队系统性地探索了 LLM 在精排模型中的应用，核心方向是用 LLM 为搜索词（Query）、商家（POI）和商品（Deal）生成高质量的语义向量表征，将语义匹配信息以 cosine 相似度的形式注入排序模型，弥补传统特征在语义理解上的不足。经过三期迭代，累计完成 3 个 Launch Review（LR），均已完成全量上线，带来了显著的线上收益。</p>
<p>下图展示了三期技术演进的整体脉络。每一期都在前一期的基础上进行系统性升级，从验证可行性到全面优化再到跨模块迁移复用，逐步构建起一套完整的语义表征体系。</p>
<p><img src="https://p1.meituan.net/meituantechblog/8f6d0d2a1b53e0fbe26ec7f5426bd45a302269.png" alt="图1 三期技术演进整体脉络：从特征验证到体系重构再到跨场景迁移"></p>
<h2>二、一期：精排引入大模型语义表征（验证可行性）</h2>
<h3>2.1 核心思路</h3>
<p>服务零售精排在语义层面的建模几乎为零，排序模型主要依赖少量文本匹配和 Query 统计类特征。所以一期的目标很纯粹：<strong>验证 LLM 表征能否对精排模型有实质性帮助</strong>。如果用 LLM 生成的语义向量能带来正向收益，就值得投入更多资源深度优化。整个一期的设计都围绕「先把路走通」。</p>
<p><strong>整体思路是</strong>：选择一个轻量级的 LLM 作为基座，对 Query 和 POI 的信息进行统一建模，通过微调，使模型仅依赖文本语义来判断"这个搜索词和这个商家是否匹配"，然后全量推理出 Query 和 POI 各自的语义向量，计算它们的 cosine 相似度，作为特征注入精排模型。</p>
<h3>2.2 技术方案</h3>
<p><strong>模型设计：特殊 Token 与信息隔离</strong></p>
<p>一期选用小参数量的开源基座模型，采用全参数微调。</p>
<p>要提取语义表征，需要一个明确的"聚合点"——<strong>模型在哪个位置把输入文本的语义信息汇聚成一个向量</strong>。直接用序列末尾 Token 或整个 Token 序列 Mean Pooling 也可以，但缺少可学习性。一期的核心设计是在词表中新增三个特殊 Token——<code>&lt;|query|&gt;</code>、<code>&lt;|item|&gt;</code>、<code>&lt;|qi|&gt;</code>，作为专门的聚合锚点，在训练中与模型参数一起优化。特殊 Token 的嵌入采用平均初始化法，参考 vocab-expansion<sup>[1]</sup>。</p>
<p>输入 Prompt 的结构如下：</p>
<div class="language-text line-numbers-mode" data-highlighter="prismjs" data-ext="text"><pre><code><span class="line">prompt = """用户查询：{}&lt;|query|&gt;</span>
<span class="line"></span>
<span class="line">候选商铺信息如下：</span>
<span class="line">商铺名称：{}</span>
<span class="line">热销商品：{}</span>
<span class="line">所属品牌：{}</span>
<span class="line">商铺分类：{} - {} - {}</span>
<span class="line">用户评分：{}分</span>
<span class="line">平均价格：{}元</span>
<span class="line">所在商圈：{}&lt;|item|&gt;</span>
<span class="line"></span>
<span class="line">请判断该商铺是否匹配用户查询&lt;|qi|&gt;"""</span>
<span class="line"></span></code></pre>
<div class="line-numbers" aria-hidden="true" style="counter-reset:line-number 0"><div class="line-number"></div><div class="line-number"></div><div class="line-number"></div><div class="line-number"></div><div class="line-number"></div><div class="line-number"></div><div class="line-number"></div><div class="line-number"></div><div class="line-number"></div><div class="line-number"></div><div class="line-number"></div><div class="line-number"></div></div></div><p>设计三个而非一个 Token，是因为需要三种不同类型的表征：<code>&lt;|query|&gt;</code> 聚合 Query 侧语义，<code>&lt;|item|&gt;</code> 聚合 item 侧语义，<code>&lt;|qi|&gt;</code> 聚合双侧融合信息——前两者用于推理时独立提取各自的 Embedding 并计算 cosine 相似度，后者仅用于微调时的辅助 Loss。</p>
<p>三个特殊 Token 内嵌在同一条 Prompt 序列中，意味着训练时 Query 和 item 的文本信息是混在一条序列里的。如果不加干预，<code>&lt;|query|&gt;</code> 会自然"看到"后面的 item 文本，<code>&lt;|item|&gt;</code> 也会"看到"前面的 Query 文本。这本身对 <code>&lt;|qi|&gt;</code> 不是问题——它本来就要看两侧信息。但对 <code>&lt;|query|&gt;</code> 和 <code>&lt;|item|&gt;</code> 来说是个问题：推理时，Query 和 item 的 Embedding 是分别独立生成的，如果训练时 <code>&lt;|query|&gt;</code> "看到"了 item 信息，它学到的表征就会依赖 item 上下文，推理时只输入 Query 文本，产出的表征就失去了意义。</p>
<p>因此，通过 Attention Mask 对同一条输入序列进行三次独立 forward pass：提取 query 表征时，mask 将注意力范围限制在 Query 文本段，<code>&lt;|query|&gt;</code> 只能聚合查询信息；提取 item 表征时，mask 限制在 item 文本段，<code>&lt;|item|&gt;</code> 只能聚合商家信息；提取融合表征时使用完整 mask，<code>&lt;|qi|&gt;</code> 可以 attend 到整条序列。这样确保了 Query 和 item 各自的表征是自包含的，可以独立提取和存储。</p>
<p>表征提取方式是取 transformer 最后一层在特殊 Token 位置的 hidden state，经两层 MLP（hidden_size → 512 → ReLU → LayerNorm → 64）降至 64 维，作为最终的目标语义表征。</p>
<p><strong>训练数据与目标</strong></p>
<p>从服务零售垂直搜索链路的精排日志中抽取近 2 个月、共 3,000 余万条训练样本，其中下单:点击未下单:未点击 = 1:3:6。训练目标包含两个 Loss 协同优化：</p>
<ul>
<li>Loss_1 基于<code>&lt;|query|&gt;</code> 和 <code>&lt;|item|&gt;</code> 单侧表征的 cosine 相似度，经可学习温度参数缩放后做二分类交叉熵，让模型从语义层面学习匹配程度；</li>
</ul>
<p><img src="https://p1.meituan.net/meituantechblog/30a37438634b8c492274d54792e5700b194829.png" alt="Loss_1 计算公式"></p>
<p>Loss_2 基于 <code>&lt;|qi|&gt;</code> 融合 query 和 item 的双侧信息，经 MLP 后预测点击率，目的是让学到的语义表征对齐下游排序目标。</p>
<p><img src="https://p1.meituan.net/meituantechblog/3d3682e4e575ad0a8c2a6b08af9aa3e4118087.png" alt="Loss_2 计算公式"></p>
<p>最终 Loss：L = Loss_1 + Loss_2。</p>
<p>双 Loss 设计的目的是让模型同时学习"单侧表征的质量"和"双侧匹配的判断"——前者直接服务于推理时的 cosine 相似度计算，后者辅助表征对齐下游点击率预估目标。</p>
<p><strong>从模型到特征：推理、分桶与注入</strong></p>
<p>推理时分别独立生成 Query 和 item 的语义 Embedding，离线存储至 Hive 表，按天例行增量更新。</p>
<p><strong>模型推理</strong></p>
<p><img src="https://p0.meituan.net/meituantechblog/54a8ef38444aa3647a4e67cf245733fa292609.png" alt="图2 一期表征生产流程"></p>
<p><strong>精排模型集成</strong></p>
<p><img src="https://p0.meituan.net/meituantechblog/808f7fe7543b764343919d7411b10c48256210.png" alt="图3 一期精排集成方式"></p>
<p>模型获得语义 Embedding 后，计算 Query 与 item 的 cosine 相似度，并按预设的分桶边界将相似度划分进 10 个分桶。分桶边界为[-0.40, -0.30, -0.18, -0.12, 0.00, 0.10, 0.16, 0.22, 0.30]，设计时考虑了每个桶内的样本量分布，并尽可能区分下单与未下单、点击与未点击等行为标签。</p>
<p>通过抽取 2 万条搜索曝光样本，我们验证了不同类型样本在各分桶中的分布。如下图所示，Query 和 item 语义越相似，点击/下单的样本占比越高：</p>
<p><img src="https://p0.meituan.net/meituantechblog/862772f1ba540efafc3970041a520362408086.png" alt="图4 不同行为标签在各 cosine 相似度分桶中的分布（2 万条搜索曝光样本）"></p>
<p>这意味着我们可以将 Query 和 item 的语义表征相似度作为一个强特征引入排序模型，以提升模型在点击/下单率预估方面的表现。</p>
<p>为了实现这一目标，我们为每个分桶分配一个可学习的 Embedding 向量（12 维），拼接到精排模型现有特征中。使用分桶而非直接使用连续相似度值的原因是：离散化后的特征能更好地被精排模型的特征交叉网络利用，同时降低噪声敏感度。使用可学习的 Embedding 向量则是为了增强模型对于不同相似度区间的表达能力。</p>
<p>离线验证显示，引入表征特征后点击 NDCG +9bp，下单 NDCG +13bp，验证了方案的有效性。</p>
<h3>2.3 线上效果</h3>
<p>实验周期 2025 年 9 月 18 日至 10 月 1 日，20%流量 14 天，AA 校验通过。</p>
<p>大盘搜索支付订单显著+0.20%，服务零售订单显著+0.27%。更值得关注的是体验指标的表现：长尾 NDCG@5 显著+2.21pp，长尾 BadCase@1 显著-2.96pp。语义理解提升在长尾场景体感最明显——这正符合预期，因为长尾 Query 恰恰是传统词面匹配最薄弱的地方。</p>
<p>一个只有 64 维的语义表征，仅通过分桶拼接的方式注入精排，就带来了显著的订单增量——这个结果直接证明了 LLM 语义表征在精排场景的价值，坚定了后续深度投入的信心。</p>
<h3>2.4 一期的局限性</h3>
<p>一期验证了 LLM 表征在精排中的可行性，但也暴露了四个明显短板。一是只覆盖 Query-商家两端，商品侧语义完全缺失——而在服务零售场景中，用户很多时候是在搜商品而非搜商家。二是全参数微调训练成本高、维护困难，不利于快速迭代。三是微调目标以点击率预估为主，对排序优化不够全面——下游精排同时也关注成单目标。四是三次 Forward Pass 的推理效率有优化空间，表征提取方式还有更高效的替代。这些问题成为二期系统性升级的起点。</p>
<h2>三、二期：商家精排表征系统性升级</h2>
<h3>3.1 核心动机</h3>
<p>一期验证了 LLM 表征在精排中的可行性，但四个短板制约了进一步迭代：仅覆盖 Query-商家两端，缺失商品语义、全参数微调成本高、点击率分类目标对排序不够全面、三次 Forward Pass 效率低。二期的目标不是单点优化，而是系统性重构表征生产的全流程——从训练数据、基座模型、微调方式、表征提取、降维方式到损失函数，逐一对应一期的短板进行升级，同时将下挂商品（Deal）纳入建模，构建 Query-POI-Deal 三元语义表征体系。</p>
<p>贯穿二期的核心矛盾是：一期的训练目标是"判断 Query 和商家是否匹配"的二分类问题，但排序模型真正需要的是"在多个候选中哪个更匹配"的相对序关系。这个矛盾直接驱动了从点击率分类到对比学习的损失函数重设计，也间接影响了训练数据构建（需要难负样本）、表征提取方式（需要更高效的聚合）等其他模块的决策。</p>
<h3>3.2 技术方案</h3>
<p><img src="https://p0.meituan.net/meituantechblog/7f74aaad59c23e8d5695c81d271b5c24233193.png" alt="图5 二期技术方案全景"></p>
<p><strong>训练数据：从单条样本到五元组</strong></p>
<p>一期每条样本只有 Query 和 POI 两部分，用于对齐下游目标的训练信号是"是否点击"。二期将每条样本扩展为五元组：Query、Deal 正样本、POI 正样本、Deal 难负样本、POI 难负样本。难负样本的选取是关键——Deal 难负样本来自同一请求、同一商家下曝光但未点击的商品，POI 难负样本来自同一请求下曝光但未点击的商家。这种"同请求"的难负采样策略确保了负样本与正样本在 Query 意图和上下文上高度相似，只在"是否被用户选择"上有差异，能迫使模型学到更精细的判别能力。最终我们构建了 2766 万条训练样本。</p>
<p><strong>Prompt 设计：反直觉的发现</strong></p>
<p>确定了"喂什么数据"后，下一步是"怎么组织成文本"。我们尝试了多种 Prompt 方案：精简信息陈述+总结引导、简单任务指令、丰富版任务指令、仅信息陈述。实验发现一个反直觉的结论：精简信息陈述+总结引导效果最好，过于复杂的任务指令反而降低表征质量。</p>
<p><img src="https://p0.meituan.net/meituantechblog/8c5c6d453c7d84ef8a0a2621e9a23bb1285747.png" alt="不同 Prompt 设计的离线评估结果"></p>
<p>这与常见的 LLM 问答任务的直觉相反。我们推测原因是：在 Embedding 训练场景中，Prompt 的作用是引导模型理解"要聚合哪些语义信息"，而非传统的"指令遵循"。过于复杂的指令会干扰模型对核心语义信息的聚合，就像给一个本该专注于理解文本的人过多任务要求，反而分散了注意力。这一结论对后续其他表征场景有直接参考价值。</p>
<p>具体的 Prompt 如下：</p>
<ul>
<li><strong>商家</strong>："商铺信息如下：商铺名称为{}，热销商品为{}，品牌名为{}，主营类目的三级标签分别是{}、{}、{}，次营类目为{}，所属商圈为{}。请根据以上信息，详细描述该商铺："</li>
<li><strong>下挂商品</strong>："商品信息如下：商品名称为{}，商品类目的三级标签分别是{}、{}、{}，所属商家名称为{}。请根据以上信息，详细描述该商品："</li>
<li><strong>搜索词</strong>："查询信息如下：用户查询词为{}。请根据该查询词，总结用户的查询意图："</li>
</ul>
<p>二期在商家的 Prompt 中也新增了"次级经营品类"、"热销商品"等信息，以期望学到更完整的商家语义表征。</p>
<p>一个值得注意的实验发现是：我们尝试在商品特征中引入 CPV（商品属性）信息后，排序评估效果反而下降：</p>
<p><img src="https://p0.meituan.net/meituantechblog/45e3f7771cb8c09245696323afa6a83f125189.png" alt="商品引入 CPV 离线评估结果"></p>
<p>我们推测原因是当前 CPV 信息过于繁杂，未经筛选地引入反而会带来噪声。这个反直觉的结果说明，<strong>在表征训练中，信息质量比信息量更重要</strong>。</p>
<p><strong>基座模型与微调方式：从全参到 LoRA</strong></p>
<p>基座模型选择上，我们横向对比了参数量在 0.5B～8B 的多个模型，涵盖通用、Embedding、Instruct 等多个系列。</p>
<p>实验发现，中等参数档位是效果与推理成本的最优平衡点——更大的模型在 NDCG 指标上提升有限且推理成本显著上升；最小参数档位则在各项指标上全面落后。最终选定专门为文本表征任务优化的 Embedding 模型变体，它在 Click-AUC 和 NDCG 上均优于同参数量的通用模型。</p>
<p>微调方式从全参数微调切换到 LoRA<sup>[3]</sup>（r=8、α=32，目标模块 q_proj 和 v_proj）。对比实验显示一个有趣的现象：LoRA 在 NDCG 指标上优于全参数微调，但全参在 AUC 上略有优势。这一现象仅在本场景中观察到，是否具有普适性有待验证。综合考虑训练效率和维护成本最终选择 LoRA。</p>
<p><strong>表征提取：从三 Token 单序列到独立序列+可学习向量</strong></p>
<p>一期在同一条序列中内嵌三个词表 Token，通过三次 Forward Pass 和不同 AttentiOn Mask 实现信息隔离，推理效率低。二期彻底重构了表征提取方式：不再将 Query 和 item 放在同一条序列中，而是各自在独立的序列中处理；特殊 Token 不再是 vocabulary token，而是 nn.Parameter——一个维度为 hidden_size 的可学习向量。具体做法是：对输入文本做 tokenize 后取 input embeddings，找到序列中最后一个有效位置，将该位置的 Embedding 覆写为对应的可学习向量，经过 Transformer 后取该位置的 hidden state 作为表征。Query、POI、Deal 各有独立的可学习向量。</p>
<p>这种设计相比一期有几方面优势：不再需要 Attention Mask 隔离（因为各实体本就在独立序列中处理），一次 Forward 可以同时处理五路输入（五元组的各部分拼接在 batch 维度上），推理效率大幅提升。同时，可学习向量直接作为"聚合锚点"放在序列末尾，模型在训练中学会在该位置汇聚全序列的语义信息。</p>
<p>对比实验显示，Last Special Token Embedding 优于 Mean Pooling 和直接取最后一个有效 Token，推测原因是可学习的特殊 Token 比固定位置或平均池化更能有效聚合序列信息并区分不同实体类型。</p>
<p><strong>降维方式：从 Linear 到 MRL-E</strong></p>
<p>一期用两层 MLP 将 hidden state 降至 64 维。二期改用 MRL-E<sup>[4]</sup>（Matryoshka Representation Learning）策略：设置嵌套维度列表[1024, 512, 256, 128]，训练时对每个维度分别计算损失并取平均，推理时直接截取前 128 维。</p>
<p>MRL-E 相比 Linear 降维的核心优势不在于精度提升（离线指标差异不大），而在于灵活性：同一套训练出的表征可以根据不同场景的效率需求选择不同维度，无需重新训练。这在后续三期将表征迁移到下挂精排时体现了价值——不同模块对 Embedding 维度的要求可能不同，MRL-E 提供了开箱即用的多尺度选择。因此我们选择 MRL-E 作为最终降维方案。</p>
<p><strong>损失函数：从分类到对比学习</strong></p>
<p>这是二期最核心的升级，也是"从分类到排序"这一核心矛盾的直接解法。</p>
<p>一期用 BCE Loss 做点击率二分类，模型只学到"是否匹配"的绝对判断。但排序模型需要的是相对序——在多个候选中哪个更匹配。InfoNCE Loss<sup>[5]</sup>天然面向这个目标：它利用 Batch 内负样本构建对比任务，最大化正样本对相似度的同时最小化与 batch 内其他样本的相似度，本质上是在做"从 N 个候选中选出正确匹配"的排序训练。</p>
<p>我们具体设计了三组 InfoNCE Loss：Query↔POI、Query↔Deal、POI↔Deal。三组对比覆盖了三元实体间所有两两关系，使表征空间同时编码 Query-商家匹配度、Query-商品匹配度和商家-商品一致性。采用归一化嵌入后的内积作为相似度度量，温度参数可学习：</p>
<p><img src="https://p0.meituan.net/meituantechblog/8a2de7b2d5b6107c4e040b12231587a7183476.png" alt=""></p>
<p><img src="https://p0.meituan.net/meituantechblog/c2e3f0a27004686f210f0936065ae38b73452.png" alt="InfoNCE Loss"></p>
<p>但如果 InfoNCE 的负样本仅来自 Batch 内随机采样，难度不够——大部分 Batch 内负样本与 Query 的语义差距很明显，模型不费力就能区分。为此我们引入 Triplet Loss 专门处理构建出的难负样本：采用欧氏距离，margin=0.5，分别计算 Query-POI 和 Query-Deal 的 Triplet Loss。难负样本是"同请求同商家曝光未点击"的样本，与正样本在 Query 意图和上下文上高度相似，只在用户选择上有差异——这才是模型真正需要学会区分的。</p>
<p><img src="https://p0.meituan.net/meituantechblog/931c552be27caf71e72cf5757cc4bf07162806.png" alt="Triplet Loss"></p>
<p>消融实验验证了这一设计：引入 Triplet Loss 后，Q2I-Click-AUC<sup>[7]</sup> +4.85pp，Q2I-Order-AUC +11.02pp。Order-AUC 的提升幅度远高于 Click-AUC，说明难负样本建模对排序下单信号的捕获比点击信号更难、但更有价值——这也印证了"从分类到排序"的转型方向是正确的。</p>
<p><img src="https://p0.meituan.net/meituantechblog/657befe9fb20497fddded702c4db05ed114157.png" alt=""></p>
<p>最终的训练目标为上述五个损失的加权和：</p>
<p v-pre="" class="katex-block"><span class="katex-display"><span class="katex"><span class="katex-mathml"><math xmlns="http://www.w3.org/1998/Math/MathML" display="block"><semantics><mrow><msub><mi mathvariant="script">L</mi><mtext>total</mtext></msub><mo>=</mo><msubsup><mi mathvariant="script">L</mi><mtext>InfoNCE</mtext><mrow><mi>Q</mi><mo>→</mo><mi>P</mi></mrow></msubsup><mo>+</mo><msubsup><mi mathvariant="script">L</mi><mtext>InfoNCE</mtext><mrow><mi>Q</mi><mo>→</mo><mi>D</mi></mrow></msubsup><mo>+</mo><msubsup><mi mathvariant="script">L</mi><mtext>InfoNCE</mtext><mrow><mi>P</mi><mo>→</mo><mi>D</mi></mrow></msubsup><mo>+</mo><msub><mi>λ</mi><mn>1</mn></msub><msubsup><mi mathvariant="script">L</mi><mtext>Triplet</mtext><mrow><mi>Q</mi><mo separator="true">,</mo><mi>P</mi></mrow></msubsup><mo>+</mo><msub><mi>λ</mi><mn>2</mn></msub><msubsup><mi mathvariant="script">L</mi><mtext>Triplet</mtext><mrow><mi>Q</mi><mo separator="true">,</mo><mi>D</mi></mrow></msubsup></mrow><annotation encoding="application/x-tex">\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{InfoNCE}}^{Q \rightarrow P} + \mathcal{L}_{\text{InfoNCE}}^{Q \rightarrow D} +
\mathcal{L}_{\text{InfoNCE}}^{P \rightarrow D} + \lambda_1 \mathcal{L}_{\text{Triplet}}^{Q, P} + \lambda_2
\mathcal{L}_{\text{Triplet}}^{Q, D}
</annotation></semantics></math></span><span class="katex-html" aria-hidden="true"><span class="base"><span class="strut" style="height:0.8333em;vertical-align:-0.15em;"></span><span class="mord"><span class="mord mathcal">L</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.3361em;"><span style="top:-2.55em;margin-left:0em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord text mtight"><span class="mord mtight">total</span></span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.15em;"><span></span></span></span></span></span></span><span class="mspace" style="margin-right:0.2778em;"></span><span class="mrel">=</span><span class="mspace" style="margin-right:0.2778em;"></span></span><span class="base"><span class="strut" style="height:1.2605em;vertical-align:-0.3013em;"></span><span class="mord"><span class="mord mathcal">L</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.9592em;"><span style="top:-2.3987em;margin-left:0em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord text mtight"><span class="mord mtight">InfoNCE</span></span></span></span></span><span style="top:-3.1809em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight">Q</span><span class="mrel mtight">→</span><span class="mord mathnormal mtight" style="margin-right:0.1389em;">P</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.3013em;"><span></span></span></span></span></span></span><span class="mspace" style="margin-right:0.2222em;"></span><span class="mbin">+</span><span class="mspace" style="margin-right:0.2222em;"></span></span><span class="base"><span class="strut" style="height:1.2605em;vertical-align:-0.3013em;"></span><span class="mord"><span class="mord mathcal">L</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.9592em;"><span style="top:-2.3987em;margin-left:0em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord text mtight"><span class="mord mtight">InfoNCE</span></span></span></span></span><span style="top:-3.1809em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight">Q</span><span class="mrel mtight">→</span><span class="mord mathnormal mtight" style="margin-right:0.0278em;">D</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.3013em;"><span></span></span></span></span></span></span><span class="mspace" style="margin-right:0.2222em;"></span><span class="mbin">+</span><span class="mspace" style="margin-right:0.2222em;"></span></span><span class="base"><span class="strut" style="height:1.1383em;vertical-align:-0.247em;"></span><span class="mord"><span class="mord mathcal">L</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.8913em;"><span style="top:-2.453em;margin-left:0em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord text mtight"><span class="mord mtight">InfoNCE</span></span></span></span></span><span style="top:-3.113em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight" style="margin-right:0.1389em;">P</span><span class="mrel mtight">→</span><span class="mord mathnormal mtight" style="margin-right:0.0278em;">D</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.247em;"><span></span></span></span></span></span></span><span class="mspace" style="margin-right:0.2222em;"></span><span class="mbin">+</span><span class="mspace" style="margin-right:0.2222em;"></span></span><span class="base"><span class="strut" style="height:1.3967em;vertical-align:-0.4374em;"></span><span class="mord"><span class="mord mathnormal">λ</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.3011em;"><span style="top:-2.55em;margin-left:0em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight">1</span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.15em;"><span></span></span></span></span></span></span><span class="mord"><span class="mord mathcal">L</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.9592em;"><span style="top:-2.3987em;margin-left:0em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord text mtight"><span class="mord mtight">Triplet</span></span></span></span></span><span style="top:-3.1809em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight">Q</span><span class="mpunct mtight">,</span><span class="mord mathnormal mtight" style="margin-right:0.1389em;">P</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.4374em;"><span></span></span></span></span></span></span><span class="mspace" style="margin-right:0.2222em;"></span><span class="mbin">+</span><span class="mspace" style="margin-right:0.2222em;"></span></span><span class="base"><span class="strut" style="height:1.3967em;vertical-align:-0.4374em;"></span><span class="mord"><span class="mord mathnormal">λ</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.3011em;"><span style="top:-2.55em;margin-left:0em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight">2</span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.15em;"><span></span></span></span></span></span></span><span class="mord"><span class="mord mathcal">L</span><span class="msupsub"><span class="vlist-t vlist-t2"><span class="vlist-r"><span class="vlist" style="height:0.9592em;"><span style="top:-2.3987em;margin-left:0em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord text mtight"><span class="mord mtight">Triplet</span></span></span></span></span><span style="top:-3.1809em;margin-right:0.05em;"><span class="pstrut" style="height:2.7em;"></span><span class="sizing reset-size6 size3 mtight"><span class="mord mtight"><span class="mord mathnormal mtight">Q</span><span class="mpunct mtight">,</span><span class="mord mathnormal mtight" style="margin-right:0.0278em;">D</span></span></span></span></span><span class="vlist-s">​</span></span><span class="vlist-r"><span class="vlist" style="height:0.4374em;"><span></span></span></span></span></span></span></span></span></span></span></p>
<p><img src="https://p1.meituan.net/meituantechblog/74f9d90a82d9fed35d85739c63430248171314.png" alt="图6 二期训练目标与损失函数概览"></p>
<p>二期相比一期在多项关键指标上取得了显著提升：Q2I-Click-AUC 提升 6.25pp、Q2I-Order-AUC 提升 5.37pp、Q2I-Click-NDCG 提升 1.77pp、Q2I-Order-NDCG 提升 2.03pp。</p>
<h3>3.3 表征应用方式</h3>
<p><strong>相似度分桶策略升级</strong></p>
<p>沿用一期的相似度分桶机制，但进行了两项升级。一是从单组相似度扩展到双组——同时计算 Query-POI 和 Query-Deal 的 cosine 相似度，各自分桶，使模型能分别利用 Query-商家和 Query-商品的语义匹配信号。二是引入零向量边界，用于捕获无表征样本（缺失表征置为零向量，并在特征计算中进入专门的缺失值分桶），确保未覆盖样本落入同一桶中，避免无表征样本的噪声干扰。</p>
<p><strong>底层+顶层双重融合</strong></p>
<p>表征信息通过底层和顶层两种方式融入精排模型。底层融合将分桶 Embedding 与精排模型现有特征拼接，参与特征交叉学习；顶层融合将原始 cosine 相似度直接在顶层拼接，经一层 LHUC 后用于 CTR 和 CTCVR 预测。</p>
<p>为什么要同时做底层和顶层？底层融合让语义特征参与特征交叉，能与其他特征产生交互效应，但经过分桶离散化后丢失了相似度的连续信息。顶层融合直接使用原始 cosine 相似度，保留了连续语义信号，但无法参与特征交叉。两者互补——加入顶层融合后点击 NDCG +5bp，下单 NDCG +3bp。</p>
<p><strong>加载方式优化</strong></p>
<p>一期采用 HashTable 热启方式加载表征，但二期引入 Deal 表征且维度从 64 维扩展至 128 维后，若沿用热启方式，模型体积将成倍增长，带来明显的存储和部署压力。为此，在工程实现上，二期优化为"离线训练样本化+线上 KV 读取"方案：离线训练时表征以样本特征形式引入，随样本一同加载；线上服务时从 KV 存储实时读取表征向量。优化后模型体积不增反降，相比一期基线还略有缩减，在牺牲部分应用灵活性的前提下解决了存储和部署压力。</p>
<h3>3.4 线上效果</h3>
<p>实验周期 2026 年 3 月 17 日至 3 月 23 日，20%流量 7 天，AA 校验通过。</p>
<p>搜索大盘搜索 UV 显著+0.07%，有效点击 QV 显著+0.13%，服务零售结果页有效 QV_CTR 显著+0.10pp（+0.15%）。性能上 TP90 仅+0.2ms。</p>
<p>线上数据中出现了一个值得分析的现象：服务零售搜索 QV 略有下降（-0.05%，不显著），但有效点击 QV 正向（+0.09%，不显著），结果页 QV_CTR 显著正向。下钻分析发现，QV 下降主要集中在美团某事业部（-0.70%，显著），但该事业部的 QV_CTR 反而提升了0.24pp（显著）。原因是实验组优化了排序结果，减少了无效曝光——部分此前会被曝光但不会被点击的结果被更相关的结果替代，虽然总曝光量下降，但转化效率提升。线上排序指标印证了这一判断：实验组点击 NDCG@30 +6bp，点击 GAUC +13bp。</p>
<p>这个现象说明，语义表征的引入不仅是"增加曝光机会"，更重要的是"优化曝光质量"——<strong>让更匹配的商品和商家排在前面，即使用户看到的选项变少了，转化效率反而更高</strong>。</p>
<h2>四、三期：下挂精排引入表征 + 全域交叉统计特征</h2>
<h3>4.1 核心动机</h3>
<p>商家精排两期的表征体系已成熟，但下挂精排——对商家下挂的具体商品进行排序——在语义维度的建模几乎为零。三期的核心逻辑是：<strong>复用二期已训练的表征模型，将成熟方案平移到下挂精排</strong>。这看起来是最自然的延伸，但实际执行中遇到了意料之外的挑战。</p>
<p>与表征迁移同步进行的，还有一项系统性特征治理工作。团队对下挂精排特征进行了全面梳理，发现部分特征已失效，同时在"个性化×商品"和"Query 意图×商品"两个交叉维度上存在建模空白。因此三期是"大模型表征迁移"和"全域交叉统计特征补充"两条线并行推进，最终以叠加效果上线。</p>
<h3>4.2 技术方案</h3>
<p><strong>扩大覆盖率：迁移的第一道关卡</strong></p>
<p>表征模型直接复用二期，但表征的"覆盖范围"不能直接复用。二期的 Query Embedding 是基于商家精排样本圈选的——即只对商家精排中出现的 Query 生成 Embedding。直接迁移到下挂精排时，Query 覆盖率仅 81.24%，双覆盖率（Query+Deal 同时有 Embedding）更只有 73.61%。</p>
<p>原因在于两个场景的 Query 分布有本质差异。商家精排的 Query 偏向商家意图词（如"SPA"），而下挂精排的 Query 更多是商品意图词（如"双人 XX 套餐"）——用户在商家列表页搜索的是"找什么样的店"，进入下挂排序时搜索的是"买什么样的商品"。这些商品意图词在商户样本中可能从未出现，自然没有对应的 Embedding。</p>
<p>解决方案是重新用下挂精排的样本分布圈选 Query Embedding 的生成范围。修复后 Query 覆盖率升至 98.92%，双覆盖率达 89.81%。</p>
<p>这个工程细节看起来不起眼，但它直接决定了特征有效性。修复前的 73.61% 双覆盖率意味着超过四分之一的样本拿不到语义匹配信号——如果带着这个缺口上线，特征的价值会被严重稀释。这一经验也成为了跨模块复用表征的标准 checklist：表征模型的迁移不是直接复用模型参数，必须针对目标场景的样本分布重新圈选 Embedding 覆盖范围。</p>
<p><strong>特征有效性前置验证</strong></p>
<p>补充完 Embedding 后，团队先做了一项前置验证：将 Query 和 Deal 的 Embedding cosine 特征等距分为 100 个桶，分别计算每个桶内各 label（成单、货架成单、点击、全域成单）的平均值。结果显示随着 cosine 分数单调上升，所有 label 均值也单调上升，方向明确。这个验证虽然简单，但它回答了一个关键问题：迁移过来的表征在下挂场景是否依然有效？答案是肯定的——Query-Deal 的语义匹配度与用户行为之间存在清晰的正相关。</p>
<p><strong>分桶策略：一种特征，五个视角</strong></p>
<p>cosine 相似度与 label 虽然正相关，但并非严格线性。为了让特征分桶与各 label 呈现更强的正相关性，团队设计了 5 种分桶策略：等样本量分桶（V1，每个桶内样本数相等）、按下挂成单 label 均值等差分桶（V2）、按货架成单 label 均值等差分桶（V3）、以及在下挂曝光样本和货架曝光样本上分别按对应 label 等差分桶（V4、V5）。</p>
<p>为什么要设计 5 种而不是选 1 种？因为下挂精排同时优化多个目标（点击、下挂成单、货架成单），不同目标与 cosine 分数的关系曲线不同。等样本量分桶对综合目标最优，而按特定 label 等差分桶则在该 label 的方向上更敏感。Droprank 特征重要性分析也印证了这一点：V1（等样本量分桶）综合重要性最高（排名第21），但 V2、V3、V4 也分别排在第40、164、129 位——它们从不同方向对模型有独立贡献。</p>
<p><img src="https://p1.meituan.net/meituantechblog/1ae97fc048ca188616340c5ca0243207403904.png" alt="图7 不同分桶策略下 label 均值与 cosine 相似度的对应关系"></p>
<p><strong>应用方式：从底层拼接到 PEPNet 门控</strong></p>
<p>三期在表征与模型的耦合方式上做了系统探索。对比了 4 种方案：底层拼接交叉统计特征（+7bp）、底层拼接 LLM 相似度+交叉统计特征（+18bp）、LLM 相似度放在输出塔前（+8bp，且部分指标负向）、PEPNet 门控注入<sup>[8]</sup>（+25bp）。</p>
<p>为什么 PEPNet 门控效果最优？底层拼接让语义特征参与特征交叉，但经过分桶离散化后信号被压缩；输出塔前注入保留了连续相似度信号，但无法与模型其他特征交互。PEPNet 门控机制的优势在于：它将语义相似度作为"门控信号"调制模型其他特征的权重——高语义匹配时放大相关特征的贡献，低匹配时抑制。这种自适应调节比固定位置的拼接更灵活，离线 ctcvr_auc_global_poi +25bp，远高于底层拼接的 +18bp。</p>
<p><img src="https://p0.meituan.net/meituantechblog/3c72b236ab01692d9963e78853b285f9200117.png" alt="图8 三期表征注入方式对比：底层拼接、输出塔前注入、PEPNet 门控的离线效果"></p>
<p><strong>全域交叉统计特征：语义维度之外</strong></p>
<p>在大模型表征之外，三期还补充了四类全域交叉统计特征：user×deal id 体系交叉统计、POI 的 cate3 统计特征、user×POI 的 cate3 交叉统计、query×deal id 体系交叉统计。这四类特征弥补了下挂精排在"个性化×商品"和"Query 意图×商品"两个交叉维度上的建模空白。其中订单及转化相关特征因覆盖率极低（低于 0.1%），在消融实验中被移除——这也是一个值得注意的经验：统计特征的价值不仅取决于相关性，还取决于覆盖面，覆盖率太低的特征即使方向正确也难以产生实际收益。</p>
<h3>4.3 线上效果</h3>
<p>实验周期 2026 年 5 月 28 日至 6 月 3 日，10%流量 7 天，AA 校验通过。</p>
<p>服务零售业务订单显著 +0.32%，服务零售访购率显著 +0.29%，搜索大盘支付订单显著+0.35%，大盘访购率显著 +0.25%。</p>
<p>三期的 +0.32% 订单是大模型表征和全域交叉统计特征两类特征叠加的结果。两类特征在离线均单独验证正向，但叠加效应比预期更强。这说明语义维度（LLM 表征）和统计维度（交叉特征）在捕获用户偏好上存在互补性——语义特征捕捉的是" Query 和商品在语义上是否匹配"，统计特征捕捉的是"具有某种行为的用户是否偏好这类商品"，两者从不同角度刻画了用户-商品的匹配关系，叠加后形成了更完整的判断。</p>
<h2>五、核心洞察与经验沉淀</h2>
<p>三期迭代的技术细节已在前文展开，这里不再复述，而是聚焦于几条跨阶段的、对后续工作有直接指导意义的判断。</p>
<p>1、中等参数量是当前阶段的最优平衡点，但不一定是终局。 在 0.5B～8B 的参数量区间内，中等档位模型在效果与推理成本上取得了最优平衡。专门为表征任务优化的 Embedding 变体优于同参数量的通用模型。但这个结论有阶段局限性：随着推理优化技术（量化、蒸馏、推测解码）的成熟，更大模型的推理成本会持续下降，最优平衡点也会上移。因此更本质的认知是——表征模型的选型不应追求"最大可用"，而应在当前推理预算下选择效果最优的，并定期重新评估。</p>
<p>2、 难负样本是提升表征判别能力的关键。一期使用点击率分类目标，模型只学到"是否匹配"的绝对判断，表征的判别能力有限。二期引入"同请求同商家曝光未点击"的难负样本，配合 InfoNCE + Triplet 对比学习框架后，离线指标大幅提升。难负样本的核心价值在于：它迫使模型学习"在高度相似的候选中，用户为什么选了这个而非那个"——这种精细判别能力是单纯靠正样本和随机负样本无法获得的。在构建表征训练数据时，难负样本的质量直接决定了表征质量的上限。</p>
<p>3、 Embedding 场景的 Prompt，做减法比做加法有效。 在传统 LLM 任务中，更详细的指令通常带来更好的效果。但在 Embedding 训练场景，精简信息陈述+总结引导优于复杂的任务指令和推理链。原因是 Embedding 的 Prompt 作用是"引导模型聚合哪些语义信息"，而非"指导模型完成什么任务"——过多的任务指令会干扰模型对核心语义的聚焦。这一结论与传统 LLM 任务的直觉相反，对后续其他表征场景有直接参考价值：写 Embedding 的 Prompt 时，问自己"模型需要从这段文字中聚合什么信息"，而不是"模型需要完成什么任务"。</p>
<p>4、 表征迁移的核心风险不在模型，而在覆盖率。 三期最大的工程挑战不是模型适配，而是 Query 覆盖率从 81.24% 到 98.92% 的修复。表征模型的参数可以直接复用，但 Embedding 的覆盖范围必须针对目标场景重新圈选——否则覆盖率缺口会直接压低特征有效性。这条经验看似简单，但容易被忽略，因为"复用模型"天然暗示着"可以直接上线"。后续任何跨模块迁移表征的工作，都应将覆盖率验证作为第一步 Checklist。</p>
<p>5、语义特征和统计特征是互补的，不是替代的。 三期的 +0.32% 订单是两类特征叠加的结果，且叠加效应比预期更强。语义特征从"Query 和商品在语义上是否匹配"的角度刻画用户-商品关系，统计特征从"具有某种行为的用户是否偏好这类商品"的角度刻画——前者是内容理解，后者是行为模式。两者各自有盲区，叠加后形成了更完整的判断。这意味着在特征体系设计中，不应将"大模型表征"和"传统统计特征"视为二选一的方向，而应将它们作为互补的信号源协同设计。</p>
<h2>六、业内工作对比与独立创新点</h2>
<p>本工作处于"LLM 文本表征"与"搜索排序特征工程"的交叉地带。为厘清本工作在技术版图中的位置，从三个维度梳理业内工作。</p>
<p><strong>维度一：文本表征模型（Producer）</strong></p>
<p>文本表征领域经历了从 Word2Vec 到 BERT 再到 LLM 的演进。以 E5<sup>[9]</sup>、BGE<sup>[10]</sup>（BAAI）、GTE<sup>[11]</sup>（阿里通义）系列为代表，训练范式以 in-batch negatives + InfoNCE 为标准配方。2025 年基于 LLM 的表征模型成为主流，代表工作有 Qwen3-Embedding（false-negative mask）、Conan-embedding<sup>[12]</sup>（动态硬负样本挖掘）、Llama-Embed-Nemotron<sup>[13]</sup>（纯难负样本 InfoNCE）。这些工作的共同关注点是负例质量——"embedding 质量的天花板在负例质量，不在 backbone"已成为业界共识。在降维策略上，MRL 提供了多尺度可截断方案；高效微调方面，LoRA 成为参数高效微调的事实标准。</p>
<p><strong>维度二：表征在排序中的应用（Consumer）</strong></p>
<p>在表征如何融入排序模型这一问题上，业内存在多条路线。TIGER<sup>[14]</sup>开创了生成式检索范式，将 Embedding 量化为分层 Semantic ID 用于序列召回，但未直接用于判别式排序。在判别式排序中，表征的注入方式正在从简单拼接向门控和自适应融合演进：UNGER<sup>[15]</sup>指出语义与协同 Embedding 直接拼接时语义信号会占据主导，需显式模态平衡。</p>
<p><strong>维度三：难负样本策略</strong></p>
<p>难负样本是表征质量的关键杠杆。ANCE<sup>[16]</sup>首次提出用异步 ANN 索引从全局语料库采样难负样本，解决了 in-batch negatives 信息量不足的问题。此后业界发展出多种策略：Meta 的 realtime hard neg 使用 LLM 聚类后的同簇 OOB 负样本配合 LogQ 校正；Apple Music 的 Elise 采用课程式调度——前期用 InfoNCE 构建全局结构，后期切换到最难 Hinge Loss 锐化边界；小红书的 Uninote 提出多粒度难负挖掘与 JS 散度软标签。这些策略的共性是：从随机负样本转向"够难但不是假负例"的精细构造。</p>
<p><strong>独立创新点</strong></p>
<p>将上述工作作为参照系，本工作在以下方面具有独立创新性：</p>
<p>1、<strong>面向搜索排序的语义相似度直接特征注入</strong>。业界表征工作以推荐场景为主，表征主要作为底层特征拼接（如 TIGER 的 SID embedding），与排序目标之间的映射是隐式的。本工作基于搜索场景特点，将 query 与供给的 cosine 语义相似度作为直接特征注入精排——分桶离散化参与特征交叉（底层融合），同时保留连续相似度在输出塔前直接参与预测（顶层融合）。这种做法相比推荐场景的底层拼接有两方面优势：一是语义相似度直接刻画"搜索词与供给是否匹配"，与搜索排序目标天然对齐，方案更具可解释性；二是底层 + 顶层的双重融合设计兼顾了特征交叉能力和信号保真度，比单一注入方式更充分地利用了语义信号。</p>
<p>2、<strong>基于"店+下挂商品"展示结构的难负样本构造</strong>。利用美团搜索"店+下挂商品"的两层展示结构，构造"同请求、同商家、曝光未点击"的下挂商品作为难负样本。这类样本与正样本在 query 意图和上下文上高度相似（同一搜索词、同一商家），仅在用户选择上有差异——迫使模型学习"在高度相似的候选中，用户为什么选了这个而非那个"。相比 ANCE 的全局 ANN 难负采样，本方案的难负样本天然绑定了搜索场景的上下文信息（同一请求、同一商家），难度更高且更贴近排序任务的真实分布。消融实验显示，引入此类难负样本后 Q2I-Order-AUC 提升11.02pp，远高于 Click-AUC 的4.85pp，验证了"从分类到排序"转型方向的有效性。</p>
<p>3、<strong>Query/POI/Deal 三元实体联合表征</strong>。业界文本表征工作以两元对（query-document 或 user-item）为标准建模单元。本工作面向服务零售"搜索词→商家→商品"的三元匹配结构，设计了三组 InfoNCE Loss（Query↔POI、Query↔Deal、POI↔Deal）覆盖三元实体间所有两两关系，使表征空间同时编码 Query-商家匹配度、Query-商品匹配度和商家-商品一致性。这种三元联合对比学习在公开文献中较少见，其设计动机直接来自业务场景——用户在服务零售搜索中既需要找到对的商家，也需要找到对的商品，二者构成层次化匹配关系。</p>
<h2>七、后续展望</h2>
<p>基于三期迭代积累的经验和前沿技术调研，后续有四个值得探索的方向。</p>
<p>1、<strong>负例质量提升</strong>：当前表征训练的最大洼地。 二期的负例策略是 in-batch 随机负样本+单显式难负样本，已有不错效果，但前沿实践表明这个方向还有很大空间。 Qwen3 Embedding 工作<sup>[17]</sup>提出了 false-negative mask——把疑似假负例从 InfoNCE 分母中剔除，是零结构改动的即插项；KALM v2<sup>[18]</sup>的 focal-style 难度重加权让训练聚焦真难例；Nemotron 的相似度阈值筛选只保留"够难但不是假负例"的区间。这些方法的共同认知是：Embedding 质量的天花板在负例质量，不在 backbone。当前仅采用 in-batch 随机负样本 + 单个显式难负样本，负例构造仍是明显短板，优先补这一环的性价比最高。</p>
<p>2、<strong>MRL 低维档诊断与 SID 量化</strong>：从连续表征到离散语义 ID。 当前使用 MRL-E 的嵌套维度列表[1024, 512, 256, 128]，推理时截取前 128 维。前沿调研显示两个值得关注的点：一是 d&lt;128 的极低维档存在退化风险（多篇工作独立证实），需要对各截断层做 neighbor-overlap 诊断，若发现退化，则移除对应维度档位，避免多尺度联合 loss 被最差档拖累。</p>
<p>二是更激进的方向：将连续 Embedding 量化成分层离散语义 ID（Semantic ID）<sup>[19]</sup>。SID 把 embedding 压成"分层的离散码字序列"（如 3 层码本）<sup>[20]</sup>，既保留语义近邻结构，又能像 ID 一样查 Embedding 表、天然层级共享、对新品友好。SID 的潜在价值在于：它打通了语义表征和 ID 特征的壁垒，让大模型表征能以更原生的方式融入排序模型的特征交叉体系，而非仅通过 cosine 相似度分桶间接参与。</p>
<p>3、<strong>针对下挂场景重训表征模型</strong>。三期复用的是商家精排的表征模型，训练数据以商户样本为主。下挂样本在 Query 分布（更多商品意图词）和正负样本构成上与商户有显著差异，专项针对下挂场景训练一版表征模型，预期能进一步提升 Embedding 质量和覆盖率。同时，前面提到的负例质量提升和 MRL 诊断，可以一并在这版重训中落地。</p>
<p>4、<strong>Producer→Consumer 闭环：让排序信号回灌表征</strong>。当前的表征训练和下游排序是单向的——表征产出后通过 cosine 相似度喂给排序模型，但排序模型学到的场景感知相关性没有回流到表征训练。前沿工作 relevance_based_emb 提出了这条闭环的雏形：把下游排序的相关性判断作为蒸馏信号回灌到表征训练，让表征不仅语义准确，还对齐下游排序目标。这是 Producer（表征生产）与 Consumer（排序侧消费）协同的独有优势，有望进一步缩短离在线 Gap。</p>
<h2>八、总结</h2>
<p>本文介绍了服务零售搜索排序团队在 2025 年 Q4 至 2026 年 Q2 期间，将 LLM 语义表征引入精排模型的三期实践。一期验证了可行性——用 64 维 cosine 相似度特征就带来了显著订单增量；二期系统性重构了表征生产全流程——从分类目标转向对比学习，从全参数微调转向 LoRA，构建了 query-POI-deal 三元表征体系；三期将成熟表征迁移到下挂精排——在解决覆盖率问题后，通过 PEPNet 门控注入和全域交叉统计特征的叠加，进一步拓展了收益边界。</p>
<p>三期迭代的主线可以概括为一个认知演进：从"用 LLM 生成一个语义特征"到"构建一套可迁移的表征生产体系"。一期的重心是验证"LLM 表征能不能用"，二期是解决"怎么把表征做好"，三期是探索"好的表征怎么跨场景复用"。每一期的技术决策都建立在前一期的短板分析之上，而非独立的技术选型。</p>
<p>从方法论角度，三期实践沉淀了一条可复用的表征工程路径：用对比学习目标（InfoNCE + Triplet）训练 LLM 表征模型，用 MRL-E 实现多尺度降维，用相似度分桶或 PEPNet 门控注入排序模型。这条路径的每个环节都有明确的工程 checklist——难负样本的质量决定表征上限，Prompt 精简化优于复杂指令，覆盖率验证是跨模块迁移的第一步，语义特征与统计特征应协同设计而非二选一。</p>
<p><strong>注释</strong></p>
<ul>
<li>[1] Hewitt, J. "Initializing New Word Embeddings for Pretrained Language Models". Columbia University. https://www.cs.columbia.edu/~johnhew/vocab-expansion.html</li>
<li>[2] Prompt：该部分实验在单独商家表征建模阶段进行，表格中未包含商品 Prompt 的对比实验。实验得到的 Prompt 设计原则(精简信息优于复杂指令)可通用到商品表征建模中。</li>
<li>[3] Hu, E. et al. (2022). "LoRA: Low-Rank Adaptation of Large Language Models". ICLR 2022. https://arxiv.org/abs/2106.09685</li>
<li>[4] Kusupati, A. et al. (2022). "Matryoshka Representation Learning". NeurIPS 2022. https://arxiv.org/abs/2205.13147</li>
<li>[5] van den Oord, A. et al. (2018). "Representation Learning with Contrastive Predictive Coding". arXiv:1807.03748. https://arxiv.org/abs/1807.03748</li>
<li>[6] 实验设置为0.5：通过网格搜索实验(m ∈ {0.1, 0.3, 0.5, 0.7,1.0})，发现 m=0.5 时模型在验证集上取得最佳效果，该设置能够在保证正负样本区分度的同时避免过度惩罚。</li>
<li>[7] Q2I-Click-AUC：基于 query 和 item 表征的余弦相似度作为打分，在精排样本上计算得到。这些指标能够直接反映表征的语义匹配质量</li>
<li>[8] Chang, J. et al. (2023). "PEPNet: Parameter and Embedding Personalized Network for Injecting Tunneling Personalized Prior Information". KDD 2023. https://arxiv.org/abs/2302.01115</li>
<li>[9] Wang, L. et al. (2024). "Improving Text Embeddings with Large Language Models". ACL 2024. arXiv:2401.00368. https://arxiv.org/abs/2401.00368</li>
<li>[10] Xiao, S. et al. (2023). "C-Pack: Packaged Resources To Advance General Chinese Embedding". BAAI. arXiv:2309.07597. https://arxiv.org/abs/2309.07597</li>
<li>[11] Li, Z. et al. (2023). "Towards General Text Embeddings with Multi-stage Contrastive Learning". Alibaba. arXiv:2308.03281. https://arxiv.org/abs/2308.03281</li>
<li>[12] Li, S. et al. (2024). "Conan-embedding: General Text Embedding with More and Better Negative Samples". Tencent. arXiv:2408.15710. https://arxiv.org/abs/2408.15710</li>
<li>[13] Babakhin, N. et al. (2025). "Llama-Embed-Nemotron-8B: Training Llama 3.1 8B as a Top-Performing Embedding Model". NVIDIA. arXiv:2511.07025. https://arxiv.org/abs/2511.07025</li>
<li>[14] Rajput, S. et al. (2023). "Recommender Systems with Generative Retrieval". NeurIPS 2023. arXiv:2305.05065. https://arxiv.org/abs/2305.05065</li>
<li>[15] (2025). "UNGER: Generative Recommendation with A Unified Code via Semantic and Collaborative Integration". HUST &amp; Huawei. arXiv:2502.06269. https://arxiv.org/abs/2502.06269</li>
<li>[16] Xiong, L. et al. (2020). "Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval". arXiv:2007.00808. https://arxiv.org/abs/2007.00808</li>
<li>[17] Zhang, D. et al. (2025). "Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models". Alibaba Group. arXiv:2506.05176. https://arxiv.org/abs/2506.05176</li>
<li>[18] Zhao, K. et al. (2025). "KaLM-Embedding-V2: Out-tasking Specialized LLM Embedders for Multi-lingual Multi-context Retrieval". arXiv:2506.20923. https://arxiv.org/abs/2506.20923</li>
<li>[19] Ju, Z. et al. (2025). "Generative Recommendation with Semantic IDs: A Practitioner's Handbook". Snap Inc. arXiv:2507.22224. https://arxiv.org/abs/2507.22224</li>
<li>[20] Fu K. et al. (2025) "Forge: Forming semantic identifiers for generative retrieval in industrial datasets"[J]. arXiv preprint arXiv:2509.20904, 2025. https://arxiv.org/abs/2509.20904</li>
</ul>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/8f6d0d2a1b53e0fbe26ec7f5426bd45a302269.png" type="image/png"/>
    </item>
    <item>
      <title>KDD&amp;apos;26美团学术论文精选及KDD Cup&amp;apos;26 DataAgents赛道冠军思路解读</title>
      <link>https://tech.meituan.com/2026/08/13/KDD-2026-meituan-papers.html</link>
      <guid>https://tech.meituan.com/2026/08/13/KDD-2026-meituan-papers.html</guid>
      <source url="https://tech.meituan.com/rss.xml">KDD&amp;apos;26美团学术论文精选及KDD Cup&amp;apos;26 DataAgents赛道冠军思路解读</source>
      <description>本文精选了美团技术团队被 KDD 2026 收录的 8 篇论文进行分享，这些论文覆盖了推荐大模型、生成与奖励建模框架、智能体搜索、Transformer 框架、元泛化框架等技术领域。</description>
      <content:encoded><![CDATA[<p>KDD（ACM SIGKDD Conference on Knowledge Discovery and Data Mining）是数据挖掘与知识发现领域最具影响力的国际顶级学术会议。KDD 以其严格的论文录用标准和深厚的学术影响力著称，是推动数据驱动研究与应用创新的重要平台。大会为学术界和工业界提供了交流前沿成果的高水平论坛，论文录用率通常在 15%-20% 左右，属于计算机领域的 CCF-A 类顶级会议。</p>
<p>本文精选了美团技术团队被 KDD 2026 收录的 8 篇论文进行分享，这些论文覆盖了推荐大模型、生成与奖励建模框架、智能体搜索、Transformer 框架、元泛化框架等技术领域。</p>
<p>🏆 此外，大众点评技术部还荣获了 2026 KDD Cup  复杂数据分析 Data Agents 国际竞赛的冠军、季军，本文介绍了团队比赛思路和解题策略。希望以上这些内容能够对大家有所帮助或启发。</p>
<h2>01 MTFM: A Scalable and Alignment-free Foundation Model for Industrial Recommendation in Meituan</h2>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.11235" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/9720828f0ff8f07f6ce01f56d9e3f820362245.png" alt=""></p>
<p><strong>论文简介</strong>：工业推荐系统通常涉及多个场景，而现有的跨域（CDR）和多场景（MSR）方法往往需要大量资源且要求严格的输入对齐，限制了其可扩展性。该论文提出了MTFM（Meituan Foundation Model for Recommendation），一种基于Transformer的框架，旨在解决上述挑战。MTFM不预先对齐输入，而是将跨域数据转换为异质Token，以无对齐的方式捕捉多场景知识。为提升训练效率，MTFM引入了多场景用户级样本聚合机制，显著减少了总实例数量，大幅提升训练吞吐量；同时融合了Grouped-Query Attention和定制化的Hybrid Target Attention，有效降低了内存占用和计算复杂度。
此外，论文还实现了多项系统级优化，如kernel融合和消除CPU-GPU阻塞，进一步提升了训练和推理吞吐。在外卖等场景的离在线实验均验证了MTFM的有效性，证明了通过扩展模型容量和多场景训练数据可以实现显著的性能提升。基于MTFM，团队构建了服务于以上多个业务主场景的统一基座推荐大模型，替换各自的独立精排模型，并完成了全量。</p>
<h2>02 CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling</h2>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2603.08035" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/6c7cf0afe25cec1712d7dde27ff5a337479964.png" alt=""></p>
<p><strong>论文简介</strong>：本文提出CDRRM，一个对比驱动的评分准则生成与奖励建模框架，旨在提升LLM对齐中奖励模型的可靠性、可解释性与数据效率。传统奖励模型是“黑箱”且依赖昂贵标注；现有准则方法存在冗余与偏见。CDRRM采用“对比-聚合”流程：先对比好/差回答定位关键差异，再聚合为简洁的任务相关准则，指导评判模型。实验表明，CDRRM在三个基准上达最先进水平，缓解话痨、位置等偏见，且仅用3千样本让未微调模型超越全量微调基线，兼具高效与可解释性。</p>
<h2>03 LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services</h2>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2512.07436" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/1d4c9143463672d888cb2eb2a0732a1f723905.png" alt=""></p>
<p><strong>论文简介</strong>：本文针对本地生活服务领域AI搜索的研究空白，构建LocalSearchBench评测基准。该基准涵盖国内 9 座城市、6 大服务品类，包含 900 道多跳问答任务，同时配套交互环境 LocalPlayground 与商户检索工具 LocalRAG。实验测评 16 款主流大语言推理模型后发现，当前模型在此类任务表现不佳，普遍存在信息完整性、可信度不足等问题。研究还剖析了模型工具调用、多跳推理等典型缺陷，为本地生活服务场景下智能体搜索的模型训练和基准测试提供了重要支撑。</p>
<h2>04 Deterministic-Allocation and Anonymous Joint Advertising in E-commerce Platforms</h2>
<p><strong>论文下载</strong>：<a href="https://dl.acm.org/doi/epdf/10.1145/3770855.3818370" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/5a01fb282240b7941f2037723c76a830296753.png" alt=""></p>
<p><strong>论文简介</strong>：针对联合广告拍卖场景中的算法无法同时满足匿名性和确定性分配的问题，导致实际应用中存在分配不公平和激励不兼容等问题，提出了JTransNet模型。匿名性要求拍卖结果仅依赖于竞标价值，而与参与者身份和顺序无关，确定性分配则保证同样的输入下分配结果唯一。JTransNet通过引入匿名性和确定性分配机制，结合可微分的NeuralSort排序方法，实现了端到端数据驱动的AMD自动化模型拍卖算法。该算法很好的解决了联合拍卖场景下多方出资的流量分配和扣费问题，在离线和在线实验中均显著提升了平台广告收益。JTransNet已在美团零售核心业务场景全量上线，促进了广告业务流量售卖的公平性与收益提升，同时为工业界大规模自动化模型拍卖机制算法设计提供了有效的解决方案。</p>
<h2>05 UME: A Unified Meta-Generalization Framework for Cross-Domain ETA</h2>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2606.00979" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/224479de429aacd8bedb20f6801bc454309283.png" alt=""></p>
<p><strong>论文简介</strong>：在即时物流场景中，提单页面的预估到达时间（checkout page ETA）对提升用户满意度、优化调度策略和控制运营成本至关重要。在美团Keeta等国际化即时配送平台上，具有显著的跨域异质性，多域建模已成为核心需求。然而，现有方法面临三大挑战：一是无法泛化到完全未见过的新市场域，无法在冷启动阶段实现零样本预测；二是跨域特征空间不一致，新市场域由于缺乏历史数据积累导致离线统计特征结构性缺失；三是成熟域与冷启动域往往需要分别建模，阻碍了知识迁移并增加了维护成本。
为此，本文提出了UME（Unified Meta-generalization framework for ETA），一个统一元泛化框架。UME设计了统一双分支网络和基于超网络的元学习机制，通过域级知识和实例级上下文动态调制特征门控、专家注意力和最终预测，实现跨域关联建模和域内自适应。同时引入知识蒸馏策略弥合特征缺失带来的信息差距。该方法在离线实验与线上实验中均优于现有方法。</p>
<h2>06 Generative Large-Scale Pre-trained Models for Automated Ad Bidding Optimization</h2>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2508.02002" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/396bda4d89816423002639874d71f127405992.png" alt=""></p>
<p><strong>论文简介</strong>：现代自动竞价系统需要在整体效果、广告主多样化目标和现实约束之间取得平衡，反映行业不断变化的需求。近年来，条件生成模型（如Transformer和扩散模型）能够根据广告主偏好直接生成竞价轨迹，为传统基于马尔可夫决策过程的方法提供了有前景的替代方案。但这些生成方法也面临诸如离线与在线环境分布偏移、动作空间探索有限以及需满足CPM和ROI等约束的挑战。为此，我们提出了GRAD，这是一种可扩展的自动竞价基础模型。GRAD通过动作混合专家模块实现多样化竞价行为探索，并结合因果Transformer进行约束优化。</p>
<h2>07 HMAF: A Hierarchical Multi-Slot GD-RTB Allocation Framework</h2>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2606.09896" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/19e1a9d93222a49084e792c4927e3727945241.png" alt=""></p>
<p><strong>论文简介</strong>：在现代在线广告平台中，保证交付（GD）合约与实时竞价（RTB）拍卖共存并相互竞价。现有方法要么将GD与RTB的优化解耦，要么依赖启发式的优先级规则，因此无法在复杂的多坑位投放和曝光约束下，有效平衡短期收入最大化与长期合约交付目标。针对这些问题，我们提出了HMAF（分层多坑位分配框架），这是一个统一框架，旨在优化GD-RTB广告平台中的曝光分配。HMAF以“规划–校准–执行”范式为核心结构，将离线约束优化与在线决策相结合，统筹离线GD资源规划、动态校准GD与RTB的竞争强度，并在多坑位环境中做出实时的列表级排序决策。</p>
<h2>08 MTGenRec: An Efficient Distributed Training System for Generative Recommendation Models in Meituan</h2>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2505.12663" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/8a8160c9e6e058a3b21d8ac801d8030996413.png" alt=""></p>
<p><strong>论文简介</strong>：生成式推荐在搜索、推荐、广告领域得到越来越广泛的应用，在用户体验和平台收入方面均取得了显著的提升。随着生成式推荐模型Scaling Dense的发展趋势，业界越来越倾向于基于PyTorch生态构建下一代推荐模型训练引擎，最大程度上复用LLM的发展红利。然而，PyTorch 生态在对大规模稀疏Embedding训练的支持上，仍有较大的提升空间。因此，我们基于PyTorch 生态提出了MTGenRec训练框架，统一「稀疏-稠密」训练能力，满足工业级生成式推荐模型训练需求。
具体来说，针对稀疏ID我们提出使用动态Hashtable替换静态表，解决ID动态上下线的问题，方便用户使用；为了提升训练效率，我们提出自动合表、ID去重、变长序列负载均衡等技术，针对推荐场景进行极致优化。此外我们还开发了断点续训、混合精度训练、梯度累积、算子融合等配套技术。大量实验结果显示相比TorchRec baseline，MTGenRec能够取得1.6倍~2.4倍的训练加速比，同时保证训练精度不变。从8卡扩展到128卡，MTGenRec也取得了近似线性的扩展效率。目前MTGenRec已在美团内部多个核心场景落地使用。</p>
<h2>| 大众点评技术部荣获2026 KDD Cup 复杂数据分析 Data Agents 国际竞赛冠军、季军</h2>
<p>KDD Cup 是数据挖掘与知识发现领域全球公认的顶级赛事。在 2026 赛季的 DataAgents 赛道中，美团技术团队历时两个月，从全球参赛队伍中突围，最终摘得冠军与季军。</p>
<p>比赛考察的是模型在真实复杂数据场景下的理解与推理能力——多模态输入、非结构化文档、干扰信息识别，每一项都是当前 Agent 落地的硬骨头。</p>
<p><img src="https://p0.meituan.net/meituantechblog/6cbd9673a4bd101e2c1801e9885063b7266358.png" alt=""></p>
<p>传统的 Data+AI 系统虽已在特定任务上取得显著进展，但端到端的分析流程仍高度依赖人类专家编排，成为制约数据分析可扩展性与适应性的主要瓶颈。为此，KDD Cup 2026 提出以「数据智能体（Data Agents）」破局——通过融合知识理解、推理与规划能力，自主完成任务拆解与规划、工具选择与调用、异构数据推理以及结果综合。复杂数据分析是其中的核心任务，主要挑战在于真实数据的「异构鸿沟」与推理链路的非线性复杂性。Data Agents智能体接收一份异构的多模态数据包（涵盖数据库、PDF 报告、JSON 数据、图表乃至视频等），并针对一个高层次的自然语言问题，自主编排包含并行分支、迭代循环与结果汇聚的复杂推理过程，最终给出准确答案，旨在推动构建真正自主的数据分析系统。</p>
<p><img src="https://p1.meituan.net/meituantechblog/60d60d0f980155b3f2b65db725493b035233598.png" alt=""></p>
<p>比赛中，队伍将点评「问点仔」建设过程中积累的 Agent Harness 能力迁移至赛题，利用业余时间构建了完整的 Agent 运行时，支持多类型数据文件的自主探索以及 SQL、Python 等分析工具的选择与执行。通过错误反馈、超时控制和自动重试等机制，提升智能体在长链路任务中的稳定性与容错能力。针对视频和非结构化文档等异构数据，还构建了多模态视频理解子智能体和非结构化文档 ETL 子智能体，进一步增强主智能体的数据提取、理解与综合分析能力。此次获奖验证了相关技术在复杂异构数据分析Agent场景中的有效性，也为后续持续提升「问点仔」智能化水平提供了技术积累。</p>
<p>目前，相关代码已在<a href="https://github.com/zhezh/kddcup2026_champion" target="_blank" rel="noopener noreferrer">GitHub开源</a>，后续我们还会通过技术博客分享更多的技术细节，敬请期待！</p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/9720828f0ff8f07f6ce01f56d9e3f820362245.png" type="image/png"/>
    </item>
    <item>
      <title>Agent评测漫谈 —— 由浅入深讲解Agent评测</title>
      <link>https://tech.meituan.com/2026/08/07/Agent-Evaluation.html</link>
      <guid>https://tech.meituan.com/2026/08/07/Agent-Evaluation.html</guid>
      <source url="https://tech.meituan.com/rss.xml">Agent评测漫谈 —— 由浅入深讲解Agent评测</source>
      <description>本篇博客是一篇科普文章，由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么，以及如何建立评测体系；其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验，是我们在两年实践过程中逐步打磨出来的认知。</description>
      <content:encoded><![CDATA[<p>本篇博客是一篇科普文章，由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么，以及如何建立评测体系；其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验，是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。</p>
<p>本篇博客在美团内部发表之后获得了较多的关注，我们发现大家对Agent评测的热情非常高，因此我们决定将内部博客进行公开，想把这些经验分享给更多的同学，希望对大家有所启发或帮助。</p>
<h2>一、Agent评测是什么</h2>
<h3>1.1 评测的核心目的</h3>
<p>评测的核心目的是为了回答 <strong>Agent 的好不好？以及到底哪里好，哪里不好？</strong> 从而为下一轮迭代指明方向。评测是Agent效果的“精密量具”。</p>
<p>这也是为什么 Agent 评测不能只停留在离线打榜，更不能只看某次 Demo 的表现。它必须服务于真实业务中的研发、上线、回归、优化和规模化落地。</p>
<p>而Agent评测的基石是观测，因此我们得出了Agent研发公式 —— 观测 + 评测 = 持续迭代</p>
<h3>1.2 Agent评测与传统模型评测的不同</h3>
<p>评测方法会随着 AI 形态变化而变化，大致经历了三个阶段：</p>
<p><img src="https://p0.meituan.net/meituantechblog/5a8954c2e7b681ee8fb8d2c8a73868cd157865.png" alt=""></p>
<p>传统机器学习更像在回答“算得准不准”。 大模型评测开始回答“模型能力强不强”。 而 Agent 评测真正要回答的是：</p>
<blockquote>
<p>当模型被放进一个真实系统里，和 Prompt、Skill、工具链、记忆、状态管理、业务流程耦合在一起后，它能不能稳定交付好的结果。</p>
</blockquote>
<p>这意味着 Agent 的评测对象已经不再是单一模型，而是一个“模型 + 系统 + 工具 + 流程”的复杂系统。</p>
<h3>1.3 为什么Agent评测不是只看结果，还要看行为和过程</h3>
<p>在真实场景中，两个 Agent 可能最终都“做对了”，但工程价值完全不同：</p>
<ul>
<li>一个路径清晰、工具调用稳定、耗时可控、可重复复现</li>
<li>一个反复试错、路径混乱、靠偶然命中结果、不可复现</li>
</ul>
<p>如果只看最终答案，这两者会被误判为同一水平；但从规模化、成本优化、用户体验的角度看，差别非常大。</p>
<p>因此，Agent 评测至少需要覆盖四层内容：</p>
<ul>
<li><strong>结果层</strong>：任务是否完成，输出是否可用</li>
<li><strong>过程层</strong>：规划是否合理，步骤是否稳定</li>
<li><strong>效率层</strong>：耗时、Token、工具调用次数是否可接受</li>
<li><strong>风险层（安全层）</strong>：是否越权、是否误操作、是否存在安全隐患</li>
</ul>
<p>从这个意义上讲，自2023年GPT爆火以来，Agent发展从ChatBot形态快速发展至ClaudCode、OpenClaw这样的多功能长程Agent，Agent能力日渐强大，Agent评测正在从“答案评测”走向“行为评测”。</p>
<h3>1.4 为什么说观测是评测的基石</h3>
<p>有一个朴素的认知：Agent 属于广义的 SaaS 层，大模型赋予Agent泛化能力但也带出随机性的问题，而用户仍旧期望得到一个稳定可靠的智能体。为了弥合“随机性”与“可靠性”之间的鸿沟，我们必须回归工程视角看待Agent —— <strong>看不见的问题，几乎不可能被稳定解决</strong>。</p>
<p>Agent 的一次执行通常包含如下链路：</p>
<p><img src="https://p0.meituan.net/meituantechblog/6a9ba42edcd2f8bd0ec7d23d4983147a257714.png" alt=""></p>
<p>只要其中任意一层出问题，最终效果都可能劣化。为了结果稳定，我们需要过程稳定。但如果日志系统只能看到“用户说了什么”和“最后回复了什么”，就几乎无法判断问题根因。正是基于“<strong>我想看Case却发现没打日志</strong>”这个朴素的问题，工业界发展出了 Trace 系统，将黑盒内部的逻辑推理过程进行全路径的披露，将所有影响模型输出的输入信息都记录下来。</p>
<p>对 Agent 的每一个“隐形动作”进行精准观测，是实现从“概率性生成”向“工业级可靠性”跨越的必由之路。</p>
<h3>1.5 小结：Trajectory Evaluation 与 Response Evaluation</h3>
<p>经过前文的论述，我们知道Agent评测本质是在回答好不好，为迭代指明方向。而Agent评测本身既要关注结果（Response）也要关注过程（Trace或者叫做Trajectory）。</p>
<h2>二、评测的核心方法论</h2>
<h3>2.1 评测体系的核心不是堆指标，而是搭桥</h3>
<p>有的同学会好奇，为什么一定要“搭桥”？这是因为Agent评测体系必须追求业务价值与评测指标之间的解释性。而Agent 评测的难点之一，是模型能力指标和业务结果指标之间有天然鸿沟。</p>
<p><img src="https://p0.meituan.net/meituantechblog/0791bdb6ec11d84dfcc4a4b667164383100037.png" alt=""></p>
<p>这两类指标不能直接映射，中间必须有一层面向任务系统的桥梁指标。我们提供一种分层思路如下：</p>
<p><img src="https://p0.meituan.net/meituantechblog/fa88ffeb3556e0e8d6b2f12e8e2dbf6b146404.png" alt=""></p>
<p>以 AI 搜索为例，业务可能关心DAU、留存和点击；搜索系统本身关心召回率和点击率；Agent 层则关心意图识别是否准确、检索是否有效、结果整合是否可信。</p>
<p>只有把这些层次串起来，才能真正回答“为什么业务指标变差”以及“模型能力提升为什么没有带来业务收益”。这件事必须依赖真正懂业务流程的人来共同建立指标体系。</p>
<h3>2.2 客观评测与主观评测并行</h3>
<p>经过第一章的介绍，我们知道，Agent的核心目标就是要稳定地交付好的结果。行业内 Agent 评测大量借鉴了大模型评测的方法论，总体上可以拆成客观评测和主观评测：</p>
<p><img src="https://p0.meituan.net/meituantechblog/728970da126530ee8541775cac60508c277172.png" alt=""></p>
<p>因此更现实的做法通常是：</p>
<ul>
<li>用客观评测覆盖高频、结构化、可规则化的部分</li>
<li>用主观评测覆盖开放性、高价值、复杂业务场景</li>
<li>用主观评测校准客观评测和 AI 评测，再把规模化部分交给自动化系统</li>
</ul>
<h3>2.3 使用“人人一致、人机一致”的方法论对齐主观评测</h3>
<p>“好不好”是一个主观问题，主观的标准需要对齐，否则我们不能确定某次迭代之后，到底是指标的抖动带来的提升还是真实的效果提升。</p>
<p>在评测实践中，真正困难的不是“没有人会评”，而是“不同的人评得不一样，机器和人评得也不一样”。在过去一年，我们图灵团队深度BP业务方的过程中，我们发现多个团队相继踩入了相同的坑。</p>
<p>图灵评测积累的关键认知可以概括为“人人对齐和人机对齐”，具体如下：</p>
<ul>
<li><strong>人人一致</strong>：1个“独裁者”好过10个“民主者”。需要一位强有力的角色，拉齐产品、运营、研发、QA的评测标准，遵循同一套评测体系，避免大家各自为政。不同评测员通过背靠背标注的方法拉齐标准。</li>
</ul>
<p><img src="https://p0.meituan.net/meituantechblog/c8424009679d2ecc1b00466290ebc522589569.png" alt=""></p>
<ul>
<li><strong>人机一致</strong>：机器评测结果与人工评测结果保持一致，否则不置信。人机一致的意义在于规模化提效，以应对更大的业务流量。</li>
</ul>
<p>具体如何进行对齐呢？最佳实践是把模糊指标下钻成更细的评测Rubric（或者叫评测维度：学界关于评测维度dimension和评测规则rubric的说法尚未统一，我们这里与开源项目Arize AI对齐），再把每个Rubric尽可能二元化。具体如下：</p>
<ul>
<li><strong>指标下钻</strong>：把“大而模糊”的概念下钻拆解成多个清晰维度</li>
<li><strong>Rubric 二元化</strong>：把打分规则尽量收敛成是/否/未知、0/1/unknown</li>
<li><strong>持续迭代</strong>：用 unknown 占比来反查 Rubric 是否定义合理，直到单条 Rubric 的人人一致率、人机一致率达到可信阈值（例如85%、90%）</li>
</ul>
<p>这种拆解法的价值在于：从“主观的模糊感受”转向“可判断的事实依据”，用下钻降低模糊度，从而降低人与人之间、人与机器之间的分歧。应用这套方法，数字站长的人机一致率可以达到99%。Beam以图灵的二元化方案改造评测体系，人机一致率从62%提升到92%。</p>
<p>下面我们分享两个案例。</p>
<p>案例一：如何评价初中生作文的好坏？（满分40分）</p>
<p><img src="https://p0.meituan.net/meituantechblog/bcd654d41d8dc247cafa5648750234fc123958.png" alt=""></p>
<p>案例二：以骑手外呼场景模型回复是否“口语化”举例</p>
<p>经典错误示范 —— 请判断大模型的回答是否口语化，并按照0到10分打分。</p>
<p>下钻与二元化之后的改进版：</p>
<ul>
<li>模型是否以您指代骑手；</li>
<li>模型是否使用“甭客气”，“明儿见”等非官方文书的口语交流词汇；</li>
<li>模型输出是否包含“吧”，“呢”，“那个”等语气词汇。</li>
</ul>
<p>补充：标注和评测的关系是什么？</p>
<p>其中，标注是一种动作，而评测是一套目标导向的判断流程。机器预标注可以帮助人工提效，但只有在人机一致率保障才能称为自动化评测，否则只是机器标注。</p>
<h3>2.4 Agent评测是一门实践科学</h3>
<p>从执行链路看，Agent 评测可以被拆成五个关键环节，</p>
<ul>
<li><strong>采集</strong>：采集线上或沙箱中的原始任务数据</li>
<li><strong>清洗</strong>：去重、归类、补上下文、修复脏数据</li>
<li><strong>评测</strong>：人工评测、AI 评测</li>
<li><strong>质检</strong>：检查评测标准是否稳定、评测结果是否可信</li>
<li><strong>分析/归因</strong>：定位问题归因，形成优化建议和回归任务</li>
</ul>
<p>这5个环节与线上AB、持续观测共同构成了Agent迭代的数据飞轮。</p>
<p>绝大部分新上手Agent评测团队都有一个误区 —— 多方调研总结设计一个复杂精妙的评测指标体系，而越复杂的指标越难以执行和对齐。</p>
<p>而Agent评测是一门实践科学。<strong>起步阶段“让数据飞轮高效运转起来”的意义远大于“设计一个复杂精妙的评测体系”。评测体系的建立不是一蹴而就的，而是依靠 Good Case 和 Bad Case 喂养的</strong>。</p>
<p>因此 ，Agent 评测指标体系的搭建最佳实践路径如下：</p>
<ul>
<li>从高频核心场景起步，先定义少量关键指标</li>
<li>从生产环境中收集 Bad Case</li>
<li>沉淀高质量 Good Case，明确什么叫“好”</li>
<li>把 Good/Bad Case 转成标准评测样本</li>
<li>用评测结果反哺 Prompt、Skill、策略和模型优化等等</li>
<li>再从新的线上表现里持续抽样，形成下一轮迭代</li>
</ul>
<p>其中，Bad Case 的价值往往更高，因为它最容易暴露能力边界和系统短板；而 Good Case 的作用则是帮助团队定义高质量完成的范式。</p>
<p>一个成熟的评测团队，核心能力不是一开始就搭出完美系统，而是能把线上问题、失败样本、模糊反馈不断转化成结构化评测资产。我们通过Bad Case和Good Case修正评测体系的目标，逐步修正“独裁者”与真实目标之间的负面偏差。例如履约数字站长业务，项目启动之处只有20多个评测指标，而经历1年时间推全之后，我们扩展到了近200个指标。</p>
<h3>2.5 专家知识补充模型能力在垂域场景的不足</h3>
<p>从GPT 3.5发布至今，虽然基座能力发生了天翻地覆的变化，但是模型能力终究不是万能的。在过去三年的Agent实践中，我们遇到过大量脱离实际的“许愿式”需求。我们要知道模型是训练出来的，模型本身拟合了Token的概率分布，即便在大规模参数下会产生能力的“涌现”，但模型能力的提升依旧强依赖语料的输入，尤其是高质量语料的输入。无论是早期的RLHF，还是如今的DPO、GRPO等算法，虽然训练架构在不断简化，但对高质量核心数据的依赖从未改变。</p>
<p>例如字节专门设立了众包专家标注平台 Xpert，用于生产地理、代码、法律、医学等专业领域的高质量数据，以此支撑豆包基座模型的迭代训练。基座模型能力的提升，大家的直观感受就是它在一个又一个垂直领域的表现越来越好。</p>
<p>因此，当我们在特定垂域面临业务知识语料匮乏（或公网无公开高质数据）的挑战时，通过引入行业专家的知识输入来补足模型/Agent的能力，就成了破局的关键——尤其是在项目的冷启动阶段。</p>
<p><img src="https://p0.meituan.net/meituantechblog/38f14cf00310f5e510a565afe5add85475210.png" alt=""></p>
<p>呼应前文，评测的目的是回答“Agent好不好”，那么谁来定义“好不好”呢？靠最懂业务最有Sense的行业专家。</p>
<h3>2.6 小结&amp;FAQ</h3>
<p>这个章节讲述的是图灵评测从履约的项目出发，又经过这1年多BP公司各个业务方的过程中沉淀的核心方法论。</p>
<p><strong>FAQ</strong></p>
<p><strong>Q1：“独裁者”必须是1个人吗，还是1个团队共同遵循一套评测规范即可？</strong></p>
<p>首先一个团队需要遵循同一套评测体系。独裁者的作用多方征求意见并整合评测体系，当项目方观念无法对齐的时候，由独裁者拍板定论，避免评测体系分化带来项目方各自为政以及内部拉扯带来的损耗。</p>
<p><strong>Q2：评测体系依赖“独裁者”，存不存在风险？</strong></p>
<p>我们要认清一个事实，评测体系是不断演进的。从业务冷启动到扩量再到全量，这个过程中用户从愿意尝鲜的AI爱好者扩展到全部用户，用户画像会发生明显的偏移。这导致评测目标需要随着业务的扩量不断地发生调整。独裁者的价值更多的体现在拉齐标准，评测目标更多的是由真实的业务场景中BadCase/Good Case修正并驱动的。当然，我们需要在评测标准建立之初选出最懂业务的人来制定评测体系。</p>
<p><strong>Q3：冷启动阶段一定要设立种子评测集吗？能不能直接小流量开灰上线，直接收集Good Case和Bad Case来驱动评测呢？</strong></p>
<p>冷启动阶段是否必须设立种子评测集，本质上是一个风险与成本的Trade-Off。</p>
<p>为什么建议设立种子集：大模型具有随机性，Corner Case 可能会导致Agent体验剧烈偏移。因此，需要通过回测保证Agent基线能力，不断融入Good Case和Bad Case来拓宽Agent的能力边界。</p>
<p>关于小流量开灰的策略：如果业务场景容错率高，或者构建高质量种子集的成本远超线上试错带来的负面反馈，可以尝试小流量上线收集线上case。</p>
<p><strong>推荐落地方案</strong>：人工生产少量评测集后，AI辅助生成或扩写，以较低成本完成冷启动的种子评测集构建。</p>
<p><strong>Q4：我们邀请的行业专家对“好”的定义不一致应该怎么办？</strong></p>
<p><strong>答</strong>：最朴素且有效的方法，邀请一批行业专家定义“好”的标准，从中抽取共性的部分建设评测体系。例如邀请金牌销售来定义优秀的销售SOP。</p>
<p>那么非共性的部分就没有价值了吗？并非如此。对于专家意见不一致的部分，往往意味着业务本身存在多种优秀策略。我们可以将这些分歧转化为 Agent 的不同风格或策略分支（例如：AI电销中，老练激进派 vs 细水长流派），并允许在不同的测试集（Benchmark）中独立评测。这些分歧点非但不是噪声，反而会成为 Agent 未来走向精细化迭代、覆盖更多长尾场景的重要养分。</p>
<h2>三、Agent观测评测的演进</h2>
<p>2023年GPT爆火，2024年工作流出现，去年 Claude Code发布，再到今年的龙虾热、爱马仕热，长程Agent逐渐进入了大众视野。Agent Harness也全面进入长程Agent时代。</p>
<p>长程Agent（Long-horizon Agent）与短程Agent的区别，在于它如何处理“时间跨度带来的复杂性”：</p>
<p><img src="https://p0.meituan.net/meituantechblog/8f8ece9a28d04ecfddfb2adeda215de5422438.png" alt=""></p>
<p>这些差异会为观测评测带来怎样的变化呢？</p>
<h3>3.1 短程Agent时代的观测评测</h3>
<p>短程Agent时代的评测对象相对简单。ChatAgent 时代的典型输入输出形态是：<code>Query -&gt; Answer</code>。</p>
<p>这类场景的共同特点是：Agent 更多是在“回答问题”，进行少量的系统操作，而不是“进入操作系统执行任务”。典型应用场景，例如AI搜索、客服机器人。此类Agent评测重点通常落在回答本身，例如：</p>
<p><img src="https://p0.meituan.net/meituantechblog/9f0173186662a5fc1f713ea812e1bedf123607.png" alt=""></p>
<p>在过去1年的发展中图灵形成了成熟的解决方案，包括人工评测、机器评测，部分案例如下：</p>
<p><img src="https://p1.meituan.net/meituantechblog/ed3a1d605c114a237925bb77f1d3b4f1531735.png" alt=""></p>
<h3>3.2 长程Agent的观测评测</h3>
<p><strong>3.2.1 长程Agent带来评测范式变化</strong></p>
<p>长程 Agent 解决的不是“回答一个问题”，而是“完成一个复杂任务”。它通常需要：</p>
<ul>
<li>任务需要多步骤拆解</li>
<li>执行过程中需要多次调用 Tool 或 Skill</li>
<li>需要读取中间结果并动态调整策略</li>
</ul>
<p>让我们回顾一下观测和评测的目标，带着这个目标去看长程Agent</p>
<ul>
<li><strong>观测目标</strong>：还原现场，精确定位，解决“我想看Case却发现没打日志”的问题</li>
<li><strong>评测目标</strong>：回答Agent好不好，指出迭代方向</li>
</ul>
<p><img src="https://p0.meituan.net/meituantechblog/ded0f067e5f7efd742b99b90aa39d751334664.png" alt=""></p>
<p><strong>3.2.2 Skill评测</strong></p>
<p>在讲Skill评测之前，我们先分享一下我们关于26年春节后这一轮龙虾/Skill热潮的调研。</p>
<p>谁在提出龙虾和Skill的评测需求（2月至今龙虾/Skill热潮的用户画像）？</p>
<p>总结起来目前龙虾和Skill相关需求主要 广义的运营提效 场景，大致可以分成三类：</p>
<p><img src="https://p0.meituan.net/meituantechblog/6ffee1bafd66d006e14e29030226a0c7457553.png" alt=""></p>
<p>用户规模正在从少量专业角色扩展到更广人群</p>
<ul>
<li>商家侧仍在探索和试点阶段，规模有限</li>
<li>公司内部AI at Work系统中的龙虾（或其他长程Agent）融合更广，用户覆盖产、运、研、销等多类角色</li>
<li>Skill 的开发门槛越来越低，甚至可以由 AI 辅助生成</li>
</ul>
<p>这会带来一个直接结论：</p>
<blockquote>
<p>未来需要评测的人，不只是一小撮产运研同学，而可能是每一个会创建、修改、接入 Skill 的人。</p>
</blockquote>
<p>这对评测系统提出了新的要求：</p>
<ul>
<li>要足够简单</li>
<li>要足够标准化</li>
<li>要足够自动化</li>
<li>最好能接入开发与发布流程</li>
</ul>
<p><strong>当前的本质痛点</strong></p>
<p>本质在于 —— 大家不知道怎样写好 Skill，也缺乏对 Skill 全生命周期进行评测的工具。</p>
<p>为了方便大家理解，我们将Skill全生命周期拆解如下：</p>
<p><img src="https://p0.meituan.net/meituantechblog/182fee6cd0b3b393e24bf2283bfe024c272940.png" alt=""></p>
<p>综上，Skill评测的痛点总体可以拆解成三个方面：</p>
<p><img src="https://p1.meituan.net/meituantechblog/281c7582036750d16d76ea3a0c38516d317274.png" alt=""></p>
<p><strong>面向Task的评测</strong></p>
<p>2026年1月9号，Anthropic发表了一篇博客揭秘<a href="https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents" target="_blank" rel="noopener noreferrer">AI Agent评估</a>，在这篇博客中首次提到了面向Task的长程Agent评测。文中对Task，定义为“具有明确输入和成功标准的单个测试”。</p>
<p>我们综合了Anthropic以及开源软件对Task的定义，简化如下。</p>
<p><img src="https://p0.meituan.net/meituantechblog/230f48a442655d73f000d00d39ee8e70190919.png" alt=""></p>
<p>prompt定义了我们的问题/诉求，expeted behavior定义了我们预期Agent达成的行为，当我们在正式或测试环境中向Agent发送promt，通过trace获取到长程Agent真实的执行路径，就可以得到（prompt - expeted_behavior - trace）三元组，类似于短程Agent的（query - ground_truth - answer），即可进行评测。</p>
<p><strong>3.2.3 长程Agent评测与短程Agent评测的差异</strong></p>
<p>可以把两者的差异总结如下：</p>
<p><img src="https://p0.meituan.net/meituantechblog/7e18558ac1dcbfe4501f58703ec4fed6197508.png" alt=""></p>
<p>最本质的变化是：</p>
<blockquote>
<p>ChatAgent 评测关心“说得好不好”，长程 Agent 评测关心“事情做成没有，以及是怎么做成的”。</p>
</blockquote>
<p><strong>3.2.4 人评主导走向机评主导</strong></p>
<p>ChatAgent 时代常见流程是：<code>核心评测员对齐 -&gt; 外包对齐 -&gt; 机评对齐</code></p>
<p>而在长程 Agent 场景下，这条链路有机会被明显缩短，甚至可以跳过外包对齐，直接进入：<code>核心评测员对齐 -&gt; 机评对齐 -&gt; 规模化扩展</code></p>
<p>原因主要有三点：</p>
<ul>
<li>长程 Agent 的执行轨迹更丰富，信息密度高使人成为卡点</li>
<li>Skill 生产门槛低，数量增长极快，人工大规模标注不可持续</li>
<li>基座模型能力的持续突破</li>
</ul>
<p>这并不意味着人工不重要，而是意味着：</p>
<ul>
<li>人工更应该做高价值标准设计和 Rubric 对齐</li>
<li>AI 更适合承担规模化运行、初筛和回归验证</li>
<li>平台更应该承担沉淀、回放、告警和归因职责</li>
</ul>
<p>换句话说，AI 评测真正要放大的，不是“机器打分”本身，而是核心评测员的判断标准。</p>
<p><strong>3.2.5 长程Agent评测基建至少应该具备哪些能力</strong></p>
<p>如果未来要支撑公司内大规模 Agent 和 Skill 生态，评测基础设施至少应包含以下能力：</p>
<ul>
<li><strong>全链路回放</strong>：复现一次任务从输入到结果的全过程</li>
<li><strong>Case 管理</strong>：统一维护任务样本、上下文、约束和 Rubric</li>
<li><strong>执行沙箱</strong>：按只读、可写、高风险等类型分层隔离执行</li>
<li><strong>AI 评测引</strong>擎：支持 Rubric 驱动的人机对齐和自动判分，且足够简单易用，方便广大skill生产者接入</li>
<li><strong>报告与归因</strong>：不仅给分，还能指出问题发生在规划、工具、环境还是 Skill</li>
<li><strong>回归机制</strong>：版本升级后自动触发历史 Case 回归</li>
<li><strong>准入准出门禁</strong>：把评测结果嵌入开发、发布和运营流程</li>
</ul>
<p>如果缺少这些能力，评测就容易停留在“单次分析”和“项目制支持”层面，无法真正成为生产系统的一部分。</p>
<h2>四、总结：Agent评测正在从打分动作走向基础设施能力</h2>
<p>综合来看，随着大模型能力的增强以及Agent Harness的持续演进，Agent 评测的演进可以概括为两句话：</p>
<p><strong>第一，评测对象变了</strong></p>
<p>过去评测的是“回答”，现在评测的是“任务系统”。</p>
<p>因此我们关心的不再只是输出内容本身，而是完整执行链路中的能力、稳定性、效率与风险。</p>
<p><strong>第二，评测方法变了</strong></p>
<p>过去主流是 <code>Query -&gt; Answer</code> 的文本质量评测，现在逐步转向 <code>Prompt -&gt; Expected Behavior</code> 的行为评测。</p>
<p>标准答案不再总是唯一，过程质量、任务完成度和轨迹质量成为新的核心对象。</p>
<p>因此，未来真正重要的，不只是能不能做几次评测，而是能不能建设出一套：<strong>看得见问题</strong>、<strong>说得清标准</strong>、<strong>跑得动规模</strong>、<strong>接得上流程</strong>、<strong>带得动迭代</strong>的 Agent 评测体系。</p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/5a8954c2e7b681ee8fb8d2c8a73868cd157865.png" type="image/png"/>
    </item>
    <item>
      <title>美团正式发布 CatPaw：全场景 AI Agent，从个人提效到企业智能化</title>
      <link>https://tech.meituan.com/2026/07/28/CatPaw-LongCat.html</link>
      <guid>https://tech.meituan.com/2026/07/28/CatPaw-LongCat.html</guid>
      <source url="https://tech.meituan.com/rss.xml">美团正式发布 CatPaw：全场景 AI Agent，从个人提效到企业智能化</source>
      <description>搭载美团 LongCat 2.0 的全场景 AI Agent 平台 CatPaw 正式上线，我们将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。</description>
      <content:encoded><![CDATA[<p>本月，美团 LongCat 2.0 已<a href="https://tech.meituan.com/2026/07/12/LongCat-2.0-Open-source.html" target="_blank" rel="noopener noreferrer">正式开源</a>，总参数 1.6T，平均激活约 48B，动态范围 33B 到 56B，原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步，让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”，才是真正的考验。</p>
<p>现在，搭载 LongCat 2.0 的美团全场景 AI Agent 平台 <a href="https://catpaw.meituan.com/" target="_blank" rel="noopener noreferrer">CatPaw</a> 正式上线，将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。</p>
<p>不仅如此，依托美团十余年深耕本地生活的行业积累，CatPaw 将商家经营、服务履约与消费决策的深度认知融入其中，助力企业构建 AI 数字员工、推进业务智能化升级。</p>
<p>目前，CatPaw 已在美团内部大规模落地：累计覆盖 9 万员工、搭建 Agent 3 万个，并在多个真实业务场景中完成验证。</p>
<h2>全时段运行，多终端协作的 AI 智能工作台</h2>
<h3>01 移动/PC/云端，全时段多端协作</h3>
<p>提供独立的<strong>移动端 App 与 PC 客户端</strong>，双端任务实时同步、无缝协作。移动端支持随时发起任务、查看进度与远程确认关键决策；PC 端专注本地深度执行，具备文件操作、浏览器控制与终端命令等完整能力。</p>
<p>云端模式支持 <strong>7 × 24 小时不间断运行</strong>，即使本地设备关机或断网也不受影响。长程任务与定时任务于云端持续运转，完成后随时打开手机或电脑即可查看成果。</p>
<p><img src="https://p0.meituan.net/meituantechblog/a690ba49597fd8720f96ea56573b54cc151290.png" alt=""></p>
<h3>02 深耕本地生活，融合美团业务生态</h3>
<p>在全场景通用 AI Agent 能力的基础上，CatPaw 进一步融入了美团在本地生活领域的全链路行业认知。从门店经营、评价体系、营销转化到履约配送，这些深度积累已被封装为即装即用的<strong>专家与技能</strong>，覆盖门店评价诊断与优化、商品文案生成、营销物料设计评估、活动策划、经营数据分析等场景。</p>
<p>CatPaw 既是人人可用的<strong>全能 AI 助手</strong>，也是真正懂本地生活生意的智能搭档。</p>
<p><img src="https://p1.meituan.net/meituantechblog/864f86011bdcc6a2428f980323605284136476.png" alt=""></p>
<h3>03 专家与技能，丰富能力即装即用</h3>
<p>CatPaw <strong>支持 AI 专家</strong>，每位专家<strong>集成多项技能与子代理，高效完成特定领域的复杂任务</strong>。从专家广场<strong>一键安装</strong>即可使用，也可通过对话将自己的工作方式快速封装为专属专家，团队共享复用。</p>
<p>平台内置丰富的技能库，开箱即用。内嵌浏览器还<strong>支持操作过程一键录制</strong>，将日常高频流程自动生成专属技能，让个人与团队经验沉淀为可复用的数字化资产。</p>
<p>支持<strong>跨会话长期记忆</strong>，自动记忆用户的个性化偏好、操作习惯与历史上下文，跨设备、跨对话保持连续理解，越用越懂你。</p>
<p><img src="https://p0.meituan.net/meituantechblog/7f715c1d858cead54dad86e431e30153313940.png" alt=""></p>
<h3>04 对话即交付，多 Agent 自主协同</h3>
<p>只需明确最终目标，Agent 便会<strong>自主规划步骤并在授权范围内深度执行</strong>：读取文件、操作浏览器、运行终端命令，直接交付 Excel、可视化报告或代码等可用成果。</p>
<p>面对跨领域的复杂任务，系统动态进行任务拆解，<strong>调度多个具备专属工具的 Agent 并发处理</strong>，各 Agent 在独立环境中互不干扰，进度实时可见，结果自动汇总。</p>
<p><img src="https://p0.meituan.net/meituantechblog/2122a550b13a060033f2a0343680ccfa345379.png" alt=""></p>
<h2>从 AI 工作台到业务系统：Managed Agents</h2>
<p>CatPaw Managed Agents 是企业级 AI Agent 开发与托管平台，提供开箱即用的工程底座，<strong>无需从零搭建底层基建</strong>，即可快速构建、部署与管理专属 Agent。</p>
<h3>01 数字员工，扫码即用灵活配置</h3>
<p>数字员工是运行在飞书、企微等 IM 中的 AI 虚拟同事，@ 即可唤醒使用。<strong>平台预置多种角色模板，扫码即用</strong>；美团在本地生活领域的长期积累也已沉淀为专属模板，不只是通用的聊天机器人，而是理解业务的行业 AI 助手。</p>
<p>同时支持通过 <strong>AI 对话描述需求，快速生成专属数字员工</strong>。从 Agent 创建到环境部署、会话初始化，<strong>全程自动完成，无需手动配置</strong>。</p>
<p>提示词、知识库、凭证、工具均支持在线管理，团队可按业务场景灵活搭建。</p>
<p><img src="https://p0.meituan.net/meituantechblog/a4a4286eab88dc7a9fb8ad4a359f57d3202455.png" alt=""></p>
<h3>02 企业级安全，数据隔离可控</h3>
<p><strong>Agent 运行环境严格隔离</strong>，租户间数据互不可见。凭证集中托管，<strong>确保 Agent 全程零接触敏感资产</strong>。</p>
<p>支持<strong>分级权限管控</strong>与私有化部署，全面满足企业合规与安全审计要求。</p>
<p><img src="https://p0.meituan.net/meituantechblog/d8ea3582939d36764915e7b5f848790e478278.png" alt=""></p>
<h3>03 Agent 托管运行，持续在线</h3>
<p>支持<strong>按需配置运行环境</strong>，一键托管上线，<strong>资源动态扩缩</strong>。</p>
<p>沙箱环境轻量隔离，百毫秒级冷启动，闲时自动释放，兼顾响应速度与成本。</p>
<p><img src="https://p0.meituan.net/meituantechblog/1c65c6d75279f7085030ad763eeff3b2368282.png" alt=""></p>
<h3>04 可视化运维，全链路可观测</h3>
<p>提供统一的运维管理界面，<strong>会话记录完整留存可追溯</strong>，支持在线调试实时排查问题，<strong>模型调用量与消耗清晰可见</strong>。</p>
<p>多维度数据统计与分析，帮助团队持续评估 Agent 表现、优化运行效果。</p>
<p><img src="https://p0.meituan.net/meituantechblog/4344c5e90e47733d89ef9ee3d792f88f140185.png" alt=""></p>
<h2>从个人提效到组织智能化：与商家一起探索更多可能</h2>
<p>在全场景 AI 能力之上，CatPaw 提供<strong>组织级的管理与管控能力</strong>，满足商家**规模化落地 AI **的管理需求。</p>
<p>CatPaw 提供统一管理后台，支持团队账号体系。团队成员与权限集中管理，用量明细与消耗实时可查，成本清晰可控。AI 专家和技能支持按团队或角色集中配置与精准下发，一线员工开箱即用，AI 能力快速转化为实际生产力。</p>
<p>此外，CatPaw 还提供与<strong>美团业态深度关联的专属专家与技能</strong>，覆盖外卖、服务零售、医药健康等多个行业。以服务零售为例，美团商家运营专家整合了经营数据分析、评价管理、门店装修等核心场景，帮助商家实现智能化运营。</p>
<p>CatPaw 将持续深入行业场景，让 AI Agent <strong>真正成为驱动经营增长的数字化伙伴</strong>。更多能力陆续开放中，<strong>诚邀美团合作商家抢先体验</strong>。</p>
<p><strong>体验地址</strong>：<a href="https://catpaw.meituan.com/" target="_blank" rel="noopener noreferrer">https://catpaw.meituan.com/</a></p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/a690ba49597fd8720f96ea56573b54cc151290.png" type="image/png"/>
    </item>
    <item>
      <title>下一代搜索智能体评测基准！美团开源LoHoSearch，用知识图谱校准AI能力认知</title>
      <link>https://tech.meituan.com/2026/07/24/LongCat-LoHoSearch.html</link>
      <guid>https://tech.meituan.com/2026/07/24/LongCat-LoHoSearch.html</guid>
      <source url="https://tech.meituan.com/rss.xml">下一代搜索智能体评测基准！美团开源LoHoSearch，用知识图谱校准AI能力认知</source>
      <description>过去一年，我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上，顶尖模型准确率从最初的 30% 区间迅速攀升至 90% 以上。然而，当基准迅速饱和，其区分模型能力的价值也随之递减。</description>
      <content:encoded><![CDATA[<p>过去一年，我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上，顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而，当基准迅速饱和，其区分模型能力的价值也随之递减。</p>
<p><img src="https://p0.meituan.net/meituantechblog/69e86f1a417ef555aed62d74c1152c53108351.png" alt="图1：BrowseComp 准确率进展曲线"></p>
<p>BrowseComp 的题目由人工设计，局限在于只能基于标注者已知的实体和关系构思，无法站在全局知识网络视角判断：哪些条件真的难检索？哪些约束的候选空间足够大？正是这种局限，让我们开始思考另一种可能性：<strong>能不能让机器自己来出题？</strong></p>
<p>美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准，就是把这种可能性变成了现实。</p>
<h2>LoHoSearch 的核心"硬核"看点</h2>
<ul>
<li><strong>知识图谱自动化构造。</strong> 以覆盖762万维基百科实体的知识图谱为基础自动生成题目，替代人工出题。基准含544道经人工核验的题目，覆盖11个领域。</li>
<li><strong>双维度难度控制。</strong> 在生成中系统控制搜索空间与结构复杂度。构建出难度显著高于现有基准的挑战性问题。</li>
<li><strong>当前模型性能表现。</strong> 已评测模型中，GPT-5.5准确率为34.74%；现有上下文管理策略在LoHoSearch上提升幅度为6.8%，低于在BrowseComp上的14.03%。</li>
</ul>
<h2>01 设计原理：让机器出题，需要几部？</h2>
<p>机器出题的前提，是让机器拥有全局视野。整个构建流程可以分为四个环节：<strong>建图 → 控制难度 → 质量把关 → 数据概览</strong>。下面逐一展开。</p>
<h3>1.1 建图：搭建知识图谱，让机器获得全局视野</h3>
<p>LoHoSearch 的第一步，是从完整的英文维基百科出发搭建一张大规模知识图谱：</p>
<ul>
<li>762 万个实体（每个维基页面是一个实体节点）</li>
<li>2.65 亿条有向边（页面正文中指向其他维基页面的超链接）</li>
<li>每个实体的类型取自其 Wikidata P31 类别，实体热度用入度来衡量</li>
</ul>
<p>这张图谱为后续在全局视角下挑选"难题"提供了基础。</p>
<p><img src="https://p0.meituan.net/meituantechblog/158cf7d04a3fd9d5c8b5f171480db1ec450289.png" alt="图2：LoHoSearch 数据构造流程总览（知识图谱构建 → 子图采样 → QA 生成与验证 → 后置过滤与人工复核）"></p>
<p>有了图谱之后，下一个问题是：什么样的题目才算"难"？LoHoSearch 从两个维度来定义难度。</p>
<h3>1.2 控制难度：搜索空间和结构复杂度两个维度</h3>
<p>决定搜索难度的核心有两个维度，而它们恰恰是人工出题最难把控的：</p>
<ul>
<li><strong>搜索空间</strong>：满足一个条件的候选实体有多少。候选越多，排除成本越高。</li>
<li><strong>结构复杂度</strong>：要同时满足多少条件才能锁定答案。条件越多、咬合越紧，求解链条越长。</li>
</ul>
<p>针对这两个维度，LoHoSearch 设计了两种子图结构：</p>
<p><img src="https://p0.meituan.net/meituantechblog/da7dbb937aa30503321fa592d43b0123124986.png" alt=""></p>
<ul>
<li><strong>树结构</strong>主要通过放大"搜索空间"来制造难度。</li>
<li><strong>图结构</strong>则在巨大搜索空间之上，通过引入环形依赖和交叉约束，进一步叠加了"结构复杂度"。</li>
</ul>
<h3>1.3 质量把关：从生成到验证，层层把关</h3>
<p>子图采样完成后，还需要转换为可阅读的自然语言题目。整个转换与验证流程分为三层：</p>
<ul>
<li><strong>题目生成</strong>：从子图抽取维基描述，改写为自然语言问题。</li>
<li><strong>自动验证</strong>：检查问题是否完整覆盖子图关系，并由搜索智能体验证标准答案满足所有条件。</li>
<li><strong>筛选与复核</strong>：排除多答案题和易答题，再由人工审核。</li>
</ul>
<p>经过三层筛选，自动化流程的整体质量表现如下：75.5% 的题目直接通过人工复核，22.3% 经标注员微调后接受，仅有 2.2% 因严重问题被丢弃。</p>
<h3>1.4 数据概览：544道题目，11个主题领域</h3>
<p>LoHoSearch 最终收录 <strong>544 道</strong> 经人工核验的题目。对比树结构和图结构可以看出，图结构子图明显更稠密——节点更多、边数接近前者的两倍，这正对应它更高的结构复杂度。题目内容覆盖音乐、地理与地点、影视、体育等 11 个主题领域。</p>
<p><img src="https://p0.meituan.net/meituantechblog/9be937091fe5f30761bb06ea08a5c4e838213.png" alt="表1：LoHoSearch 数据统计"></p>
<p><img src="https://p0.meituan.net/meituantechblog/55f51f19edf66249bcb164c70a75adb3167617.png" alt="图3：LoHoSearch 的领域分布"></p>
<p><img src="https://p0.meituan.net/meituantechblog/2b54f0c184c018dbd27593bd90f40de0143825.png" alt="表2：各模型在 LoHoSearch 上的性能表现（%）"></p>
<p>最强模型 GPT-5.5 准确率仅 34.74%，DeepSeek-V4-Pro、Claude-Opus-4.6 和 Kimi-K2.6 集中在 15.53%–15.99%，其余模型均低于 14%。这与它们在 BrowseComp 上 80% 以上的表现形成鲜明对照——LoHoSearch 对当前最先进搜索智能体构成了实质挑战。</p>
<h3>洞察一：解一道题，平均工具调用从 35 次增至 61 次</h3>
<p>用 DeepSeek-V4-Flash 作为探针对比两个基准：同一模型在 BrowseComp 上准确率 58.84%，在 LoHoSearch 上仅 10.02%。</p>
<p><img src="https://p0.meituan.net/meituantechblog/234e605bbc7af2f8f7977c212bc62a8290841.png" alt="图4：BrowseComp 与 LoHoSearch 正确轨迹的工具调用次数分布"></p>
<p>解一道 LoHoSearch 题目，平均工具调用从 35 次增至 61 次（+74%），中位数从 26 次升至 59 次。图结构题目准确率仅 8.01%，远低于树结构的 11.89%，印证了结构复杂度是独立于搜索空间之外的额外难度来源。</p>
<h3>洞察二：重复采样收益可观，但天花板依然很低</h3>
<p>对 DeepSeek-V4-Flash 采样 16 个独立回答，结果如图 5 所示。</p>
<p><img src="https://p1.meituan.net/meituantechblog/a011a2b381eef5312e8281e8f32f7449129032.png" alt="图5：并行采样下 pass@N 及三种答案聚合策略的表现"></p>
<p>pass@N 从 N=1 的 9.3% 升至 N=16 的 38.3%，重复采样收益可观，但 38.3% 仍处低位。尝试 16 次仍有六成以上题目无法攻克。三种聚合策略中 best-of-N 表现最优（24.6%），远低于 pass@16 上界，说明模型在答案置信度校准上存在明显不足。</p>
<h3>洞察三：现有的上下文管理策略，在这里已失真</h3>
<p>以标准 ReAct 为基线，测试 Summary 和 Discard-all 两种策略，并加入 Verify 模块。</p>
<p><img src="https://p0.meituan.net/meituantechblog/f59c780873848c6d66609ad9eafc10d651431.png" alt="表3：基于 DeepSeek-V4-Flash 的上下文管理策略消融实验"></p>
<p>表现最佳的组合（Discard-all + Verify）将成绩从 10.02% 提至 16.82%，绝对提升仅 6.8 个百分点，而同一套策略在 BrowseComp 上可带来 14 个百分点的增益。收益收窄的原因在于 LoHoSearch 需要更长的推理链，简单的轨迹压缩或重启无法解决长程搜索中的信息丢失问题——这使其成为下一代上下文管理技术更有价值的试验场。</p>
<h3>洞察四：知识图谱是系统化构造高难度题目不可或缺的基础</h3>
<p>对比两个基准中"隐藏实体"的特征可以发现：</p>
<p><img src="https://p1.meituan.net/meituantechblog/682b8d4610aa31a2be89b70bc27a206a71835.png" alt="图6：隐藏实体分析(a) 隐藏实体的入度分布；(b) 相同流行度下关系搜索空间对比"></p>
<p>其一，BrowseComp 的隐藏实体流行度明显更高，人工出题难以精确控制实体知名度，导致实体偏易。</p>
<p>其二，即便将流行度控制在同一水平，LoHoSearch 的关系搜索空间仍显著更大，实体推断难度远高于 BrowseComp。</p>
<p>这说明人工构建存在系统性局限，知识图谱是系统化构造高难度题目不可或缺的基础。</p>
<h2>02 总结：为下一代智能搜索提供新标尺</h2>
<p>LoHoSearch 的价值体现在三项具体贡献上：</p>
<ul>
<li><strong>基于知识图谱的自动化构造流程。</strong> 以覆盖762万实体的知识图谱为基础自动生成题目，系统控制搜索空间与结构复杂度，突破人工出题的难度上限。</li>
<li><strong>更具区分度的评测标准。</strong> 最强模型 GPT-5.5 准确率仅 34.74%，正确轨迹所需工具调用次数是 BrowseComp 的 1.7 倍。LoHoSearch 为搜索智能体建立了更具区分度的评测标尺。</li>
<li><strong>面向上下文管理研究的挑战性平台。</strong> 最优策略仅带来 6.8% 的提升，远低于其在 BrowseComp 上 14.03% 的增益，表明 LoHoSearch 可成为推动下一代上下文管理技术研究的理想试验场。</li>
</ul>
<p>LoHoSearch 已全面开源，欢迎各大模型前来接受"长程搜索"大考。</p>
<h2>开源链接</h2>
<ul>
<li><strong>Paper</strong>: <a href="https://arxiv.org/abs/2606.12837" target="_blank" rel="noopener noreferrer">https://arxiv.org/abs/2606.12837</a></li>
<li><strong>HuggingFace</strong>: <a href="https://huggingface.co/datasets/meituan-longcat/LoHoSearch" target="_blank" rel="noopener noreferrer">https://huggingface.co/datasets/meituan-longcat/LoHoSearch</a></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/69e86f1a417ef555aed62d74c1152c53108351.png" type="image/png"/>
    </item>
    <item>
      <title>让AI离开温室，走向动态世界：MineExplorer揭示顶级多模态大模型被忽视的能力断层</title>
      <link>https://tech.meituan.com/2026/07/24/LongCat-MineExplorer.html</link>
      <guid>https://tech.meituan.com/2026/07/24/LongCat-MineExplorer.html</guid>
      <source url="https://tech.meituan.com/rss.xml">让AI离开温室，走向动态世界：MineExplorer揭示顶级多模态大模型被忽视的能力断层</source>
      <description>美团 LongCat 团队构建了 MineExplorer —— 首个在开放世界中做到分钟级长程任务的评测基准，系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。</description>
      <content:encoded><![CDATA[<p>假如你出生在一片未知的森林，太阳即将下山，饥肠辘辘，前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。</p>
<p>此时如果你按下暂停，把截图发给所有顶级的多模态大模型，它们都能完美回答你：“黄昏、有怪物，面临威胁。”</p>
<p>我们发现，多模态大模型能看懂图像、解析视频、在复杂场景里推理，然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么？</p>
<p>为了深入探索，美团 LongCat 团队构建了<strong>MineExplorer</strong>——<strong>首个在开放世界中做到分钟级长程任务的评测基准</strong>，系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。</p>
<p><strong>MineExplorer 核心看点：</strong></p>
<ul>
<li><strong>一个能直接跑的评测基准</strong>：813 个人工验证的高质量实例（1-hop 到 4-hop），配套规则化的里程碑自动评测框架。</li>
<li><strong>一套造题的方法论</strong>：多智能体数据合成流程的完整代码，可自动合成训练任务。</li>
<li><strong>一个可扩展的训练环境</strong>：基于 Minecraft 的沙盒，既能当考场，也能当练兵场。</li>
</ul>
<h2>01 MineExplorer设计解密：让AI离开温室，走向动态世界</h2>
<p>MineExplorer 不再是简单的看图问答，而是围绕一系列创新，构建了一个前所未有的评测体系。</p>
<p><img src="https://p1.meituan.net/meituantechblog/3415508a98cf053008ffb59af0ed592a421327.png" alt="图1：MineExplorer自动化数据合成和评测范式简介"></p>
<h3>1.1 创新设计：构建一个动态开放的世界</h3>
<p><strong>创新点一：构建一个具备完整物理规则、会动态演化的世界</strong></p>
<p>MineExplorer不是让模型看一张 Minecraft 截图做选择题，模型面对的是一个实时运行的3D沙盒世界。在评测中，每个任务实例会运行1800个环境步，每步执行 0.1 秒，对应一段3分钟的连续交互视频。也就是说在这3分钟时间里，环境一直在变：模型每做一个动作，世界状态就更新一次，它必须根据最新的画面不断调整策略。</p>
<p><strong>创新点二：隐藏前置条件的长程多跳任务</strong></p>
<p>这是 MineExplorer 最核心的设计，我们把任务按「跳数（hop）」分级，代表完成最终目标需要经过的隐藏前置步骤数量：</p>
<ul>
<li><strong>简单任务</strong>：目标明确的单跳任务，智能体不需要根据场景和任务描述推理出隐式的子任务。</li>
<li><strong>困难任务</strong>：由2-4跳任务组成的多跳推理任务。最终目标虽然给出，但要完成它，必须先推理并完成若干<strong>没有在指令里说明</strong>的前置子任务。</li>
</ul>
<p>我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ)：q 是自然语言指令，s₀ 是初始状态，Gτ 是任务之间的<strong>依赖图（DAG）</strong>，Mτ 是规则化的里程碑检查器。关键在于：**指令 q 并不会枚举依赖图里的所有节点，智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难，意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。</p>
<p><img src="https://p0.meituan.net/meituantechblog/1466cfe7ae29ef6beadf4bf8920b61b9117170.png" alt="图2：任务难度分布图"></p>
<p><strong>创新点三：知识解耦——我们测的是「通用探索」，不是「背 Minecraft Wiki」</strong></p>
<p>这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务，我们用LLM裁判判断其主要依赖的是通用世界常识，还是Minecraft专有机制，并过滤掉后者。换句话说：<strong>我们测的不是「AI 会不会玩 Minecraft」，而是「AI 能不能在一个动态物理世界里自主探索」。</strong></p>
<p><img src="https://p0.meituan.net/meituantechblog/27b8c5c7b9f9ae530adf7db2b37ee0d9117398.png" alt="图3：领域知识过滤图"></p>
<h3>1.2 构建方法：一套可复用的多智能体数据合成范式</h3>
<p>构建高质量的长程任务基准本身就是难题。我们的解法是让一组各有分工的 AI 协作来造题。MineExplorer 用一个多智能体协作流程，五个专业 Agent 在一个群聊里协作，由一个 orchestrator 控制发言顺序：</p>
<p><img src="https://p0.meituan.net/meituantechblog/033d32b59d8891664d7de8ed0c836918946656.png" alt=""></p>
<p>整个流程分初始化和辩论（debate）两个阶段，先生成初稿，再由专家和验证器找出问题并修订。</p>
<p>如<strong>下表所示</strong>，人工评估结果显示，多智能体流程把有效率拉高了约 30 个百分点，质量分提升约 0.5 分，在最难的4-hop任务上优势尤其明显。最终，我们保留了 813 个通过人工验证的高质量复合任务实例。</p>
<p><img src="https://p1.meituan.net/meituantechblog/92d0dc21970ca1a40a0386789f5a5256194522.png" alt="表1：Benchmark质量人工评估表"></p>
<h3>1.3 能力覆盖：MineExplorer 到底在测什么？</h3>
<p>MineExplorer 借鉴 ReAct 范式，把开放世界探索拆解成三大能力维度，共 14 项细粒度能力：</p>
<ul>
<li><strong>感知（Perception）：</strong> 空间、时序、实体、状态、资源。</li>
<li><strong>推理（Reasoning）：</strong> 常识、因果、关系。</li>
<li><strong>行动（Action）：</strong> 移动、跳跃、采集、放置、合成、攻击。</li>
</ul>
<p><strong>如图所示</strong>，最终的基准在三大维度上都有充足的覆盖，其中空间感知、移动、采集等基础能力出现频率最高，常识推理、因果推理也占了相当比例。</p>
<p><img src="https://p0.meituan.net/meituantechblog/5606f102fc399d300f8531427a08c4ef91444.png" alt="图4：能力覆盖分布图"></p>
<h2>02 核心洞察：18款顶级大模型测试，为何集体“考砸”了？</h2>
<p>MineExplorer不仅定义了考题，更给出了18个顶级模型的真实分数。<strong>如下表所示</strong>，这是横跨 Claude、GPT、Gemini 等八大家族的模型在整体任务成功率（TSR）上的排行榜。</p>
<p><img src="https://p1.meituan.net/meituantechblog/baa9165aab4bae0826f1a4f22315881b960739.png" alt="表2：主体评测结果表"></p>
<p>我们发现，即便是表现最好的 Claude-Opus-4.6，整体成功率也只有 41 分。</p>
<p><strong>| 洞察一：单跳尚可，多跳崩盘——问题就在隐藏前置条件</strong></p>
<p>如图所示，最强模型Claude-Opus-4.6的表现，从1跳任务的77分，一路下滑到4跳任务的12分。每增加一层隐藏的前置依赖，模型就掉一个台阶。</p>
<p><img src="https://p0.meituan.net/meituantechblog/423b7c12487a277cac27bcafb215841f1105129.png" alt="表3：分级评测结果图"></p>
<p><img src="https://p1.meituan.net/meituantechblog/0fe66c8cd12e6acd4b3273cb6e8999dd227554.png" alt="图5：不同任务难度下的任务成功率对比图"></p>
<p><strong>| 洞察二：会看，但不会想 —— 感知强于推理</strong></p>
<p>在几乎所有被测模型上，我们都观察到同一个规律：<strong>感知分数 &gt; 行动分数 &gt; 推理分数</strong>。如下图所示，以Claude-Opus-4.6为例，其整体感知分61.91，推理分54.71。瓶颈不在于看不见，而在于看懂了却无法串联成有效策略。</p>
<p><img src="https://p0.meituan.net/meituantechblog/e552dbd0ed03151c3750b43d75ad37ba836166.png" alt="图6：维度评测热力图"></p>
<p><strong>| 洞察三：近60%的失败原因，都是因为走不到目标</strong></p>
<p>我们对 Claude-Opus-4.6 的失败案例进行了归因分析。<strong>如下图所示</strong>，导航失败是最大的错误来源，占比近 60%。</p>
<p><img src="https://p0.meituan.net/meituantechblog/0e685670220ce485c94a8a8f5468218f163985.png" alt="图7：失败类型分布图"></p>
<p><strong>| 洞察四：给它更多步数、更多记忆，都不是解药</strong></p>
<p>我们进一步做了消融实验，发现模型失败并非因为资源不足。</p>
<ul>
<li><strong>步数</strong>：如图所示，能解的任务，模型在早期就解出来了；解不了的，给到 1800 步上限照样解不了。</li>
</ul>
<p><img src="https://p1.meituan.net/meituantechblog/4db113c30a91462928af6b6e28521ad8620229.png" alt="图8：平均完成步数图"></p>
<ul>
<li><strong>记忆</strong>：如图所示，增加历史画面帧数到一定程度后，性能反而会下降，因为过期的观察会干扰对当前局面的判断。</li>
</ul>
<p><img src="https://p0.meituan.net/meituantechblog/3db3e8f4aeb4dfb68dce40379b0df7a9355836.png" alt="图9：记忆帧数影响图"></p>
<p><strong>核心结论：瓶颈不在资源，而在模型没法把已有的信息和当前世界状态对齐。</strong></p>
<h2>03 总结：从看见世界到探索世界的鸿沟</h2>
<p>MineExplorer 揭示了一个被乐观情绪掩盖的能力断层：当前的多模态大模型，已经具备了不错的感知力，但严重缺乏在动态世界中持续行动的探索力。</p>
<p>这对正在快速升温的具身智能赛道有几个直接的启示：</p>
<ul>
<li>感知层基本就绪，规划层是瓶颈。 模型能看懂环境，但把感知转化成长程、含隐藏前置的行动计划，才是从能看到能做之间真正的鸿沟。</li>
<li>行业需要更接近真实复杂度的评测标准。在受控场景里跑通一个单步指令，不足以宣布AI能行动了。真实世界是动态的，充满未说明的前置条件，需要持续、长久化的探索。</li>
<li>我们不仅提供了评测，还开源了自动合成任务的方法和训练环境。MineExplorer交付的不是一套静态题库，它还带着一整套自动合成长程任务的流程，和一个能直接拿来训练的Minecraft环境。评测、造题、训练，用的是同一套基础设施。</li>
</ul>
<p>我们不是要给具身智能泼冷水。恰恰相反，把瓶颈定位清楚，比盲目乐观更有价值。MineExplorer提供的，正是这样一条诚实、可量化的能力基线。</p>
<p>看得见世界，不代表能探索世界。在一个会变化的世界里持续推理、持续行动——这才是AI走向真实世界，必须先跨过的那道门槛。MineExplorer 已全面开源，欢迎各大模型前来挑战开放世界。</p>
<p><strong>🚀 开源链接</strong></p>
<ul>
<li>
<p><strong>Paper</strong>：<a href="https://arxiv.org/abs/2605.30931" target="_blank" rel="noopener noreferrer">https://arxiv.org/abs/2605.30931</a></p>
</li>
<li>
<p><strong>GitHub</strong>：<a href="https://github.com/meituan-longcat/MineExplorer" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/MineExplorer</a></p>
</li>
<li>
<p><strong>HuggingFace</strong>：<a href="https://huggingface.co/datasets/meituan-longcat/MineExplorer" target="_blank" rel="noopener noreferrer">https://huggingface.co/datasets/meituan-longcat/MineExplorer</a></p>
</li>
</ul>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/3415508a98cf053008ffb59af0ed592a421327.png" type="image/png"/>
    </item>
    <item>
      <title>正式开源！美团 LongCat-2.0 同步开放国产卡推理代码</title>
      <link>https://tech.meituan.com/2026/07/12/LongCat-2.0-Open-source.html</link>
      <guid>https://tech.meituan.com/2026/07/12/LongCat-2.0-Open-source.html</guid>
      <source url="https://tech.meituan.com/rss.xml">正式开源！美团 LongCat-2.0 同步开放国产卡推理代码</source>
      <description>美团 LongCat-2.0 总参数 1.6T，平均激活约 48B，为真实的 Agentic Coding 任务而生，架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding，提升长上下文处理效率与 Token 级表示能力的同时，结合动态激活进一步强化了代码理解、生成以及执行的表现。</description>
      <content:encoded><![CDATA[<p><strong>本周，美团万亿参数大模型 LongCat-2.0 正式开源！</strong></p>
<p><a href="https://huggingface.co/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">HuggingFace</a> | <a href="https://github.com/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">GitHub</a> | <a href="https://www.modelscope.cn/collections/meituan-longcat/LongCat-20" target="_blank" rel="noopener noreferrer">ModelScope</a></p>
<p>作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型，LongCat-2.0 已全面开源。<strong>针对显存与带宽受限的国产算力芯片，我们在模型架构、芯片适配到部署策略上进行了深度协同优化，让万亿参数模型在存量卡上同样跑得稳、跑得快。</strong> 我们希望以真实 Agentic Coding 任务中的稳定表现为依托，通过开源将模型能力与推理优化成果完整开放，盘活更多存量国产算力，释放国产算力生态的长期价值。</p>
<p>美团 LongCat-2.0 总参数 1.6T，平均激活约 48B，为真实的 Agentic Coding 任务而生，架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding，提升长上下文处理效率与 Token 级表示能力的同时，结合动态激活进一步强化了代码理解、生成以及执行的表现。</p>
<h2>01 模型、芯片适配与部署三个方向逐一突破，实现了万亿参数模型的流畅推理</h2>
<p>面对显存、带宽和互联的多重限制，LongCat-2.0 结合国产芯片特性，<strong>从模型、芯片适配与部署三个方向逐一突破，实现了万亿参数模型的流畅推理：</strong></p>
<ul>
<li>
<p><strong>模型层面：</strong> Attention 通过 absorb 计算模式、Indexer 与 MLA prolog 并行处理以及 KVP 切分 KV-cache，有效缓解了超长上下文的 I/O 与显存压力。ScMoE 则利用国产芯片的控核能力，让 Dense 与 MoE 分支实现物理核心级并行执行，进一步压缩端到端延迟，实现了百万上下文在国产芯片上的高效推理；</p>
</li>
<li>
<p><strong>芯片适配层面：</strong> 通过 Super Kernel 减少算子数量以降低启动开销，并以 Weight Prefetch 将 I/O 延迟隐藏在前序计算中；同时基于高速片间互联完成 layer-wise 的 KV-cache 传输，TP/SP/KVP 均在 scale-up 互联域内完成，在受限的显存和带宽条件下将硬件利用率最大化；</p>
</li>
<li>
<p><strong>部署策略层面：</strong> 采用 PD 分离部署兼顾 TTFT 与 TPOT：Prefill 端通过缩小 Expert-Parallel 域与序列并行分担长序列计算压力，Decode 端以 KV-cache 切分与高并行度降低单卡显存占用，配合异步化 Expert-Parallel Load Balancing 解决大 EP 度下的负载不均。上述并行方案均已适配 constrained decoding、multi-step scheduling 和 MTP 等推理优化特性，实现了万亿参数模型在国产算力上的稳定服务。</p>
</li>
</ul>
<p>LongCat-2.0 验证了国产芯片承载复杂大模型任务的成熟能力，并希望通过开源为行业提供一条可复现的技术路径，推动存量算力在真实场景中的应用价值。</p>
<h2>02 模型全面升级，会执行、会推理、懂交互</h2>
<p>LongCat-2.0 沿用了 LongCat-Flash 的整体设计，并围绕 LongCat-2.0 在长上下文、代码任务和智能体场景中的进一步升级，做了三项关键优化：</p>
<h3>2.1 LongCat 稀疏注意力机制，提升上下文处理效率</h3>
<p>面向智能体任务中的长输入场景，LongCat-2.0 引入 LongCat 稀疏注意力机制（LSA），通过流感知索引、跨层索引和层级化索引三项策略减少碎片化访存和重复索引计算，在保持模型质量的前提下，加速百万级长上下文的训练与推理。</p>
<p><img src="https://p1.meituan.net/meituantechblog/368b1cd0634db5c41b127242d8feee08118728.png" alt=""></p>
<h3>2.2 引入 N-gram Embedding，提升参数利用效率</h3>
<p>LongCat-2.0 在 MoE 专家之外引入 N-gram Embedding 作为新的参数扩展路径。在 MoE 稀疏度已接近 97% 的情况下，将 135B 参数投入 N-gram Embedding 的收益远超继续扩充专家。该模块占比控制在总参数 10% 以内，兼顾了参数收益与结构稳定性。</p>
<p><img src="https://p1.meituan.net/meituantechblog/84d46b968d89efb8fd1bb66d3005680c29580.png" alt=""></p>
<h3>2.3 通过 MOPD 架构在国产算力集群上无缝融合，让模型会执行、会推理、懂交互</h3>
<p>后训练阶段，LongCat-2.0 采用多教师在线蒸馏，将专家分为 Agent、推理和交互三类，分别聚焦自主执行、自适应推理和安全对齐等核心能力。最终通过 MOPD 架构在国产算力集群上无缝融合，使模型兼具深度推理、自主执行与精准交互的综合表现。</p>
<p><img src="https://p0.meituan.net/meituantechblog/7e5f64947ed21d4b1c24d3e94d855844154812.png" alt=""></p>
<h2>03 开源开放</h2>
<p>LongCat-2.0 的开源，是一次技术路径的公开，也是一次生态邀约。</p>
<p>本次开源同步提供 BF16、FP8 以及 INT8 等多精度版本，全面覆盖不同算力平台的部署需求。同时，我们深度拥抱开源社区，将针对国产算力极致优化的推理成果同步开源。这意味着，即使手上没有最新算力，也能基于现有硬件将 LongCat-2.0 稳定跑起来。</p>
<p>我们希望通过这套开箱即用的推理栈，让更多的国产卡包括老卡，都能流畅部署万亿大模型推理服务，在真实生产力场景发挥更大价值。</p>
<h3>🚀 开源链接</h3>
<p><strong>Tech Blog：</strong> <a href="https://longcat.ai/blog/longcat-2.0/" target="_blank" rel="noopener noreferrer">https://longcat.ai/blog/longcat-2.0/</a></p>
<p><strong>Model Weights：</strong></p>
<ul>
<li>HuggingFace: <a href="https://huggingface.co/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">https://huggingface.co/meituan-longcat/LongCat-2.0</a></li>
<li>GitHub: <a href="https://github.com/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/LongCat-2.0</a></li>
<li>ModelScope: <a href="https://www.modelscope.cn/collections/meituan-longcat/LongCat-20" target="_blank" rel="noopener noreferrer">https://www.modelscope.cn/collections/meituan-longcat/LongCat-20</a></li>
</ul>
<p><strong>Inference Code:</strong></p>
<ul>
<li>GPU: <a href="https://github.com/sgl-project/sglang/pull/30042" target="_blank" rel="noopener noreferrer">https://github.com/sgl-project/sglang/pull/30042</a></li>
<li>NPU: <a href="https://github.com/meituan-longcat/SGLang-FluentLLM/tree/npu" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/SGLang-FluentLLM/tree/npu</a></li>
</ul>
<p><strong>API Platform：</strong></p>
<ul>
<li><a href="https://longcat.chat/platform/product" target="_blank" rel="noopener noreferrer">https://longcat.chat/platform/product</a></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/368b1cd0634db5c41b127242d8feee08118728.png" type="image/png"/>
    </item>
    <item>
      <title>直播回放·含 ACL&amp;apos;26 杰出论文 | 美团 AI 顶会论文 32 篇精讲</title>
      <link>https://tech.meituan.com/2026/07/11/2026-meituan-32-papers.html</link>
      <guid>https://tech.meituan.com/2026/07/11/2026-meituan-32-papers.html</guid>
      <source url="https://tech.meituan.com/rss.xml">直播回放·含 ACL&amp;apos;26 杰出论文 | 美团 AI 顶会论文 32 篇精讲</source>
      <description>如果你正在关注 AI 前沿，这篇内容值得收藏。2026 年，美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇，进行了 5 大专场直播。</description>
      <content:encoded><![CDATA[<p>🏆 近日，ACL 2026 杰出论文奖在圣地亚哥揭晓，全球仅 18 篇入选，美团履约技术团队的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》上榜啦，一键直达视频回放👉🏻 <a href="https://www.xiaohongshu.com/discovery/item/6a3b54740000000006030031?source=webshare&amp;xhsshare=pc_web&amp;xsec_token=ABh2ziW0cX7XYIsQ1VpYHUl5aZzXTt2-o0yyamYge4z-4=&amp;xsec_source=pc_share" target="_blank" rel="noopener noreferrer">小红书</a> | <a href="https://www.bilibili.com/video/BV1v7jc6BENd/?spm_id_from=333.1387.upload.video_card.click&amp;vd_source=8dac43659650af56650d7a9bc5f083d3" target="_blank" rel="noopener noreferrer">B站</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/f434c8979e7670cd0402c7719141eb91178306.png" alt="图2"></p>
<p>如果你正在关注 AI 前沿，这篇内容值得收藏。</p>
<p>2026 年，美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇，进行了 5 大专场直播。</p>
<p>内容涵盖了大模型推理、智能体记忆与自进化、代码智能、多模态交互、超高清视频生成、本地生活搜索等方向——既有底层能力的突破，也有贴近生活服务的落地探索。</p>
<p>如果你错过了直播，或者想再看一遍👇 五场回放都在这里啦，找到你感兴趣的议题，随时开始。</p>
<p>特别感谢所有讲师与筹备团队的倾力支持！也感谢每一位关注美团技术成长的你！❤️</p>
<h2>专场一：ACL'26 综合专场</h2>
<p>👉 直播回放入口→ <a href="https://www.xiaohongshu.com/collection/item/6a4b729b0de8000000000001?xhsshare=CopyLink&amp;appuid=6a3262ca000000000f03b001&amp;apptime=1783330950&amp;share_id=e51dd478f4b34506aed7a49ca74b9113" target="_blank" rel="noopener noreferrer">小红书</a> ｜ <a href="https://space.bilibili.com/18937923/lists/8321546?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782776&amp;idx=3&amp;sn=77c72b469a871b499a46fe06be73225f&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/fe16b3191f6276cdf692c76bb2b04308356559.png" alt=""></p>
<h2>专场二：ACL'26 履约团队前沿技术专场</h2>
<p><strong>出品人｜</strong> Jichong Gao 美团高级技术专家、Jun Xu 美团高级技术专家</p>
<p>👉 直播回放入口→ <a href="https://www.xiaohongshu.com/collection/item/6a4b72d90de6000000000001?xhsshare=CopyLink&amp;appuid=6a3262ca000000000f03b001&amp;apptime=1783331038&amp;share_id=ca3358c821584b34a480efd8350ed035" target="_blank" rel="noopener noreferrer">小红书</a> ｜ <a href="https://space.bilibili.com/18937923/lists/8370607?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782810&amp;idx=2&amp;sn=aeb92a7c0c0bcf2befa7a201f1d4ece9&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/87835a72dafb62eb0c93a17fdab075ca674240.png" alt=""></p>
<h2>专场三：搜推 ASX 团队专场</h2>
<p><strong>出品人｜</strong> Guojun Yin 美团研究员</p>
<p>👉 直播回放入口→ <a href="https://www.xiaohongshu.com/collection/item/6a4b72f50e97000000000001?xhsshare=CopyLink&amp;appuid=6a3262ca000000000f03b001&amp;apptime=1783478239&amp;share_id=196398bf22d742bda21e83ee981f6615" target="_blank" rel="noopener noreferrer">小红书</a> ｜ <a href="https://space.bilibili.com/18937923/lists/8427999?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782896&amp;idx=2&amp;sn=ce2cb30b2d2b0e9ea12d03561124dd05&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/6498214ebe581bcea5541619c1cd145d359417.png" alt=""></p>
<h2>专场四：ICML'26 通用 Agent 前沿技术专场</h2>
<p><strong>出品人｜</strong> Qi Gu 美团研究员</p>
<p>👉 直播回放入口→ <a href="https://space.bilibili.com/18937923/lists/8471639?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782940&amp;idx=2&amp;sn=4456ee2f95bf8b1016981539d760253f&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/247700c227d0b4f4c7f88bb02adecdbe344171.png" alt=""></p>
<h2>专场五：ICML'26 综合专场</h2>
<p>👉 直播回放入口→ <a href="https://space.bilibili.com/18937923/lists/8485771?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782940&amp;idx=2&amp;sn=4456ee2f95bf8b1016981539d760253f&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/cbd47f8df818779808c61e614f6087f7351215.png" alt=""></p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/f434c8979e7670cd0402c7719141eb91178306.png" type="image/png"/>
    </item>
    <item>
      <title>美团 LongCat-2.0 正式发布：在国产算力集群上完成全流程训练与推理的万亿参数模型</title>
      <link>https://tech.meituan.com/2026/06/30/LongCat2.0.html</link>
      <guid>https://tech.meituan.com/2026/06/30/LongCat2.0.html</guid>
      <source url="https://tech.meituan.com/rss.xml">美团 LongCat-2.0 正式发布：在国产算力集群上完成全流程训练与推理的万亿参数模型</source>
      <description>作为业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型（总参数 1.6 T，平均激活约 48 B，动态范围 33B~56B），LongCat-2.0 从零开始预训练，原生支持 1M 超长上下文，其架构设计自始至终围绕一个核心目标：让模型在真实的 Agentic Coding 任务中，更高效、更稳定地完成代码理解、生成与执行。</description>
      <content:encoded><![CDATA[<p>6月30日，美团正式发布新一代万亿参数大模型 LongCat-2.0，并将对外开源。</p>
<p>作为<strong>业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型</strong>（总参数 1.6 T，平均激活约 48 B，动态范围 33B~56B），LongCat-2.0 从零开始预训练，原生支持 1M 超长上下文，其架构设计自始至终围绕一个核心目标：<strong>让模型在真实的 Agentic Coding 任务中，更高效、更稳定地完成代码理解、生成与执行</strong>。</p>
<p>正式版发布前，LongCat-2.0预览版本已通过 OpenRouter 平台和<a href="https://longcat.ai/" target="_blank" rel="noopener noreferrer">longcat.ai</a>面向全球开发者开放调用——截至目前该模型<strong>已跻身 OpenRouter 全球大模型调用量前三</strong>，月调用量在 Hermes、Claude Code 和 OpenClaw 分列全球第一、第二和第三位，<strong>成为最受全球 Agent 开发者欢迎的模型之一</strong>。</p>
<iframe frameborder="0" src="https://s3plus.meituan.net/ddfile/2026-06-30%2011_20_15.mp4" allowfullscreen="true" height="720" width="1280" style="display: block; margin: 0 auto;"></iframe>
<h2>01 国模国芯全栈协同：完成万亿参数 MoE 模型在国产算力上的稳定训练</h2>
<p>LongCat 团队对国产算力的探索始于 2023 年，三年来，团队从千卡起步，逐步攻克算子适配、通信优化、分布式稳定性等基础难题，最终在五万卡集群上完成万亿参数模型的全流程训练与推理。</p>
<p>LongCat-2.0 预训练数据规模超过30Ttokens，覆盖中文、英文、多语言和代码等多类数据；面对万卡级训练中的硬件故障、通信异常、显存压力与数值波动，LongCat 团队从<strong>稳定性、正确性和效率</strong>三方面攻克国产算力训练难题。</p>
<ul>
<li>在<strong>稳定性</strong>上，通过卡间通信异常处理、弹性扩缩卡和自动故障恢复，将月均日故障率降低70%以上；</li>
<li>在<strong>正确性</strong>上，通过自研设计确定性算子、Bitwise 一致性验证和参数检测，保障训练结果的可靠，同时基于实践提升关键模块计算精度、优化 Reduce 逻辑；</li>
<li>在<strong>效率</strong>上，通过流水线调度、显存优化和算子级控核，训练 MFU 提升 1.5 倍。</li>
</ul>
<p><strong>最终，LongCat 实现稳态日吞吐超过1T tokens/day，完成万亿参数 MoE 模型在国产算力上的稳定训练。</strong></p>
<p>在推理阶段，LongCat-2.0 围绕模型、算子和框架进行协同优化：通过大规模专家并行聚合访存带宽，支撑万亿参数 MoE 模型的低延迟解码；将零计算专家机制融入专家并行通信流程，使路由到零专家的 token 真正避免不必要的传输与计算；并针对通信、Attention、GEMM 等核心算子优化调度，结合提前下发与权重预取等框架机制，进一步降低推理链路中的等待开销。</p>
<p><strong>从稳定训练到低延迟推理，LongCat-2.0 验证了我们已具备在国产算力集群上进行大规模模型训练的能力。它不只是“能训出”万亿参数模型，还让万亿参数模型能够在真实任务中稳定运行。</strong></p>
<h2>02 让模型在真实 Agentic Coding 任务中更高效、更稳定地完成代码理解、生成与执行</h2>
<p>LongCat-2.0 的架构设计始终围绕一个核心目标：<strong>让模型在真实 Agentic Coding 任务中更高效、更稳定地完成代码理解、生成与执行</strong>。</p>
<p><strong>1M超长上下文，让 Agent 看见整个项目。传统模型在处理超过 100K 上下文后就开始“遗忘”前面的内容</strong>。LongCat-2.0 采用<strong>LongCat Sparse Attention（LSA）稀疏注意力机制</strong>，在处理长文本时不再“逐字逐句地看”，而是智能筛选关键信息，将计算量从平方级降至线性级。这使得模型在 100 万 Token 的超长上下文中，依然保持精准的信息定位与理解能力。</p>
<p><strong>零计算专家 + ScMoE，让算力用在刀刃上</strong>。代码任务中不同 token 复杂度差异巨大——定义变量名和推导递归算法对算力的需求完全不同。LongCat-2.0 通过零计算专家实现 token 级动态激活（33B~56B），简单 token 不消耗算力，复杂 token 自动获得更多计算资源。</p>
<p><strong>MOPD 多专家融合，一个模型同时擅长写代码、做推理、懂交互</strong>。LongCat-2.0 通过 MOPD 架构融合 Agent、Reasoning、Interaction 三组专家能力——Agent Experts 专攻工具调用与自主纠错，Reasoning Experts 深耕数学与 STEM 推理，Interaction Experts 优化指令遵循与交互体验。推理时由门控网络根据任务类型动态调度最擅长的专家，而非简单合并参数。得益于此，模型在编程、推理、交互等维度均表现突出。</p>
<p><strong>LongCat-2.0 通过精细的架构设计，让万亿参数模型在实际任务中更高效、更稳定地发挥能力。</strong></p>
<p><img src="https://p1.meituan.net/meituantechblog/ef19600fdb0e6868a3574c4a8c7ff746220482.png" alt=""></p>
<h2>03 在编程能力、真实办公场景的复杂任务处理方面表现优异</h2>
<p>综合评测结果显示，LongCat-2.0 凭借卓越的综合性能与稳定的任务表现，<strong>在 Code 和 General Agent 场景表现优异</strong>。</p>
<p><img src="https://p0.meituan.net/meituantechblog/9d8da6909183ad1a8e591186849c0947457784.png" alt=""></p>
<ul>
<li><strong>在编程能力方面</strong>，LongCat-2.0 展现出扎实的综合实力：在考察深层工程能力的 SWE-bench Pro 中获得 59.5，领先Gemini 3.1 Pro（54.2）、GPT-5.5（58.6）和 Claude Opus 4.6（57.3）；在 SWE-bench Multilingual 中取得 77.3 的成绩，与 Claude Opus 4.6（77.8）保持在同一水位；此外，在真实终端指令交互评测 Terminal-Bench 2.1 中取得 70.8，体现了其在真实运维与开发终端任务中的稳定执行与纠错能力。</li>
<li><strong>在真实办公场景的复杂任务处理方面</strong>，LongCat-2.0 表现均衡：在搜索智能体评测集RWSearch中获得 78.8，在生产力场景评测集 FORTE 中获得 73.2 ，在 BrowseComp 中获得 79.9，均达到或接近前沿闭源模型水平，证明了其在多步骤任务规划、复杂工具调用及长程检索执行上的高可靠性，能够较好的契合企业级 Agent 的落地需求。</li>
</ul>
<h2>04 在真实工作场景中，成为大家可靠的“工作伙伴”</h2>
<p>内测期间，我们面向真实工作场景征集了大量真实的用户任务需求，这些来自一线的真实“工作单”，可以看出 LongCat-2.0 在用户的真实工作场景中正在成为他们可靠的“工作伙伴”。</p>
<p><strong>Agent 搭建：一问即得，全闭环交付</strong></p>
<p>通过 LongCat-2.0 搭建的 AI SQL Agent，业务人员可以直接用自然语言查询数据。LongCat-2.0 自动完成全链路闭环——理解问题意图、规划查询步骤，并将数据结果转化为清晰的业务洞察。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>代码库迁移：读懂老代码，重构新架构</strong></p>
<p>给 LongCat-2.0 一个旧版插件代码库和一份新版SDK文档，它能自行分析整体架构、梳理核心逻辑，再将整个插件重构为符合新API的实现——保留全部原有功能，修复潜在隐患，编译一次通过。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>完整应用开发：从一句话到可运行产品</strong></p>
<p>描述一个“儿童AI游戏训练场”的创意，LongCat-2.0 会逐步生成技术选型、页面架构、游戏逻辑与视觉细节——从首页到三个完整可玩的游戏页面，全部代码一次产出，开箱即用。从一句话到可用的产品，将灵感轻松实现。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>3D交互演示：一句话，生成一个3D世界</strong></p>
<p>通过一句话描述，LongCat-2.0 即可生成完整 Three.js 3D 演示：透明烧瓶、荧光液体、泡沫喷发、液面下降和堆积效果全部可交互呈现。所有代码封装在一个 HTML 文件中，打开即用，让创意快速转化为可交互的3D体验。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>AI 小说工厂：从单点灵感到商业变现</strong></p>
<p>基于 LongCat-2.0 构建的“AI小说工厂”，将创意写作升级为自动化内容流水线。用户输入灵感后，系统编排多个 Agent，自动完成世界观构建、并行章节生成、质量评估与回流修订。并通过长上下文能力保障百万字级设定一致性。最终内容可自动适配多平台发布，并由 Web 面板实时监控生成进度与质量状态，实现持续稳定的连载输出。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>立即体验</strong></p>
<ul>
<li><strong>API 开放平台：<a href="https://longcat.chat/platform/product" target="_blank" rel="noopener noreferrer">https://longcat.chat/platform/product</a></strong></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/ef19600fdb0e6868a3574c4a8c7ff746220482.png" type="image/png"/>
    </item>
    <item>
      <title>ICML 2026 | 美团技术团队学术论文精选</title>
      <link>https://tech.meituan.com/2026/06/29/ICML-2026.html</link>
      <guid>https://tech.meituan.com/2026/06/29/ICML-2026.html</guid>
      <source url="https://tech.meituan.com/rss.xml">ICML 2026 | 美团技术团队学术论文精选</source>
      <description>ICML是机器学习领域最具影响力的国际顶级学术会议之一。大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题，并通过征集和评估具有重要理论价值和实际影响的前沿研究成果，推动领域发展并引领未来研究方向。</description>
      <content:encoded><![CDATA[<p>ICML（International Conference on Machine Learning，国际机器学习大会）是机器学习领域最具影响力的国际顶级学术会议之一。大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题，并通过征集和评估具有重要理论价值和实际影响的前沿研究成果，推动领域发展并引领未来研究方向。2026年，ICML共收到全球篇论文23918投稿，最终6352篇被接收，接收率约为26.6%。本文解读了美团技术团队被收录的13篇论文，覆盖智能体推理、强化学习训练、复杂任务生成、智能体基准测试、监督微调等技术方向。</p>
<h2>01 MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning</h2>
<p><strong>MemOCR：面向高效长程推理的版面感知视觉记忆机制</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2601.21468" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/53ce71427cc5fb26c883af36a738b10569202.webp" alt=""></p>
<p><strong>论文简介</strong>：长时间跨度的智能体推理需要将不断增长的交互历史有效压缩到有限的上下文窗口中。现有的大多数记忆系统将历史序列化为文本，其中token级别的开销是均匀的，且与长度线性增长。为此，我们提出了MemOCR，一种多模态记忆智能体，通过视觉布局实现自适应信息密度的记忆空间分配，从而在紧张的上下文预算下提升长时间跨度推理能力。在长上下文多跳和单跳问答基准测试中，MemOCR优于强文本基线方法，并在极端预算条件下实现了更有效的上下文利用。</p>
<h2>02 ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training</h2>
<p><strong>ScaleEnv: 从零开始构建可扩展的环境合成系统用于通用交互式工具使用智能体的训练</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.06820" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/ccceeac77d665e5ffea65436222decc7118744.webp" alt=""></p>
<p><strong>论文简介</strong>：为智能体配备交互式环境和可验证任务以进行自我探索，对于培养能够适应多样化场景的通用智能体至关重要。我们提出了ScaleEnv，一个完全从零开始构建全交互式环境和可验证任务的框架。ScaleEnv通过程序化测试确保环境的可靠性，通过工具依赖图扩展和可执行动作验证来保证任务的完整性和可解性。在未见过的多轮工具使用基准测试上展示了显著的性能提升，突显了强大的泛化能力。</p>
<h2>03 V_0: A Generalist Value Model for Any Policy at State Zero</h2>
<p><strong>V_0：一种适用于任意策略在初始状态下的通用价值模型</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.03584" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/78419c635c8bc694f07882566afb116176626.webp" alt=""></p>
<p><strong>论文简介</strong>：大语言模型的强化学习训练中的价值模型面临耦合困境：它们需要与更新中的策略同步训练。我们提出了V_0，一种通用价值模型，通过将任务重新定义为上下文学习来预测未见策略的性能，从而将价值估计与特定策略参数解耦。实验结果表明，V_0在GRPO训练过程中追踪策略演化方面优于耦合价值模型，能够优化冷启动预算分配，并在推理路由中逼近性能-成本的帕累托前沿。</p>
<h2>04 Learning to Self-Verify Makes Language Models Better Reasoners</h2>
<p><strong>学习自我验证使语言模型成为更好的推理者</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.07594" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/75add83935b72c67529dc96ae4b6a9b268520.webp" alt=""></p>
<p><strong>论文简介</strong>：近期的大语言模型在为复杂任务生成有前景的推理路径方面表现出色，但在验证自身答案方面仍然薄弱。我们发现学习自我验证能够有效提升生成性能，产生更高效的推理轨迹。我们提出了一个多任务强化学习框架，将生成和自我验证作为两个独立但互补的目标进行联合优化。实验表明，该方法在生成和验证能力上均优于仅进行生成训练的方法。</p>
<h2>05 AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition</h2>
<p><strong>AgentNoiseBench：噪声条件下工具使用型大语言模型智能体的鲁棒性基准评测</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2602.11348" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/31e3e86e970c5c79e9b4d762b09326dd118430.webp" alt=""></p>
<p><strong>论文简介</strong>：随着基于大语言模型的智能体越来越多地部署在实际工作流程中，现有的智能体基准测试不足以刻画智能体在不完美用户指令和不可靠工具反馈下的鲁棒性。我们提出了AgentNoiseBench，一个用于系统评估大语言模型智能体交互式噪声鲁棒性的框架。该基准建模了用户侧指令噪声和工具侧结果噪声两种主要噪声来源，提供模块化噪声注入管道和多维度评估指标。通过对25个工具使用模型的评估，发现工具侧噪声通常比用户侧噪声引起更大幅度的性能下降。</p>
<h2>06 AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation</h2>
<p><strong>AJ-Bench：面向环境感知评估的智能体裁判基准</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2604.18240" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/2b3544e8ab174ad18492a3a6c98ed6b9127010.webp" alt=""></p>
<p><strong>论文简介</strong>：随着强化学习不断推动基于大语言模型的智能体训练规模化，在复杂环境中可靠地验证智能体行为变得日益困难。现有方法依赖基于规则的验证器或 LLM-as-a-Judge 模型，但这些方法难以泛化到狭窄领域之外。Agent-as-a-Judge 通过主动与环境和工具交互以获取可验证的证据来解决这一局限性，但其能力仍未得到充分探索。 我们提出了一个基准测试 AJ-Bench，用于系统性地评估"智能体充当评判者"在三个领域——搜索、数据系统和图形用户界面——中的表现，涵盖155个任务和516条标注轨迹。该基准全面评估了评判智能体在信息获取、状态验证和过程验证方面的能力。实验表明，相比 LLM-as-a-Judge 基线方法，该方法取得了稳定的性能提升，同时也揭示了基于智能体的验证中仍存在的重大开放性挑战。</p>
<h2>07 LUVE : Latent-Cascaded Ultra-High-Resolution Video Generation with Dual Frequency Experts</h2>
<p><strong>LUVE：基于双频率专家的潜空间级联超高分辨率视频生成</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.11564" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/adcdda2e2386d052a06f76362ffc24df164210.webp" alt=""></p>
<p><strong>论文简介</strong>：为解决超高分辨率视频生成中连贯性与算力难以兼顾的难题，该论文提出了基于双频专家的潜空间级联框架LUVE。该框架创新性地采用三阶段架构：先通过低分辨率生成保障运动一致性；接着利用潜空间上采样直接提升分辨率，大幅降低内存与计算开销；最后融合高低频专家细化高分辨内容，全面增强全局语义与局部细节。实验表明，LUVE展现出了卓越的逼真度与内容保真度，其核心思想现已成功应用于美团LongCat-Video模型中。</p>
<h2>08 Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory</h2>
<p><strong>Infinite-World：通过无位姿层次化记忆将交互式世界模型扩展至1000帧</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.02393" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/7e37532eff0ab36936a1b9cd21f869e7119212.webp" alt=""></p>
<p><strong>论文简介</strong>：Infinite-World 是面向真实场景中的长程交互式世界模型，其目标是在 1000+ 帧生成中保持稳定的视觉记忆和动作响应。针对真实视频中位姿噪声大、视角回访稀少的问题，论文提出三点创新：用无位姿层级记忆压缩器将历史 latent 压缩为固定预算记忆，降低长程建模成本；用不确定性感知动作标注提升噪声轨迹下的动作学习；再通过高回访数据微调增强 loop closure 能力。整体上，它让世界模型更适合从真实视频学习长时空一致性。</p>
<h2>09 WildActor: Unconstrained Identity-Preserving Video Generation</h2>
<p><strong>WildActor：无约束身份保持视频生成</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2603.00586" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/24933777ccb49e8a29a709b287221cd8309446.webp" alt=""></p>
<p><strong>论文简介</strong>：本文提出 WildActor，一种面向无约束身份保留的视频生成新框架，旨在应对现有方法在动态长镜头和视角剧烈切换时面临的全身体态不一致、面部漂移及姿态僵死伪影。在机制层面，WildActor 构建了含1.6M视频和18M多视角图像的大规模数据集 Actor-18M，有效解决原始数据中的正脸偏置；同时引入非对称身份保留注意力（AIPA）解耦身份与运动生成，并结合身份感知3D旋转位置编码（I-ROPE）显式分离时空 Token，配合视角自适应蒙特卡洛采样实现了鲁棒的任意视角条件控制。实验表明，WildActor 在新构建的 Actor-Bench 连贯叙事与泛化测试中，不仅全身一致性与文本对齐度显著超越现有开源及商业大模型，还验证了其在复杂现实场景下保持物理恒常性的优越性。</p>
<h2>10 Navigating the Pareto Frontier of Alignment: Spectrum-Adaptive Fine-Tuning for LLMs</h2>
<p><strong>SAFT：面向大语言模型的谱自适应微调方法</strong></p>
<p><strong>论文下载</strong>：<a href="https://github.com/sjtu-scx/SAFT/blob/main/SAFT.pdf" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/f7b88b332a240ef7176c970b7c6879cd170832.webp" alt=""></p>
<p><strong>论文简介</strong>：监督微调常用交叉熵作为目标函数，虽然学习高效，但它并非正确率的光滑近似，还会因为特别关注预测概率低的样本从而容易对噪音过度拟合并过度自信。DFT则在梯度层面等同优化正确率的光滑近似函数，在保持训推一致性的同时提升了鲁棒性，但也会削弱对可学习的难样本的学习效率。因此，SFT 与 DFT 构成效率—鲁棒性两个端点，而真实数据应选择哪种折中取决于其未知的内在 SNR。我们提出轻量的 pre-test protocol：用少量训练数据分别训练 SFT/DFT 并在验证集比较表现，SFT 更优则判定为高 SNR 并选择几何插值Geo-SAFT，DFT 更优则判定为低 SNR 并选择调和插值Har-SAFT。相比仍保留低置信梯度发散的线性插值，SAFT 通过数据自适应的几何/调和非线性插值匹配不同噪声 regime，从而获得更优的鲁棒性—效率 Pareto trade-off。</p>
<h2>11 TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios</h2>
<p><strong>TRIP-Bench：真实场景中长时域交互式智能体的基准评测</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2602.01675" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/99f9fc23599da395c9ace3cba6c7d90787516.webp" alt=""></p>
<p><strong>论文简介</strong>：本论文提出了 TRIP-Bench，一个面向长程交互式 Agent 的旅行规划评测基准。它基于真实世界数据构建，包含 18 个工具和 40 多类旅行约束，重点考察模型在多轮对话中保持全局约束、调用工具、处理用户需求变化和方案反复修改的能力。其困难任务最长可达 15 轮用户交互、150 次以上工具调用，甚至超过 20 万 tokens 上下文。实验表明，现有先进模型在该基准上仍表现有限。论文进一步提出 GTPO 多轮强化学习方法，通过奖励归一化和轮次级奖励差分提升模型鲁棒性，使 Qwen2.5-32B-Instruct 在评测中超过 Gemini-3-Pro。</p>
<h2>12 InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution</h2>
<p><strong>InfVSR：面向一致性驱动的流式生成视频超分辨率</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2510.00948" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/8120868b5fc25080dc2c2986f2323c5468146.webp" alt=""></p>
<p><strong>论文简介</strong>：本文提出了 InfVSR，一种面向一致性驱动的流式生成视频超分辨率新框架，旨在解决扩散式视频超分方法在长视频场景中存在的推理效率低、显存占用大和时序不一致问题。其核心机制包括：将预训练视频 DiT 改为因果流式架构，引入滚动 KV 缓存以维持局部过渡平滑性；设计联合视觉引导通过交叉注意力注入全局语义锚点，抑制累积误差漂移。训练阶段结合分块像素监督与跨块分布匹配，双重约束时序一致性，并将扩散过程蒸馏为高效单步推理。实验表明，InfVSR 在多项基准上取得 SOTA 性能，时序一致性显著领先，推理速度提升 58 倍且长序列显存占用恒定。</p>
<h2>13 DRIVE: Distributional and Retrieval-Augmented Bidding with Value Evaluation</h2>
<p><strong>DRIVE</strong>：基于混合分布与检索增强的价值评估出价策略</p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2606.14192" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/3c5da2f5bb1f05cb0e55acd180e633f544634.webp" alt=""></p>
<p><strong>论文简介</strong>：针对标准Decision Transformer (DT)在复杂竞价环境中的三大痛点（“平均动作”陷阱、长尾幻觉、缺乏推理优化），提出“生成—检索—评估”闭环框架：1）用高斯混合模型替代确定性输出，解决多模态策略坍缩问题；2）引入检索机制增强长尾场景记忆，避免参数化模型幻觉；3）通过IQL Critic实现闭环择优，对生成动作与历史动作进行实时评估。该方案显著提升决策鲁棒性。</p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/53ce71427cc5fb26c883af36a738b10569202.webp" type="image/webp"/>
    </item>
  </channel>
</rss>