<?xml version="1.0" encoding="utf-8"?><?xml-stylesheet type="text/xsl" href="https://tech.meituan.com/rss.xsl"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <atom:link href="https://tech.meituan.com/rss.xml" rel="self" type="application/rss+xml"/>
    <title>美团 · 技术团队</title>
    <link>https://tech.meituan.com/</link>
    <description>美团技术团队|前端|后端|IOS|安卓|客户端</description>
    <language>zh-CN</language>
    <pubDate>Mon, 10 Aug 2026 06:13:20 GMT</pubDate>
    <lastBuildDate>Mon, 10 Aug 2026 06:13:20 GMT</lastBuildDate>
    <generator>@vuepress/plugin-feed</generator>
    <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
    <item>
      <title>Agent评测漫谈 —— 由浅入深讲解Agent评测</title>
      <link>https://tech.meituan.com/2026/08/07/Agent-Evaluation.html</link>
      <guid>https://tech.meituan.com/2026/08/07/Agent-Evaluation.html</guid>
      <source url="https://tech.meituan.com/rss.xml">Agent评测漫谈 —— 由浅入深讲解Agent评测</source>
      <description>本篇博客是一篇科普文章，由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么，以及如何建立评测体系；其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验，是我们在两年实践过程中逐步打磨出来的认知。</description>
      <content:encoded><![CDATA[<p>本篇博客是一篇科普文章，由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么，以及如何建立评测体系；其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验，是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。</p>
<p>本篇博客在美团内部发表之后获得了较多的关注，我们发现大家对Agent评测的热情非常高，因此我们决定将内部博客进行公开，想把这些经验分享给更多的同学，希望对大家有所启发或帮助。</p>
<h2>一、Agent评测是什么</h2>
<h3>1.1 评测的核心目的</h3>
<p>评测的核心目的是为了回答 <strong>Agent 的好不好？以及到底哪里好，哪里不好？</strong> 从而为下一轮迭代指明方向。评测是Agent效果的“精密量具”。</p>
<p>这也是为什么 Agent 评测不能只停留在离线打榜，更不能只看某次 Demo 的表现。它必须服务于真实业务中的研发、上线、回归、优化和规模化落地。</p>
<p>而Agent评测的基石是观测，因此我们得出了Agent研发公式 —— 观测 + 评测 = 持续迭代</p>
<h3>1.2 Agent评测与传统模型评测的不同</h3>
<p>评测方法会随着 AI 形态变化而变化，大致经历了三个阶段：</p>
<p><img src="https://p0.meituan.net/meituantechblog/5a8954c2e7b681ee8fb8d2c8a73868cd157865.png" alt=""></p>
<p>传统机器学习更像在回答“算得准不准”。 大模型评测开始回答“模型能力强不强”。 而 Agent 评测真正要回答的是：</p>
<blockquote>
<p>当模型被放进一个真实系统里，和 Prompt、Skill、工具链、记忆、状态管理、业务流程耦合在一起后，它能不能稳定交付好的结果。</p>
</blockquote>
<p>这意味着 Agent 的评测对象已经不再是单一模型，而是一个“模型 + 系统 + 工具 + 流程”的复杂系统。</p>
<h3>1.3 为什么Agent评测不是只看结果，还要看行为和过程</h3>
<p>在真实场景中，两个 Agent 可能最终都“做对了”，但工程价值完全不同：</p>
<ul>
<li>一个路径清晰、工具调用稳定、耗时可控、可重复复现</li>
<li>一个反复试错、路径混乱、靠偶然命中结果、不可复现</li>
</ul>
<p>如果只看最终答案，这两者会被误判为同一水平；但从规模化、成本优化、用户体验的角度看，差别非常大。</p>
<p>因此，Agent 评测至少需要覆盖四层内容：</p>
<ul>
<li><strong>结果层</strong>：任务是否完成，输出是否可用</li>
<li><strong>过程层</strong>：规划是否合理，步骤是否稳定</li>
<li><strong>效率层</strong>：耗时、Token、工具调用次数是否可接受</li>
<li><strong>风险层（安全层）</strong>：是否越权、是否误操作、是否存在安全隐患</li>
</ul>
<p>从这个意义上讲，自2023年GPT爆火以来，Agent发展从ChatBot形态快速发展至ClaudCode、OpenClaw这样的多功能长程Agent，Agent能力日渐强大，Agent评测正在从“答案评测”走向“行为评测”。</p>
<h3>1.4 为什么说观测是评测的基石</h3>
<p>有一个朴素的认知：Agent 属于广义的 SaaS 层，大模型赋予Agent泛化能力但也带出随机性的问题，而用户仍旧期望得到一个稳定可靠的智能体。为了弥合“随机性”与“可靠性”之间的鸿沟，我们必须回归工程视角看待Agent —— <strong>看不见的问题，几乎不可能被稳定解决</strong>。</p>
<p>Agent 的一次执行通常包含如下链路：</p>
<p><img src="https://p0.meituan.net/meituantechblog/6a9ba42edcd2f8bd0ec7d23d4983147a257714.png" alt=""></p>
<p>只要其中任意一层出问题，最终效果都可能劣化。为了结果稳定，我们需要过程稳定。但如果日志系统只能看到“用户说了什么”和“最后回复了什么”，就几乎无法判断问题根因。正是基于“<strong>我想看Case却发现没打日志</strong>”这个朴素的问题，工业界发展出了 Trace 系统，将黑盒内部的逻辑推理过程进行全路径的披露，将所有影响模型输出的输入信息都记录下来。</p>
<p>对 Agent 的每一个“隐形动作”进行精准观测，是实现从“概率性生成”向“工业级可靠性”跨越的必由之路。</p>
<h3>1.5 小结：Trajectory Evaluation 与 Response Evaluation</h3>
<p>经过前文的论述，我们知道Agent评测本质是在回答好不好，为迭代指明方向。而Agent评测本身既要关注结果（Response）也要关注过程（Trace或者叫做Trajectory）。</p>
<h2>二、评测的核心方法论</h2>
<h3>2.1 评测体系的核心不是堆指标，而是搭桥</h3>
<p>有的同学会好奇，为什么一定要“搭桥”？这是因为Agent评测体系必须追求业务价值与评测指标之间的解释性。而Agent 评测的难点之一，是模型能力指标和业务结果指标之间有天然鸿沟。</p>
<p><img src="https://p0.meituan.net/meituantechblog/0791bdb6ec11d84dfcc4a4b667164383100037.png" alt=""></p>
<p>这两类指标不能直接映射，中间必须有一层面向任务系统的桥梁指标。我们提供一种分层思路如下：</p>
<p><img src="https://p0.meituan.net/meituantechblog/fa88ffeb3556e0e8d6b2f12e8e2dbf6b146404.png" alt=""></p>
<p>以 AI 搜索为例，业务可能关心DAU、留存和点击；搜索系统本身关心召回率和点击率；Agent 层则关心意图识别是否准确、检索是否有效、结果整合是否可信。</p>
<p>只有把这些层次串起来，才能真正回答“为什么业务指标变差”以及“模型能力提升为什么没有带来业务收益”。这件事必须依赖真正懂业务流程的人来共同建立指标体系。</p>
<h3>2.2 客观评测与主观评测并行</h3>
<p>经过第一章的介绍，我们知道，Agent的核心目标就是要稳定地交付好的结果。行业内 Agent 评测大量借鉴了大模型评测的方法论，总体上可以拆成客观评测和主观评测：</p>
<p><img src="https://p0.meituan.net/meituantechblog/728970da126530ee8541775cac60508c277172.png" alt=""></p>
<p>因此更现实的做法通常是：</p>
<ul>
<li>用客观评测覆盖高频、结构化、可规则化的部分</li>
<li>用主观评测覆盖开放性、高价值、复杂业务场景</li>
<li>用主观评测校准客观评测和 AI 评测，再把规模化部分交给自动化系统</li>
</ul>
<h3>2.3 使用“人人一致、人机一致”的方法论对齐主观评测</h3>
<p>“好不好”是一个主观问题，主观的标准需要对齐，否则我们不能确定某次迭代之后，到底是指标的抖动带来的提升还是真实的效果提升。</p>
<p>在评测实践中，真正困难的不是“没有人会评”，而是“不同的人评得不一样，机器和人评得也不一样”。在过去一年，我们图灵团队深度BP业务方的过程中，我们发现多个团队相继踩入了相同的坑。</p>
<p>图灵评测积累的关键认知可以概括为“人人对齐和人机对齐”，具体如下：</p>
<ul>
<li><strong>人人一致</strong>：1个“独裁者”好过10个“民主者”。需要一位强有力的角色，拉齐产品、运营、研发、QA的评测标准，遵循同一套评测体系，避免大家各自为政。不同评测员通过背靠背标注的方法拉齐标准。</li>
</ul>
<p><img src="https://p0.meituan.net/meituantechblog/c8424009679d2ecc1b00466290ebc522589569.png" alt=""></p>
<ul>
<li><strong>人机一致</strong>：机器评测结果与人工评测结果保持一致，否则不置信。人机一致的意义在于规模化提效，以应对更大的业务流量。</li>
</ul>
<p>具体如何进行对齐呢？最佳实践是把模糊指标下钻成更细的评测Rubric（或者叫评测维度：学界关于评测维度dimension和评测规则rubric的说法尚未统一，我们这里与开源项目Arize AI对齐），再把每个Rubric尽可能二元化。具体如下：</p>
<ul>
<li><strong>指标下钻</strong>：把“大而模糊”的概念下钻拆解成多个清晰维度</li>
<li><strong>Rubric 二元化</strong>：把打分规则尽量收敛成是/否/未知、0/1/unknown</li>
<li><strong>持续迭代</strong>：用 unknown 占比来反查 Rubric 是否定义合理，直到单条 Rubric 的人人一致率、人机一致率达到可信阈值（例如85%、90%）</li>
</ul>
<p>这种拆解法的价值在于：从“主观的模糊感受”转向“可判断的事实依据”，用下钻降低模糊度，从而降低人与人之间、人与机器之间的分歧。应用这套方法，数字站长的人机一致率可以达到99%。Beam以图灵的二元化方案改造评测体系，人机一致率从62%提升到92%。</p>
<p>下面我们分享两个案例。</p>
<p>案例一：如何评价初中生作文的好坏？（满分40分）</p>
<p><img src="https://p0.meituan.net/meituantechblog/bcd654d41d8dc247cafa5648750234fc123958.png" alt=""></p>
<p>案例二：以骑手外呼场景模型回复是否“口语化”举例</p>
<p>经典错误示范 —— 请判断大模型的回答是否口语化，并按照0到10分打分。</p>
<p>下钻与二元化之后的改进版：</p>
<ul>
<li>模型是否以您指代骑手；</li>
<li>模型是否使用“甭客气”，“明儿见”等非官方文书的口语交流词汇；</li>
<li>模型输出是否包含“吧”，“呢”，“那个”等语气词汇。</li>
</ul>
<p>补充：标注和评测的关系是什么？</p>
<p>其中，标注是一种动作，而评测是一套目标导向的判断流程。机器预标注可以帮助人工提效，但只有在人机一致率保障才能称为自动化评测，否则只是机器标注。</p>
<h3>2.4 Agent评测是一门实践科学</h3>
<p>从执行链路看，Agent 评测可以被拆成五个关键环节，</p>
<ul>
<li><strong>采集</strong>：采集线上或沙箱中的原始任务数据</li>
<li><strong>清洗</strong>：去重、归类、补上下文、修复脏数据</li>
<li><strong>评测</strong>：人工评测、AI 评测</li>
<li><strong>质检</strong>：检查评测标准是否稳定、评测结果是否可信</li>
<li><strong>分析/归因</strong>：定位问题归因，形成优化建议和回归任务</li>
</ul>
<p>这5个环节与线上AB、持续观测共同构成了Agent迭代的数据飞轮。</p>
<p>绝大部分新上手Agent评测团队都有一个误区 —— 多方调研总结设计一个复杂精妙的评测指标体系，而越复杂的指标越难以执行和对齐。</p>
<p>而Agent评测是一门实践科学。<strong>起步阶段“让数据飞轮高效运转起来”的意义远大于“设计一个复杂精妙的评测体系”。评测体系的建立不是一蹴而就的，而是依靠 Good Case 和 Bad Case 喂养的</strong>。</p>
<p>因此 ，Agent 评测指标体系的搭建最佳实践路径如下：</p>
<ul>
<li>从高频核心场景起步，先定义少量关键指标</li>
<li>从生产环境中收集 Bad Case</li>
<li>沉淀高质量 Good Case，明确什么叫“好”</li>
<li>把 Good/Bad Case 转成标准评测样本</li>
<li>用评测结果反哺 Prompt、Skill、策略和模型优化等等</li>
<li>再从新的线上表现里持续抽样，形成下一轮迭代</li>
</ul>
<p>其中，Bad Case 的价值往往更高，因为它最容易暴露能力边界和系统短板；而 Good Case 的作用则是帮助团队定义高质量完成的范式。</p>
<p>一个成熟的评测团队，核心能力不是一开始就搭出完美系统，而是能把线上问题、失败样本、模糊反馈不断转化成结构化评测资产。我们通过Bad Case和Good Case修正评测体系的目标，逐步修正“独裁者”与真实目标之间的负面偏差。例如履约数字站长业务，项目启动之处只有20多个评测指标，而经历1年时间推全之后，我们扩展到了近200个指标。</p>
<h3>2.5 专家知识补充模型能力在垂域场景的不足</h3>
<p>从GPT 3.5发布至今，虽然基座能力发生了天翻地覆的变化，但是模型能力终究不是万能的。在过去三年的Agent实践中，我们遇到过大量脱离实际的“许愿式”需求。我们要知道模型是训练出来的，模型本身拟合了Token的概率分布，即便在大规模参数下会产生能力的“涌现”，但模型能力的提升依旧强依赖语料的输入，尤其是高质量语料的输入。无论是早期的RLHF，还是如今的DPO、GRPO等算法，虽然训练架构在不断简化，但对高质量核心数据的依赖从未改变。</p>
<p>例如字节专门设立了众包专家标注平台 Xpert，用于生产地理、代码、法律、医学等专业领域的高质量数据，以此支撑豆包基座模型的迭代训练。基座模型能力的提升，大家的直观感受就是它在一个又一个垂直领域的表现越来越好。</p>
<p>因此，当我们在特定垂域面临业务知识语料匮乏（或公网无公开高质数据）的挑战时，通过引入行业专家的知识输入来补足模型/Agent的能力，就成了破局的关键——尤其是在项目的冷启动阶段。</p>
<p><img src="https://p0.meituan.net/meituantechblog/38f14cf00310f5e510a565afe5add85475210.png" alt=""></p>
<p>呼应前文，评测的目的是回答“Agent好不好”，那么谁来定义“好不好”呢？靠最懂业务最有Sense的行业专家。</p>
<h3>2.6 小结&amp;FAQ</h3>
<p>这个章节讲述的是图灵评测从履约的项目出发，又经过这1年多BP公司各个业务方的过程中沉淀的核心方法论。</p>
<p><strong>FAQ</strong></p>
<p><strong>Q1：“独裁者”必须是1个人吗，还是1个团队共同遵循一套评测规范即可？</strong></p>
<p>首先一个团队需要遵循同一套评测体系。独裁者的作用多方征求意见并整合评测体系，当项目方观念无法对齐的时候，由独裁者拍板定论，避免评测体系分化带来项目方各自为政以及内部拉扯带来的损耗。</p>
<p><strong>Q2：评测体系依赖“独裁者”，存不存在风险？</strong></p>
<p>我们要认清一个事实，评测体系是不断演进的。从业务冷启动到扩量再到全量，这个过程中用户从愿意尝鲜的AI爱好者扩展到全部用户，用户画像会发生明显的偏移。这导致评测目标需要随着业务的扩量不断地发生调整。独裁者的价值更多的体现在拉齐标准，评测目标更多的是由真实的业务场景中BadCase/Good Case修正并驱动的。当然，我们需要在评测标准建立之初选出最懂业务的人来制定评测体系。</p>
<p><strong>Q3：冷启动阶段一定要设立种子评测集吗？能不能直接小流量开灰上线，直接收集Good Case和Bad Case来驱动评测呢？</strong></p>
<p>冷启动阶段是否必须设立种子评测集，本质上是一个风险与成本的Trade-Off。</p>
<p>为什么建议设立种子集：大模型具有随机性，Corner Case 可能会导致Agent体验剧烈偏移。因此，需要通过回测保证Agent基线能力，不断融入Good Case和Bad Case来拓宽Agent的能力边界。</p>
<p>关于小流量开灰的策略：如果业务场景容错率高，或者构建高质量种子集的成本远超线上试错带来的负面反馈，可以尝试小流量上线收集线上case。</p>
<p><strong>推荐落地方案</strong>：人工生产少量评测集后，AI辅助生成或扩写，以较低成本完成冷启动的种子评测集构建。</p>
<p><strong>Q4：我们邀请的行业专家对“好”的定义不一致应该怎么办？</strong></p>
<p><strong>答</strong>：最朴素且有效的方法，邀请一批行业专家定义“好”的标准，从中抽取共性的部分建设评测体系。例如邀请金牌销售来定义优秀的销售SOP。</p>
<p>那么非共性的部分就没有价值了吗？并非如此。对于专家意见不一致的部分，往往意味着业务本身存在多种优秀策略。我们可以将这些分歧转化为 Agent 的不同风格或策略分支（例如：AI电销中，老练激进派 vs 细水长流派），并允许在不同的测试集（Benchmark）中独立评测。这些分歧点非但不是噪声，反而会成为 Agent 未来走向精细化迭代、覆盖更多长尾场景的重要养分。</p>
<h2>三、Agent观测评测的演进</h2>
<p>2023年GPT爆火，2024年工作流出现，去年 Claude Code发布，再到今年的龙虾热、爱马仕热，长程Agent逐渐进入了大众视野。Agent Harness也全面进入长程Agent时代。</p>
<p>长程Agent（Long-horizon Agent）与短程Agent的区别，在于它如何处理“时间跨度带来的复杂性”：</p>
<p><img src="https://p0.meituan.net/meituantechblog/8f8ece9a28d04ecfddfb2adeda215de5422438.png" alt=""></p>
<p>这些差异会为观测评测带来怎样的变化呢？</p>
<h3>3.1 短程Agent时代的观测评测</h3>
<p>短程Agent时代的评测对象相对简单。ChatAgent 时代的典型输入输出形态是：<code>Query -&gt; Answer</code>。</p>
<p>这类场景的共同特点是：Agent 更多是在“回答问题”，进行少量的系统操作，而不是“进入操作系统执行任务”。典型应用场景，例如AI搜索、客服机器人。此类Agent评测重点通常落在回答本身，例如：</p>
<p><img src="https://p0.meituan.net/meituantechblog/9f0173186662a5fc1f713ea812e1bedf123607.png" alt=""></p>
<p>在过去1年的发展中图灵形成了成熟的解决方案，包括人工评测、机器评测，部分案例如下：</p>
<p><img src="https://p1.meituan.net/meituantechblog/ed3a1d605c114a237925bb77f1d3b4f1531735.png" alt=""></p>
<h3>3.2 长程Agent的观测评测</h3>
<p><strong>3.2.1 长程Agent带来评测范式变化</strong></p>
<p>长程 Agent 解决的不是“回答一个问题”，而是“完成一个复杂任务”。它通常需要：</p>
<ul>
<li>任务需要多步骤拆解</li>
<li>执行过程中需要多次调用 Tool 或 Skill</li>
<li>需要读取中间结果并动态调整策略</li>
</ul>
<p>让我们回顾一下观测和评测的目标，带着这个目标去看长程Agent</p>
<ul>
<li><strong>观测目标</strong>：还原现场，精确定位，解决“我想看Case却发现没打日志”的问题</li>
<li><strong>评测目标</strong>：回答Agent好不好，指出迭代方向</li>
</ul>
<p><img src="https://p0.meituan.net/meituantechblog/ded0f067e5f7efd742b99b90aa39d751334664.png" alt=""></p>
<p><strong>3.2.2 Skill评测</strong></p>
<p>在讲Skill评测之前，我们先分享一下我们关于26年春节后这一轮龙虾/Skill热潮的调研。</p>
<p>谁在提出龙虾和Skill的评测需求（2月至今龙虾/Skill热潮的用户画像）？</p>
<p>总结起来目前龙虾和Skill相关需求主要 广义的运营提效 场景，大致可以分成三类：</p>
<p><img src="https://p0.meituan.net/meituantechblog/6ffee1bafd66d006e14e29030226a0c7457553.png" alt=""></p>
<p>用户规模正在从少量专业角色扩展到更广人群</p>
<ul>
<li>商家侧仍在探索和试点阶段，规模有限</li>
<li>公司内部AI at Work系统中的龙虾（或其他长程Agent）融合更广，用户覆盖产、运、研、销等多类角色</li>
<li>Skill 的开发门槛越来越低，甚至可以由 AI 辅助生成</li>
</ul>
<p>这会带来一个直接结论：</p>
<blockquote>
<p>未来需要评测的人，不只是一小撮产运研同学，而可能是每一个会创建、修改、接入 Skill 的人。</p>
</blockquote>
<p>这对评测系统提出了新的要求：</p>
<ul>
<li>要足够简单</li>
<li>要足够标准化</li>
<li>要足够自动化</li>
<li>最好能接入开发与发布流程</li>
</ul>
<p><strong>当前的本质痛点</strong></p>
<p>本质在于 —— 大家不知道怎样写好 Skill，也缺乏对 Skill 全生命周期进行评测的工具。</p>
<p>为了方便大家理解，我们将Skill全生命周期拆解如下：</p>
<p><img src="https://p0.meituan.net/meituantechblog/182fee6cd0b3b393e24bf2283bfe024c272940.png" alt=""></p>
<p>综上，Skill评测的痛点总体可以拆解成三个方面：</p>
<p><img src="https://p1.meituan.net/meituantechblog/281c7582036750d16d76ea3a0c38516d317274.png" alt=""></p>
<p><strong>面向Task的评测</strong></p>
<p>2026年1月9号，Anthropic发表了一篇博客揭秘<a href="https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents" target="_blank" rel="noopener noreferrer">AI Agent评估</a>，在这篇博客中首次提到了面向Task的长程Agent评测。文中对Task，定义为“具有明确输入和成功标准的单个测试”。</p>
<p>我们综合了Anthropic以及开源软件对Task的定义，简化如下。</p>
<p><img src="https://p0.meituan.net/meituantechblog/230f48a442655d73f000d00d39ee8e70190919.png" alt=""></p>
<p>prompt定义了我们的问题/诉求，expeted behavior定义了我们预期Agent达成的行为，当我们在正式或测试环境中向Agent发送promt，通过trace获取到长程Agent真实的执行路径，就可以得到（prompt - expeted_behavior - trace）三元组，类似于短程Agent的（query - ground_truth - answer），即可进行评测。</p>
<p><strong>3.2.3 长程Agent评测与短程Agent评测的差异</strong></p>
<p>可以把两者的差异总结如下：</p>
<p><img src="https://p0.meituan.net/meituantechblog/7e18558ac1dcbfe4501f58703ec4fed6197508.png" alt=""></p>
<p>最本质的变化是：</p>
<blockquote>
<p>ChatAgent 评测关心“说得好不好”，长程 Agent 评测关心“事情做成没有，以及是怎么做成的”。</p>
</blockquote>
<p><strong>3.2.4 人评主导走向机评主导</strong></p>
<p>ChatAgent 时代常见流程是：<code>核心评测员对齐 -&gt; 外包对齐 -&gt; 机评对齐</code></p>
<p>而在长程 Agent 场景下，这条链路有机会被明显缩短，甚至可以跳过外包对齐，直接进入：<code>核心评测员对齐 -&gt; 机评对齐 -&gt; 规模化扩展</code></p>
<p>原因主要有三点：</p>
<ul>
<li>长程 Agent 的执行轨迹更丰富，信息密度高使人成为卡点</li>
<li>Skill 生产门槛低，数量增长极快，人工大规模标注不可持续</li>
<li>基座模型能力的持续突破</li>
</ul>
<p>这并不意味着人工不重要，而是意味着：</p>
<ul>
<li>人工更应该做高价值标准设计和 Rubric 对齐</li>
<li>AI 更适合承担规模化运行、初筛和回归验证</li>
<li>平台更应该承担沉淀、回放、告警和归因职责</li>
</ul>
<p>换句话说，AI 评测真正要放大的，不是“机器打分”本身，而是核心评测员的判断标准。</p>
<p><strong>3.2.5 长程Agent评测基建至少应该具备哪些能力</strong></p>
<p>如果未来要支撑公司内大规模 Agent 和 Skill 生态，评测基础设施至少应包含以下能力：</p>
<ul>
<li><strong>全链路回放</strong>：复现一次任务从输入到结果的全过程</li>
<li><strong>Case 管理</strong>：统一维护任务样本、上下文、约束和 Rubric</li>
<li><strong>执行沙箱</strong>：按只读、可写、高风险等类型分层隔离执行</li>
<li><strong>AI 评测引</strong>擎：支持 Rubric 驱动的人机对齐和自动判分，且足够简单易用，方便广大skill生产者接入</li>
<li><strong>报告与归因</strong>：不仅给分，还能指出问题发生在规划、工具、环境还是 Skill</li>
<li><strong>回归机制</strong>：版本升级后自动触发历史 Case 回归</li>
<li><strong>准入准出门禁</strong>：把评测结果嵌入开发、发布和运营流程</li>
</ul>
<p>如果缺少这些能力，评测就容易停留在“单次分析”和“项目制支持”层面，无法真正成为生产系统的一部分。</p>
<h2>四、总结：Agent评测正在从打分动作走向基础设施能力</h2>
<p>综合来看，随着大模型能力的增强以及Agent Harness的持续演进，Agent 评测的演进可以概括为两句话：</p>
<p><strong>第一，评测对象变了</strong></p>
<p>过去评测的是“回答”，现在评测的是“任务系统”。</p>
<p>因此我们关心的不再只是输出内容本身，而是完整执行链路中的能力、稳定性、效率与风险。</p>
<p><strong>第二，评测方法变了</strong></p>
<p>过去主流是 <code>Query -&gt; Answer</code> 的文本质量评测，现在逐步转向 <code>Prompt -&gt; Expected Behavior</code> 的行为评测。</p>
<p>标准答案不再总是唯一，过程质量、任务完成度和轨迹质量成为新的核心对象。</p>
<p>因此，未来真正重要的，不只是能不能做几次评测，而是能不能建设出一套：<strong>看得见问题</strong>、<strong>说得清标准</strong>、<strong>跑得动规模</strong>、<strong>接得上流程</strong>、<strong>带得动迭代</strong>的 Agent 评测体系。</p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/5a8954c2e7b681ee8fb8d2c8a73868cd157865.png" type="image/png"/>
    </item>
    <item>
      <title>美团正式发布 CatPaw：全场景 AI Agent，从个人提效到企业智能化</title>
      <link>https://tech.meituan.com/2026/07/28/CatPaw-LongCat.html</link>
      <guid>https://tech.meituan.com/2026/07/28/CatPaw-LongCat.html</guid>
      <source url="https://tech.meituan.com/rss.xml">美团正式发布 CatPaw：全场景 AI Agent，从个人提效到企业智能化</source>
      <description>搭载美团 LongCat 2.0 的全场景 AI Agent 平台 CatPaw 正式上线，我们将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。</description>
      <content:encoded><![CDATA[<p>本月，美团 LongCat 2.0 已<a href="https://tech.meituan.com/2026/07/12/LongCat-2.0-Open-source.html" target="_blank" rel="noopener noreferrer">正式开源</a>，总参数 1.6T，平均激活约 48B，动态范围 33B 到 56B，原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步，让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”，才是真正的考验。</p>
<p>现在，搭载 LongCat 2.0 的美团全场景 AI Agent 平台 <a href="https://catpaw.meituan.com/" target="_blank" rel="noopener noreferrer">CatPaw</a> 正式上线，将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。</p>
<p>不仅如此，依托美团十余年深耕本地生活的行业积累，CatPaw 将商家经营、服务履约与消费决策的深度认知融入其中，助力企业构建 AI 数字员工、推进业务智能化升级。</p>
<p>目前，CatPaw 已在美团内部大规模落地：累计覆盖 9 万员工、搭建 Agent 3 万个，并在多个真实业务场景中完成验证。</p>
<h2>全时段运行，多终端协作的 AI 智能工作台</h2>
<h3>01 移动/PC/云端，全时段多端协作</h3>
<p>提供独立的<strong>移动端 App 与 PC 客户端</strong>，双端任务实时同步、无缝协作。移动端支持随时发起任务、查看进度与远程确认关键决策；PC 端专注本地深度执行，具备文件操作、浏览器控制与终端命令等完整能力。</p>
<p>云端模式支持 <strong>7 × 24 小时不间断运行</strong>，即使本地设备关机或断网也不受影响。长程任务与定时任务于云端持续运转，完成后随时打开手机或电脑即可查看成果。</p>
<p><img src="https://p0.meituan.net/meituantechblog/a690ba49597fd8720f96ea56573b54cc151290.png" alt=""></p>
<h3>02 深耕本地生活，融合美团业务生态</h3>
<p>在全场景通用 AI Agent 能力的基础上，CatPaw 进一步融入了美团在本地生活领域的全链路行业认知。从门店经营、评价体系、营销转化到履约配送，这些深度积累已被封装为即装即用的<strong>专家与技能</strong>，覆盖门店评价诊断与优化、商品文案生成、营销物料设计评估、活动策划、经营数据分析等场景。</p>
<p>CatPaw 既是人人可用的<strong>全能 AI 助手</strong>，也是真正懂本地生活生意的智能搭档。</p>
<p><img src="https://p1.meituan.net/meituantechblog/864f86011bdcc6a2428f980323605284136476.png" alt=""></p>
<h3>03 专家与技能，丰富能力即装即用</h3>
<p>CatPaw <strong>支持 AI 专家</strong>，每位专家<strong>集成多项技能与子代理，高效完成特定领域的复杂任务</strong>。从专家广场<strong>一键安装</strong>即可使用，也可通过对话将自己的工作方式快速封装为专属专家，团队共享复用。</p>
<p>平台内置丰富的技能库，开箱即用。内嵌浏览器还<strong>支持操作过程一键录制</strong>，将日常高频流程自动生成专属技能，让个人与团队经验沉淀为可复用的数字化资产。</p>
<p>支持<strong>跨会话长期记忆</strong>，自动记忆用户的个性化偏好、操作习惯与历史上下文，跨设备、跨对话保持连续理解，越用越懂你。</p>
<p><img src="https://p0.meituan.net/meituantechblog/7f715c1d858cead54dad86e431e30153313940.png" alt=""></p>
<h3>04 对话即交付，多 Agent 自主协同</h3>
<p>只需明确最终目标，Agent 便会<strong>自主规划步骤并在授权范围内深度执行</strong>：读取文件、操作浏览器、运行终端命令，直接交付 Excel、可视化报告或代码等可用成果。</p>
<p>面对跨领域的复杂任务，系统动态进行任务拆解，<strong>调度多个具备专属工具的 Agent 并发处理</strong>，各 Agent 在独立环境中互不干扰，进度实时可见，结果自动汇总。</p>
<p><img src="https://p0.meituan.net/meituantechblog/2122a550b13a060033f2a0343680ccfa345379.png" alt=""></p>
<h2>从 AI 工作台到业务系统：Managed Agents</h2>
<p>CatPaw Managed Agents 是企业级 AI Agent 开发与托管平台，提供开箱即用的工程底座，<strong>无需从零搭建底层基建</strong>，即可快速构建、部署与管理专属 Agent。</p>
<h3>01 数字员工，扫码即用灵活配置</h3>
<p>数字员工是运行在飞书、企微等 IM 中的 AI 虚拟同事，@ 即可唤醒使用。<strong>平台预置多种角色模板，扫码即用</strong>；美团在本地生活领域的长期积累也已沉淀为专属模板，不只是通用的聊天机器人，而是理解业务的行业 AI 助手。</p>
<p>同时支持通过 <strong>AI 对话描述需求，快速生成专属数字员工</strong>。从 Agent 创建到环境部署、会话初始化，<strong>全程自动完成，无需手动配置</strong>。</p>
<p>提示词、知识库、凭证、工具均支持在线管理，团队可按业务场景灵活搭建。</p>
<p><img src="https://p0.meituan.net/meituantechblog/a4a4286eab88dc7a9fb8ad4a359f57d3202455.png" alt=""></p>
<h3>02 企业级安全，数据隔离可控</h3>
<p><strong>Agent 运行环境严格隔离</strong>，租户间数据互不可见。凭证集中托管，<strong>确保 Agent 全程零接触敏感资产</strong>。</p>
<p>支持<strong>分级权限管控</strong>与私有化部署，全面满足企业合规与安全审计要求。</p>
<p><img src="https://p0.meituan.net/meituantechblog/d8ea3582939d36764915e7b5f848790e478278.png" alt=""></p>
<h3>03 Agent 托管运行，持续在线</h3>
<p>支持<strong>按需配置运行环境</strong>，一键托管上线，<strong>资源动态扩缩</strong>。</p>
<p>沙箱环境轻量隔离，百毫秒级冷启动，闲时自动释放，兼顾响应速度与成本。</p>
<p><img src="https://p0.meituan.net/meituantechblog/1c65c6d75279f7085030ad763eeff3b2368282.png" alt=""></p>
<h3>04 可视化运维，全链路可观测</h3>
<p>提供统一的运维管理界面，<strong>会话记录完整留存可追溯</strong>，支持在线调试实时排查问题，<strong>模型调用量与消耗清晰可见</strong>。</p>
<p>多维度数据统计与分析，帮助团队持续评估 Agent 表现、优化运行效果。</p>
<p><img src="https://p0.meituan.net/meituantechblog/4344c5e90e47733d89ef9ee3d792f88f140185.png" alt=""></p>
<h2>从个人提效到组织智能化：与商家一起探索更多可能</h2>
<p>在全场景 AI 能力之上，CatPaw 提供<strong>组织级的管理与管控能力</strong>，满足商家**规模化落地 AI **的管理需求。</p>
<p>CatPaw 提供统一管理后台，支持团队账号体系。团队成员与权限集中管理，用量明细与消耗实时可查，成本清晰可控。AI 专家和技能支持按团队或角色集中配置与精准下发，一线员工开箱即用，AI 能力快速转化为实际生产力。</p>
<p>此外，CatPaw 还提供与<strong>美团业态深度关联的专属专家与技能</strong>，覆盖外卖、服务零售、医药健康等多个行业。以服务零售为例，美团商家运营专家整合了经营数据分析、评价管理、门店装修等核心场景，帮助商家实现智能化运营。</p>
<p>CatPaw 将持续深入行业场景，让 AI Agent <strong>真正成为驱动经营增长的数字化伙伴</strong>。更多能力陆续开放中，<strong>诚邀美团合作商家抢先体验</strong>。</p>
<p><strong>体验地址</strong>：<a href="https://catpaw.meituan.com/" target="_blank" rel="noopener noreferrer">https://catpaw.meituan.com/</a></p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/a690ba49597fd8720f96ea56573b54cc151290.png" type="image/png"/>
    </item>
    <item>
      <title>下一代搜索智能体评测基准！美团开源LoHoSearch，用知识图谱校准AI能力认知</title>
      <link>https://tech.meituan.com/2026/07/24/LongCat-LoHoSearch.html</link>
      <guid>https://tech.meituan.com/2026/07/24/LongCat-LoHoSearch.html</guid>
      <source url="https://tech.meituan.com/rss.xml">下一代搜索智能体评测基准！美团开源LoHoSearch，用知识图谱校准AI能力认知</source>
      <description>过去一年，我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上，顶尖模型准确率从最初的 30% 区间迅速攀升至 90% 以上。然而，当基准迅速饱和，其区分模型能力的价值也随之递减。</description>
      <content:encoded><![CDATA[<p>过去一年，我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上，顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而，当基准迅速饱和，其区分模型能力的价值也随之递减。</p>
<p><img src="https://p0.meituan.net/meituantechblog/69e86f1a417ef555aed62d74c1152c53108351.png" alt="图1：BrowseComp 准确率进展曲线"></p>
<p>BrowseComp 的题目由人工设计，局限在于只能基于标注者已知的实体和关系构思，无法站在全局知识网络视角判断：哪些条件真的难检索？哪些约束的候选空间足够大？正是这种局限，让我们开始思考另一种可能性：<strong>能不能让机器自己来出题？</strong></p>
<p>美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准，就是把这种可能性变成了现实。</p>
<h2>LoHoSearch 的核心"硬核"看点</h2>
<ul>
<li><strong>知识图谱自动化构造。</strong> 以覆盖762万维基百科实体的知识图谱为基础自动生成题目，替代人工出题。基准含544道经人工核验的题目，覆盖11个领域。</li>
<li><strong>双维度难度控制。</strong> 在生成中系统控制搜索空间与结构复杂度。构建出难度显著高于现有基准的挑战性问题。</li>
<li><strong>当前模型性能表现。</strong> 已评测模型中，GPT-5.5准确率为34.74%；现有上下文管理策略在LoHoSearch上提升幅度为6.8%，低于在BrowseComp上的14.03%。</li>
</ul>
<h2>01 设计原理：让机器出题，需要几部？</h2>
<p>机器出题的前提，是让机器拥有全局视野。整个构建流程可以分为四个环节：<strong>建图 → 控制难度 → 质量把关 → 数据概览</strong>。下面逐一展开。</p>
<h3>1.1 建图：搭建知识图谱，让机器获得全局视野</h3>
<p>LoHoSearch 的第一步，是从完整的英文维基百科出发搭建一张大规模知识图谱：</p>
<ul>
<li>762 万个实体（每个维基页面是一个实体节点）</li>
<li>2.65 亿条有向边（页面正文中指向其他维基页面的超链接）</li>
<li>每个实体的类型取自其 Wikidata P31 类别，实体热度用入度来衡量</li>
</ul>
<p>这张图谱为后续在全局视角下挑选"难题"提供了基础。</p>
<p><img src="https://p0.meituan.net/meituantechblog/158cf7d04a3fd9d5c8b5f171480db1ec450289.png" alt="图2：LoHoSearch 数据构造流程总览（知识图谱构建 → 子图采样 → QA 生成与验证 → 后置过滤与人工复核）"></p>
<p>有了图谱之后，下一个问题是：什么样的题目才算"难"？LoHoSearch 从两个维度来定义难度。</p>
<h3>1.2 控制难度：搜索空间和结构复杂度两个维度</h3>
<p>决定搜索难度的核心有两个维度，而它们恰恰是人工出题最难把控的：</p>
<ul>
<li><strong>搜索空间</strong>：满足一个条件的候选实体有多少。候选越多，排除成本越高。</li>
<li><strong>结构复杂度</strong>：要同时满足多少条件才能锁定答案。条件越多、咬合越紧，求解链条越长。</li>
</ul>
<p>针对这两个维度，LoHoSearch 设计了两种子图结构：</p>
<p><img src="https://p0.meituan.net/meituantechblog/da7dbb937aa30503321fa592d43b0123124986.png" alt=""></p>
<ul>
<li><strong>树结构</strong>主要通过放大"搜索空间"来制造难度。</li>
<li><strong>图结构</strong>则在巨大搜索空间之上，通过引入环形依赖和交叉约束，进一步叠加了"结构复杂度"。</li>
</ul>
<h3>1.3 质量把关：从生成到验证，层层把关</h3>
<p>子图采样完成后，还需要转换为可阅读的自然语言题目。整个转换与验证流程分为三层：</p>
<ul>
<li><strong>题目生成</strong>：从子图抽取维基描述，改写为自然语言问题。</li>
<li><strong>自动验证</strong>：检查问题是否完整覆盖子图关系，并由搜索智能体验证标准答案满足所有条件。</li>
<li><strong>筛选与复核</strong>：排除多答案题和易答题，再由人工审核。</li>
</ul>
<p>经过三层筛选，自动化流程的整体质量表现如下：75.5% 的题目直接通过人工复核，22.3% 经标注员微调后接受，仅有 2.2% 因严重问题被丢弃。</p>
<h3>1.4 数据概览：544道题目，11个主题领域</h3>
<p>LoHoSearch 最终收录 <strong>544 道</strong> 经人工核验的题目。对比树结构和图结构可以看出，图结构子图明显更稠密——节点更多、边数接近前者的两倍，这正对应它更高的结构复杂度。题目内容覆盖音乐、地理与地点、影视、体育等 11 个主题领域。</p>
<p><img src="https://p0.meituan.net/meituantechblog/9be937091fe5f30761bb06ea08a5c4e838213.png" alt="表1：LoHoSearch 数据统计"></p>
<p><img src="https://p0.meituan.net/meituantechblog/55f51f19edf66249bcb164c70a75adb3167617.png" alt="图3：LoHoSearch 的领域分布"></p>
<p><img src="https://p0.meituan.net/meituantechblog/2b54f0c184c018dbd27593bd90f40de0143825.png" alt="表2：各模型在 LoHoSearch 上的性能表现（%）"></p>
<p>最强模型 GPT-5.5 准确率仅 34.74%，DeepSeek-V4-Pro、Claude-Opus-4.6 和 Kimi-K2.6 集中在 15.53%–15.99%，其余模型均低于 14%。这与它们在 BrowseComp 上 80% 以上的表现形成鲜明对照——LoHoSearch 对当前最先进搜索智能体构成了实质挑战。</p>
<h3>洞察一：解一道题，平均工具调用从 35 次增至 61 次</h3>
<p>用 DeepSeek-V4-Flash 作为探针对比两个基准：同一模型在 BrowseComp 上准确率 58.84%，在 LoHoSearch 上仅 10.02%。</p>
<p><img src="https://p0.meituan.net/meituantechblog/234e605bbc7af2f8f7977c212bc62a8290841.png" alt="图4：BrowseComp 与 LoHoSearch 正确轨迹的工具调用次数分布"></p>
<p>解一道 LoHoSearch 题目，平均工具调用从 35 次增至 61 次（+74%），中位数从 26 次升至 59 次。图结构题目准确率仅 8.01%，远低于树结构的 11.89%，印证了结构复杂度是独立于搜索空间之外的额外难度来源。</p>
<h3>洞察二：重复采样收益可观，但天花板依然很低</h3>
<p>对 DeepSeek-V4-Flash 采样 16 个独立回答，结果如图 5 所示。</p>
<p><img src="https://p1.meituan.net/meituantechblog/a011a2b381eef5312e8281e8f32f7449129032.png" alt="图5：并行采样下 pass@N 及三种答案聚合策略的表现"></p>
<p>pass@N 从 N=1 的 9.3% 升至 N=16 的 38.3%，重复采样收益可观，但 38.3% 仍处低位。尝试 16 次仍有六成以上题目无法攻克。三种聚合策略中 best-of-N 表现最优（24.6%），远低于 pass@16 上界，说明模型在答案置信度校准上存在明显不足。</p>
<h3>洞察三：现有的上下文管理策略，在这里已失真</h3>
<p>以标准 ReAct 为基线，测试 Summary 和 Discard-all 两种策略，并加入 Verify 模块。</p>
<p><img src="https://p0.meituan.net/meituantechblog/f59c780873848c6d66609ad9eafc10d651431.png" alt="表3：基于 DeepSeek-V4-Flash 的上下文管理策略消融实验"></p>
<p>表现最佳的组合（Discard-all + Verify）将成绩从 10.02% 提至 16.82%，绝对提升仅 6.8 个百分点，而同一套策略在 BrowseComp 上可带来 14 个百分点的增益。收益收窄的原因在于 LoHoSearch 需要更长的推理链，简单的轨迹压缩或重启无法解决长程搜索中的信息丢失问题——这使其成为下一代上下文管理技术更有价值的试验场。</p>
<h3>洞察四：知识图谱是系统化构造高难度题目不可或缺的基础</h3>
<p>对比两个基准中"隐藏实体"的特征可以发现：</p>
<p><img src="https://p1.meituan.net/meituantechblog/682b8d4610aa31a2be89b70bc27a206a71835.png" alt="图6：隐藏实体分析(a) 隐藏实体的入度分布；(b) 相同流行度下关系搜索空间对比"></p>
<p>其一，BrowseComp 的隐藏实体流行度明显更高，人工出题难以精确控制实体知名度，导致实体偏易。</p>
<p>其二，即便将流行度控制在同一水平，LoHoSearch 的关系搜索空间仍显著更大，实体推断难度远高于 BrowseComp。</p>
<p>这说明人工构建存在系统性局限，知识图谱是系统化构造高难度题目不可或缺的基础。</p>
<h2>02 总结：为下一代智能搜索提供新标尺</h2>
<p>LoHoSearch 的价值体现在三项具体贡献上：</p>
<ul>
<li><strong>基于知识图谱的自动化构造流程。</strong> 以覆盖762万实体的知识图谱为基础自动生成题目，系统控制搜索空间与结构复杂度，突破人工出题的难度上限。</li>
<li><strong>更具区分度的评测标准。</strong> 最强模型 GPT-5.5 准确率仅 34.74%，正确轨迹所需工具调用次数是 BrowseComp 的 1.7 倍。LoHoSearch 为搜索智能体建立了更具区分度的评测标尺。</li>
<li><strong>面向上下文管理研究的挑战性平台。</strong> 最优策略仅带来 6.8% 的提升，远低于其在 BrowseComp 上 14.03% 的增益，表明 LoHoSearch 可成为推动下一代上下文管理技术研究的理想试验场。</li>
</ul>
<p>LoHoSearch 已全面开源，欢迎各大模型前来接受"长程搜索"大考。</p>
<h2>开源链接</h2>
<ul>
<li><strong>Paper</strong>: <a href="https://arxiv.org/abs/2606.12837" target="_blank" rel="noopener noreferrer">https://arxiv.org/abs/2606.12837</a></li>
<li><strong>HuggingFace</strong>: <a href="https://huggingface.co/datasets/meituan-longcat/LoHoSearch" target="_blank" rel="noopener noreferrer">https://huggingface.co/datasets/meituan-longcat/LoHoSearch</a></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/69e86f1a417ef555aed62d74c1152c53108351.png" type="image/png"/>
    </item>
    <item>
      <title>让AI离开温室，走向动态世界：MineExplorer揭示顶级多模态大模型被忽视的能力断层</title>
      <link>https://tech.meituan.com/2026/07/24/LongCat-MineExplorer.html</link>
      <guid>https://tech.meituan.com/2026/07/24/LongCat-MineExplorer.html</guid>
      <source url="https://tech.meituan.com/rss.xml">让AI离开温室，走向动态世界：MineExplorer揭示顶级多模态大模型被忽视的能力断层</source>
      <description>美团 LongCat 团队构建了 MineExplorer —— 首个在开放世界中做到分钟级长程任务的评测基准，系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。</description>
      <content:encoded><![CDATA[<p>假如你出生在一片未知的森林，太阳即将下山，饥肠辘辘，前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。</p>
<p>此时如果你按下暂停，把截图发给所有顶级的多模态大模型，它们都能完美回答你：“黄昏、有怪物，面临威胁。”</p>
<p>我们发现，多模态大模型能看懂图像、解析视频、在复杂场景里推理，然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么？</p>
<p>为了深入探索，美团 LongCat 团队构建了<strong>MineExplorer</strong>——<strong>首个在开放世界中做到分钟级长程任务的评测基准</strong>，系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。</p>
<p><strong>MineExplorer 核心看点：</strong></p>
<ul>
<li><strong>一个能直接跑的评测基准</strong>：813 个人工验证的高质量实例（1-hop 到 4-hop），配套规则化的里程碑自动评测框架。</li>
<li><strong>一套造题的方法论</strong>：多智能体数据合成流程的完整代码，可自动合成训练任务。</li>
<li><strong>一个可扩展的训练环境</strong>：基于 Minecraft 的沙盒，既能当考场，也能当练兵场。</li>
</ul>
<h2>01 MineExplorer设计解密：让AI离开温室，走向动态世界</h2>
<p>MineExplorer 不再是简单的看图问答，而是围绕一系列创新，构建了一个前所未有的评测体系。</p>
<p><img src="https://p1.meituan.net/meituantechblog/3415508a98cf053008ffb59af0ed592a421327.png" alt="图1：MineExplorer自动化数据合成和评测范式简介"></p>
<h3>1.1 创新设计：构建一个动态开放的世界</h3>
<p><strong>创新点一：构建一个具备完整物理规则、会动态演化的世界</strong></p>
<p>MineExplorer不是让模型看一张 Minecraft 截图做选择题，模型面对的是一个实时运行的3D沙盒世界。在评测中，每个任务实例会运行1800个环境步，每步执行 0.1 秒，对应一段3分钟的连续交互视频。也就是说在这3分钟时间里，环境一直在变：模型每做一个动作，世界状态就更新一次，它必须根据最新的画面不断调整策略。</p>
<p><strong>创新点二：隐藏前置条件的长程多跳任务</strong></p>
<p>这是 MineExplorer 最核心的设计，我们把任务按「跳数（hop）」分级，代表完成最终目标需要经过的隐藏前置步骤数量：</p>
<ul>
<li><strong>简单任务</strong>：目标明确的单跳任务，智能体不需要根据场景和任务描述推理出隐式的子任务。</li>
<li><strong>困难任务</strong>：由2-4跳任务组成的多跳推理任务。最终目标虽然给出，但要完成它，必须先推理并完成若干<strong>没有在指令里说明</strong>的前置子任务。</li>
</ul>
<p>我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ)：q 是自然语言指令，s₀ 是初始状态，Gτ 是任务之间的<strong>依赖图（DAG）</strong>，Mτ 是规则化的里程碑检查器。关键在于：**指令 q 并不会枚举依赖图里的所有节点，智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难，意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。</p>
<p><img src="https://p0.meituan.net/meituantechblog/1466cfe7ae29ef6beadf4bf8920b61b9117170.png" alt="图2：任务难度分布图"></p>
<p><strong>创新点三：知识解耦——我们测的是「通用探索」，不是「背 Minecraft Wiki」</strong></p>
<p>这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务，我们用LLM裁判判断其主要依赖的是通用世界常识，还是Minecraft专有机制，并过滤掉后者。换句话说：<strong>我们测的不是「AI 会不会玩 Minecraft」，而是「AI 能不能在一个动态物理世界里自主探索」。</strong></p>
<p><img src="https://p0.meituan.net/meituantechblog/27b8c5c7b9f9ae530adf7db2b37ee0d9117398.png" alt="图3：领域知识过滤图"></p>
<h3>1.2 构建方法：一套可复用的多智能体数据合成范式</h3>
<p>构建高质量的长程任务基准本身就是难题。我们的解法是让一组各有分工的 AI 协作来造题。MineExplorer 用一个多智能体协作流程，五个专业 Agent 在一个群聊里协作，由一个 orchestrator 控制发言顺序：</p>
<p><img src="https://p0.meituan.net/meituantechblog/033d32b59d8891664d7de8ed0c836918946656.png" alt=""></p>
<p>整个流程分初始化和辩论（debate）两个阶段，先生成初稿，再由专家和验证器找出问题并修订。</p>
<p>如<strong>下表所示</strong>，人工评估结果显示，多智能体流程把有效率拉高了约 30 个百分点，质量分提升约 0.5 分，在最难的4-hop任务上优势尤其明显。最终，我们保留了 813 个通过人工验证的高质量复合任务实例。</p>
<p><img src="https://p1.meituan.net/meituantechblog/92d0dc21970ca1a40a0386789f5a5256194522.png" alt="表1：Benchmark质量人工评估表"></p>
<h3>1.3 能力覆盖：MineExplorer 到底在测什么？</h3>
<p>MineExplorer 借鉴 ReAct 范式，把开放世界探索拆解成三大能力维度，共 14 项细粒度能力：</p>
<ul>
<li><strong>感知（Perception）：</strong> 空间、时序、实体、状态、资源。</li>
<li><strong>推理（Reasoning）：</strong> 常识、因果、关系。</li>
<li><strong>行动（Action）：</strong> 移动、跳跃、采集、放置、合成、攻击。</li>
</ul>
<p><strong>如图所示</strong>，最终的基准在三大维度上都有充足的覆盖，其中空间感知、移动、采集等基础能力出现频率最高，常识推理、因果推理也占了相当比例。</p>
<p><img src="https://p0.meituan.net/meituantechblog/5606f102fc399d300f8531427a08c4ef91444.png" alt="图4：能力覆盖分布图"></p>
<h2>02 核心洞察：18款顶级大模型测试，为何集体“考砸”了？</h2>
<p>MineExplorer不仅定义了考题，更给出了18个顶级模型的真实分数。<strong>如下表所示</strong>，这是横跨 Claude、GPT、Gemini 等八大家族的模型在整体任务成功率（TSR）上的排行榜。</p>
<p><img src="https://p1.meituan.net/meituantechblog/baa9165aab4bae0826f1a4f22315881b960739.png" alt="表2：主体评测结果表"></p>
<p>我们发现，即便是表现最好的 Claude-Opus-4.6，整体成功率也只有 41 分。</p>
<p><strong>| 洞察一：单跳尚可，多跳崩盘——问题就在隐藏前置条件</strong></p>
<p>如图所示，最强模型Claude-Opus-4.6的表现，从1跳任务的77分，一路下滑到4跳任务的12分。每增加一层隐藏的前置依赖，模型就掉一个台阶。</p>
<p><img src="https://p0.meituan.net/meituantechblog/423b7c12487a277cac27bcafb215841f1105129.png" alt="表3：分级评测结果图"></p>
<p><img src="https://p1.meituan.net/meituantechblog/0fe66c8cd12e6acd4b3273cb6e8999dd227554.png" alt="图5：不同任务难度下的任务成功率对比图"></p>
<p><strong>| 洞察二：会看，但不会想 —— 感知强于推理</strong></p>
<p>在几乎所有被测模型上，我们都观察到同一个规律：<strong>感知分数 &gt; 行动分数 &gt; 推理分数</strong>。如下图所示，以Claude-Opus-4.6为例，其整体感知分61.91，推理分54.71。瓶颈不在于看不见，而在于看懂了却无法串联成有效策略。</p>
<p><img src="https://p0.meituan.net/meituantechblog/e552dbd0ed03151c3750b43d75ad37ba836166.png" alt="图6：维度评测热力图"></p>
<p><strong>| 洞察三：近60%的失败原因，都是因为走不到目标</strong></p>
<p>我们对 Claude-Opus-4.6 的失败案例进行了归因分析。<strong>如下图所示</strong>，导航失败是最大的错误来源，占比近 60%。</p>
<p><img src="https://p0.meituan.net/meituantechblog/0e685670220ce485c94a8a8f5468218f163985.png" alt="图7：失败类型分布图"></p>
<p><strong>| 洞察四：给它更多步数、更多记忆，都不是解药</strong></p>
<p>我们进一步做了消融实验，发现模型失败并非因为资源不足。</p>
<ul>
<li><strong>步数</strong>：如图所示，能解的任务，模型在早期就解出来了；解不了的，给到 1800 步上限照样解不了。</li>
</ul>
<p><img src="https://p1.meituan.net/meituantechblog/4db113c30a91462928af6b6e28521ad8620229.png" alt="图8：平均完成步数图"></p>
<ul>
<li><strong>记忆</strong>：如图所示，增加历史画面帧数到一定程度后，性能反而会下降，因为过期的观察会干扰对当前局面的判断。</li>
</ul>
<p><img src="https://p0.meituan.net/meituantechblog/3db3e8f4aeb4dfb68dce40379b0df7a9355836.png" alt="图9：记忆帧数影响图"></p>
<p><strong>核心结论：瓶颈不在资源，而在模型没法把已有的信息和当前世界状态对齐。</strong></p>
<h2>03 总结：从看见世界到探索世界的鸿沟</h2>
<p>MineExplorer 揭示了一个被乐观情绪掩盖的能力断层：当前的多模态大模型，已经具备了不错的感知力，但严重缺乏在动态世界中持续行动的探索力。</p>
<p>这对正在快速升温的具身智能赛道有几个直接的启示：</p>
<ul>
<li>感知层基本就绪，规划层是瓶颈。 模型能看懂环境，但把感知转化成长程、含隐藏前置的行动计划，才是从能看到能做之间真正的鸿沟。</li>
<li>行业需要更接近真实复杂度的评测标准。在受控场景里跑通一个单步指令，不足以宣布AI能行动了。真实世界是动态的，充满未说明的前置条件，需要持续、长久化的探索。</li>
<li>我们不仅提供了评测，还开源了自动合成任务的方法和训练环境。MineExplorer交付的不是一套静态题库，它还带着一整套自动合成长程任务的流程，和一个能直接拿来训练的Minecraft环境。评测、造题、训练，用的是同一套基础设施。</li>
</ul>
<p>我们不是要给具身智能泼冷水。恰恰相反，把瓶颈定位清楚，比盲目乐观更有价值。MineExplorer提供的，正是这样一条诚实、可量化的能力基线。</p>
<p>看得见世界，不代表能探索世界。在一个会变化的世界里持续推理、持续行动——这才是AI走向真实世界，必须先跨过的那道门槛。MineExplorer 已全面开源，欢迎各大模型前来挑战开放世界。</p>
<p><strong>🚀 开源链接</strong></p>
<ul>
<li>
<p><strong>Paper</strong>：<a href="https://arxiv.org/abs/2605.30931" target="_blank" rel="noopener noreferrer">https://arxiv.org/abs/2605.30931</a></p>
</li>
<li>
<p><strong>GitHub</strong>：<a href="https://github.com/meituan-longcat/MineExplorer" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/MineExplorer</a></p>
</li>
<li>
<p><strong>HuggingFace</strong>：<a href="https://huggingface.co/datasets/meituan-longcat/MineExplorer" target="_blank" rel="noopener noreferrer">https://huggingface.co/datasets/meituan-longcat/MineExplorer</a></p>
</li>
</ul>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/3415508a98cf053008ffb59af0ed592a421327.png" type="image/png"/>
    </item>
    <item>
      <title>正式开源！美团 LongCat-2.0 同步开放国产卡推理代码</title>
      <link>https://tech.meituan.com/2026/07/12/LongCat-2.0-Open-source.html</link>
      <guid>https://tech.meituan.com/2026/07/12/LongCat-2.0-Open-source.html</guid>
      <source url="https://tech.meituan.com/rss.xml">正式开源！美团 LongCat-2.0 同步开放国产卡推理代码</source>
      <description>美团 LongCat-2.0 总参数 1.6T，平均激活约 48B，为真实的 Agentic Coding 任务而生，架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding，提升长上下文处理效率与 Token 级表示能力的同时，结合动态激活进一步强化了代码理解、生成以及执行的表现。</description>
      <content:encoded><![CDATA[<p><strong>本周，美团万亿参数大模型 LongCat-2.0 正式开源！</strong></p>
<p><a href="https://huggingface.co/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">HuggingFace</a> | <a href="https://github.com/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">GitHub</a> | <a href="https://www.modelscope.cn/collections/meituan-longcat/LongCat-20" target="_blank" rel="noopener noreferrer">ModelScope</a></p>
<p>作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型，LongCat-2.0 已全面开源。<strong>针对显存与带宽受限的国产算力芯片，我们在模型架构、芯片适配到部署策略上进行了深度协同优化，让万亿参数模型在存量卡上同样跑得稳、跑得快。</strong> 我们希望以真实 Agentic Coding 任务中的稳定表现为依托，通过开源将模型能力与推理优化成果完整开放，盘活更多存量国产算力，释放国产算力生态的长期价值。</p>
<p>美团 LongCat-2.0 总参数 1.6T，平均激活约 48B，为真实的 Agentic Coding 任务而生，架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding，提升长上下文处理效率与 Token 级表示能力的同时，结合动态激活进一步强化了代码理解、生成以及执行的表现。</p>
<h2>01 模型、芯片适配与部署三个方向逐一突破，实现了万亿参数模型的流畅推理</h2>
<p>面对显存、带宽和互联的多重限制，LongCat-2.0 结合国产芯片特性，<strong>从模型、芯片适配与部署三个方向逐一突破，实现了万亿参数模型的流畅推理：</strong></p>
<ul>
<li>
<p><strong>模型层面：</strong> Attention 通过 absorb 计算模式、Indexer 与 MLA prolog 并行处理以及 KVP 切分 KV-cache，有效缓解了超长上下文的 I/O 与显存压力。ScMoE 则利用国产芯片的控核能力，让 Dense 与 MoE 分支实现物理核心级并行执行，进一步压缩端到端延迟，实现了百万上下文在国产芯片上的高效推理；</p>
</li>
<li>
<p><strong>芯片适配层面：</strong> 通过 Super Kernel 减少算子数量以降低启动开销，并以 Weight Prefetch 将 I/O 延迟隐藏在前序计算中；同时基于高速片间互联完成 layer-wise 的 KV-cache 传输，TP/SP/KVP 均在 scale-up 互联域内完成，在受限的显存和带宽条件下将硬件利用率最大化；</p>
</li>
<li>
<p><strong>部署策略层面：</strong> 采用 PD 分离部署兼顾 TTFT 与 TPOT：Prefill 端通过缩小 Expert-Parallel 域与序列并行分担长序列计算压力，Decode 端以 KV-cache 切分与高并行度降低单卡显存占用，配合异步化 Expert-Parallel Load Balancing 解决大 EP 度下的负载不均。上述并行方案均已适配 constrained decoding、multi-step scheduling 和 MTP 等推理优化特性，实现了万亿参数模型在国产算力上的稳定服务。</p>
</li>
</ul>
<p>LongCat-2.0 验证了国产芯片承载复杂大模型任务的成熟能力，并希望通过开源为行业提供一条可复现的技术路径，推动存量算力在真实场景中的应用价值。</p>
<h2>02 模型全面升级，会执行、会推理、懂交互</h2>
<p>LongCat-2.0 沿用了 LongCat-Flash 的整体设计，并围绕 LongCat-2.0 在长上下文、代码任务和智能体场景中的进一步升级，做了三项关键优化：</p>
<h3>2.1 LongCat 稀疏注意力机制，提升上下文处理效率</h3>
<p>面向智能体任务中的长输入场景，LongCat-2.0 引入 LongCat 稀疏注意力机制（LSA），通过流感知索引、跨层索引和层级化索引三项策略减少碎片化访存和重复索引计算，在保持模型质量的前提下，加速百万级长上下文的训练与推理。</p>
<p><img src="https://p1.meituan.net/meituantechblog/368b1cd0634db5c41b127242d8feee08118728.png" alt=""></p>
<h3>2.2 引入 N-gram Embedding，提升参数利用效率</h3>
<p>LongCat-2.0 在 MoE 专家之外引入 N-gram Embedding 作为新的参数扩展路径。在 MoE 稀疏度已接近 97% 的情况下，将 135B 参数投入 N-gram Embedding 的收益远超继续扩充专家。该模块占比控制在总参数 10% 以内，兼顾了参数收益与结构稳定性。</p>
<p><img src="https://p1.meituan.net/meituantechblog/84d46b968d89efb8fd1bb66d3005680c29580.png" alt=""></p>
<h3>2.3 通过 MOPD 架构在国产算力集群上无缝融合，让模型会执行、会推理、懂交互</h3>
<p>后训练阶段，LongCat-2.0 采用多教师在线蒸馏，将专家分为 Agent、推理和交互三类，分别聚焦自主执行、自适应推理和安全对齐等核心能力。最终通过 MOPD 架构在国产算力集群上无缝融合，使模型兼具深度推理、自主执行与精准交互的综合表现。</p>
<p><img src="https://p0.meituan.net/meituantechblog/7e5f64947ed21d4b1c24d3e94d855844154812.png" alt=""></p>
<h2>03 开源开放</h2>
<p>LongCat-2.0 的开源，是一次技术路径的公开，也是一次生态邀约。</p>
<p>本次开源同步提供 BF16、FP8 以及 INT8 等多精度版本，全面覆盖不同算力平台的部署需求。同时，我们深度拥抱开源社区，将针对国产算力极致优化的推理成果同步开源。这意味着，即使手上没有最新算力，也能基于现有硬件将 LongCat-2.0 稳定跑起来。</p>
<p>我们希望通过这套开箱即用的推理栈，让更多的国产卡包括老卡，都能流畅部署万亿大模型推理服务，在真实生产力场景发挥更大价值。</p>
<h3>🚀 开源链接</h3>
<p><strong>Tech Blog：</strong> <a href="https://longcat.ai/blog/longcat-2.0/" target="_blank" rel="noopener noreferrer">https://longcat.ai/blog/longcat-2.0/</a></p>
<p><strong>Model Weights：</strong></p>
<ul>
<li>HuggingFace: <a href="https://huggingface.co/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">https://huggingface.co/meituan-longcat/LongCat-2.0</a></li>
<li>GitHub: <a href="https://github.com/meituan-longcat/LongCat-2.0" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/LongCat-2.0</a></li>
<li>ModelScope: <a href="https://www.modelscope.cn/collections/meituan-longcat/LongCat-20" target="_blank" rel="noopener noreferrer">https://www.modelscope.cn/collections/meituan-longcat/LongCat-20</a></li>
</ul>
<p><strong>Inference Code:</strong></p>
<ul>
<li>GPU: <a href="https://github.com/sgl-project/sglang/pull/30042" target="_blank" rel="noopener noreferrer">https://github.com/sgl-project/sglang/pull/30042</a></li>
<li>NPU: <a href="https://github.com/meituan-longcat/SGLang-FluentLLM/tree/npu" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/SGLang-FluentLLM/tree/npu</a></li>
</ul>
<p><strong>API Platform：</strong></p>
<ul>
<li><a href="https://longcat.chat/platform/product" target="_blank" rel="noopener noreferrer">https://longcat.chat/platform/product</a></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/368b1cd0634db5c41b127242d8feee08118728.png" type="image/png"/>
    </item>
    <item>
      <title>直播回放·含 ACL&amp;apos;26 杰出论文 | 美团 AI 顶会论文 32 篇精讲</title>
      <link>https://tech.meituan.com/2026/07/11/2026-meituan-32-papers.html</link>
      <guid>https://tech.meituan.com/2026/07/11/2026-meituan-32-papers.html</guid>
      <source url="https://tech.meituan.com/rss.xml">直播回放·含 ACL&amp;apos;26 杰出论文 | 美团 AI 顶会论文 32 篇精讲</source>
      <description>如果你正在关注 AI 前沿，这篇内容值得收藏。2026 年，美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇，进行了 5 大专场直播。</description>
      <content:encoded><![CDATA[<p>🏆 近日，ACL 2026 杰出论文奖在圣地亚哥揭晓，全球仅 18 篇入选，美团履约技术团队的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》上榜啦，一键直达视频回放👉🏻 <a href="https://www.xiaohongshu.com/discovery/item/6a3b54740000000006030031?source=webshare&amp;xhsshare=pc_web&amp;xsec_token=ABh2ziW0cX7XYIsQ1VpYHUl5aZzXTt2-o0yyamYge4z-4=&amp;xsec_source=pc_share" target="_blank" rel="noopener noreferrer">小红书</a> | <a href="https://www.bilibili.com/video/BV1v7jc6BENd/?spm_id_from=333.1387.upload.video_card.click&amp;vd_source=8dac43659650af56650d7a9bc5f083d3" target="_blank" rel="noopener noreferrer">B站</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/f434c8979e7670cd0402c7719141eb91178306.png" alt="图2"></p>
<p>如果你正在关注 AI 前沿，这篇内容值得收藏。</p>
<p>2026 年，美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇，进行了 5 大专场直播。</p>
<p>内容涵盖了大模型推理、智能体记忆与自进化、代码智能、多模态交互、超高清视频生成、本地生活搜索等方向——既有底层能力的突破，也有贴近生活服务的落地探索。</p>
<p>如果你错过了直播，或者想再看一遍👇 五场回放都在这里啦，找到你感兴趣的议题，随时开始。</p>
<p>特别感谢所有讲师与筹备团队的倾力支持！也感谢每一位关注美团技术成长的你！❤️</p>
<h2>专场一：ACL'26 综合专场</h2>
<p>👉 直播回放入口→ <a href="https://www.xiaohongshu.com/collection/item/6a4b729b0de8000000000001?xhsshare=CopyLink&amp;appuid=6a3262ca000000000f03b001&amp;apptime=1783330950&amp;share_id=e51dd478f4b34506aed7a49ca74b9113" target="_blank" rel="noopener noreferrer">小红书</a> ｜ <a href="https://space.bilibili.com/18937923/lists/8321546?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782776&amp;idx=3&amp;sn=77c72b469a871b499a46fe06be73225f&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/fe16b3191f6276cdf692c76bb2b04308356559.png" alt=""></p>
<h2>专场二：ACL'26 履约团队前沿技术专场</h2>
<p><strong>出品人｜</strong> Jichong Gao 美团高级技术专家、Jun Xu 美团高级技术专家</p>
<p>👉 直播回放入口→ <a href="https://www.xiaohongshu.com/collection/item/6a4b72d90de6000000000001?xhsshare=CopyLink&amp;appuid=6a3262ca000000000f03b001&amp;apptime=1783331038&amp;share_id=ca3358c821584b34a480efd8350ed035" target="_blank" rel="noopener noreferrer">小红书</a> ｜ <a href="https://space.bilibili.com/18937923/lists/8370607?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782810&amp;idx=2&amp;sn=aeb92a7c0c0bcf2befa7a201f1d4ece9&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/87835a72dafb62eb0c93a17fdab075ca674240.png" alt=""></p>
<h2>专场三：搜推 ASX 团队专场</h2>
<p><strong>出品人｜</strong> Guojun Yin 美团研究员</p>
<p>👉 直播回放入口→ <a href="https://www.xiaohongshu.com/collection/item/6a4b72f50e97000000000001?xhsshare=CopyLink&amp;appuid=6a3262ca000000000f03b001&amp;apptime=1783478239&amp;share_id=196398bf22d742bda21e83ee981f6615" target="_blank" rel="noopener noreferrer">小红书</a> ｜ <a href="https://space.bilibili.com/18937923/lists/8427999?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782896&amp;idx=2&amp;sn=ce2cb30b2d2b0e9ea12d03561124dd05&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/6498214ebe581bcea5541619c1cd145d359417.png" alt=""></p>
<h2>专场四：ICML'26 通用 Agent 前沿技术专场</h2>
<p><strong>出品人｜</strong> Qi Gu 美团研究员</p>
<p>👉 直播回放入口→ <a href="https://space.bilibili.com/18937923/lists/8471639?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782940&amp;idx=2&amp;sn=4456ee2f95bf8b1016981539d760253f&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/247700c227d0b4f4c7f88bb02adecdbe344171.png" alt=""></p>
<h2>专场五：ICML'26 综合专场</h2>
<p>👉 直播回放入口→ <a href="https://space.bilibili.com/18937923/lists/8485771?type=season" target="_blank" rel="noopener noreferrer">B站</a></p>
<p>📚 论文简介及下载→ <a href="https://mp.weixin.qq.com/s?__biz=MjM5NjQ5MTI5OA==&amp;mid=2651782940&amp;idx=2&amp;sn=4456ee2f95bf8b1016981539d760253f&amp;scene=21#wechat_redirect" target="_blank" rel="noopener noreferrer">点这里</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/cbd47f8df818779808c61e614f6087f7351215.png" alt=""></p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/f434c8979e7670cd0402c7719141eb91178306.png" type="image/png"/>
    </item>
    <item>
      <title>美团 LongCat-2.0 正式发布：在国产算力集群上完成全流程训练与推理的万亿参数模型</title>
      <link>https://tech.meituan.com/2026/06/30/LongCat2.0.html</link>
      <guid>https://tech.meituan.com/2026/06/30/LongCat2.0.html</guid>
      <source url="https://tech.meituan.com/rss.xml">美团 LongCat-2.0 正式发布：在国产算力集群上完成全流程训练与推理的万亿参数模型</source>
      <description>作为业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型（总参数 1.6 T，平均激活约 48 B，动态范围 33B~56B），LongCat-2.0 从零开始预训练，原生支持 1M 超长上下文，其架构设计自始至终围绕一个核心目标：让模型在真实的 Agentic Coding 任务中，更高效、更稳定地完成代码理解、生成与执行。</description>
      <content:encoded><![CDATA[<p>6月30日，美团正式发布新一代万亿参数大模型 LongCat-2.0，并将对外开源。</p>
<p>作为<strong>业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型</strong>（总参数 1.6 T，平均激活约 48 B，动态范围 33B~56B），LongCat-2.0 从零开始预训练，原生支持 1M 超长上下文，其架构设计自始至终围绕一个核心目标：<strong>让模型在真实的 Agentic Coding 任务中，更高效、更稳定地完成代码理解、生成与执行</strong>。</p>
<p>正式版发布前，LongCat-2.0预览版本已通过 OpenRouter 平台和<a href="https://longcat.ai/" target="_blank" rel="noopener noreferrer">longcat.ai</a>面向全球开发者开放调用——截至目前该模型<strong>已跻身 OpenRouter 全球大模型调用量前三</strong>，月调用量在 Hermes、Claude Code 和 OpenClaw 分列全球第一、第二和第三位，<strong>成为最受全球 Agent 开发者欢迎的模型之一</strong>。</p>
<iframe frameborder="0" src="https://s3plus.meituan.net/ddfile/2026-06-30%2011_20_15.mp4" allowfullscreen="true" height="720" width="1280" style="display: block; margin: 0 auto;"></iframe>
<h2>01 国模国芯全栈协同：完成万亿参数 MoE 模型在国产算力上的稳定训练</h2>
<p>LongCat 团队对国产算力的探索始于 2023 年，三年来，团队从千卡起步，逐步攻克算子适配、通信优化、分布式稳定性等基础难题，最终在五万卡集群上完成万亿参数模型的全流程训练与推理。</p>
<p>LongCat-2.0 预训练数据规模超过30Ttokens，覆盖中文、英文、多语言和代码等多类数据；面对万卡级训练中的硬件故障、通信异常、显存压力与数值波动，LongCat 团队从<strong>稳定性、正确性和效率</strong>三方面攻克国产算力训练难题。</p>
<ul>
<li>在<strong>稳定性</strong>上，通过卡间通信异常处理、弹性扩缩卡和自动故障恢复，将月均日故障率降低70%以上；</li>
<li>在<strong>正确性</strong>上，通过自研设计确定性算子、Bitwise 一致性验证和参数检测，保障训练结果的可靠，同时基于实践提升关键模块计算精度、优化 Reduce 逻辑；</li>
<li>在<strong>效率</strong>上，通过流水线调度、显存优化和算子级控核，训练 MFU 提升 1.5 倍。</li>
</ul>
<p><strong>最终，LongCat 实现稳态日吞吐超过1T tokens/day，完成万亿参数 MoE 模型在国产算力上的稳定训练。</strong></p>
<p>在推理阶段，LongCat-2.0 围绕模型、算子和框架进行协同优化：通过大规模专家并行聚合访存带宽，支撑万亿参数 MoE 模型的低延迟解码；将零计算专家机制融入专家并行通信流程，使路由到零专家的 token 真正避免不必要的传输与计算；并针对通信、Attention、GEMM 等核心算子优化调度，结合提前下发与权重预取等框架机制，进一步降低推理链路中的等待开销。</p>
<p><strong>从稳定训练到低延迟推理，LongCat-2.0 验证了我们已具备在国产算力集群上进行大规模模型训练的能力。它不只是“能训出”万亿参数模型，还让万亿参数模型能够在真实任务中稳定运行。</strong></p>
<h2>02 让模型在真实 Agentic Coding 任务中更高效、更稳定地完成代码理解、生成与执行</h2>
<p>LongCat-2.0 的架构设计始终围绕一个核心目标：<strong>让模型在真实 Agentic Coding 任务中更高效、更稳定地完成代码理解、生成与执行</strong>。</p>
<p><strong>1M超长上下文，让 Agent 看见整个项目。传统模型在处理超过 100K 上下文后就开始“遗忘”前面的内容</strong>。LongCat-2.0 采用<strong>LongCat Sparse Attention（LSA）稀疏注意力机制</strong>，在处理长文本时不再“逐字逐句地看”，而是智能筛选关键信息，将计算量从平方级降至线性级。这使得模型在 100 万 Token 的超长上下文中，依然保持精准的信息定位与理解能力。</p>
<p><strong>零计算专家 + ScMoE，让算力用在刀刃上</strong>。代码任务中不同 token 复杂度差异巨大——定义变量名和推导递归算法对算力的需求完全不同。LongCat-2.0 通过零计算专家实现 token 级动态激活（33B~56B），简单 token 不消耗算力，复杂 token 自动获得更多计算资源。</p>
<p><strong>MOPD 多专家融合，一个模型同时擅长写代码、做推理、懂交互</strong>。LongCat-2.0 通过 MOPD 架构融合 Agent、Reasoning、Interaction 三组专家能力——Agent Experts 专攻工具调用与自主纠错，Reasoning Experts 深耕数学与 STEM 推理，Interaction Experts 优化指令遵循与交互体验。推理时由门控网络根据任务类型动态调度最擅长的专家，而非简单合并参数。得益于此，模型在编程、推理、交互等维度均表现突出。</p>
<p><strong>LongCat-2.0 通过精细的架构设计，让万亿参数模型在实际任务中更高效、更稳定地发挥能力。</strong></p>
<p><img src="https://p1.meituan.net/meituantechblog/ef19600fdb0e6868a3574c4a8c7ff746220482.png" alt=""></p>
<h2>03 在编程能力、真实办公场景的复杂任务处理方面表现优异</h2>
<p>综合评测结果显示，LongCat-2.0 凭借卓越的综合性能与稳定的任务表现，<strong>在 Code 和 General Agent 场景表现优异</strong>。</p>
<p><img src="https://p0.meituan.net/meituantechblog/9d8da6909183ad1a8e591186849c0947457784.png" alt=""></p>
<ul>
<li><strong>在编程能力方面</strong>，LongCat-2.0 展现出扎实的综合实力：在考察深层工程能力的 SWE-bench Pro 中获得 59.5，领先Gemini 3.1 Pro（54.2）、GPT-5.5（58.6）和 Claude Opus 4.6（57.3）；在 SWE-bench Multilingual 中取得 77.3 的成绩，与 Claude Opus 4.6（77.8）保持在同一水位；此外，在真实终端指令交互评测 Terminal-Bench 2.1 中取得 70.8，体现了其在真实运维与开发终端任务中的稳定执行与纠错能力。</li>
<li><strong>在真实办公场景的复杂任务处理方面</strong>，LongCat-2.0 表现均衡：在搜索智能体评测集RWSearch中获得 78.8，在生产力场景评测集 FORTE 中获得 73.2 ，在 BrowseComp 中获得 79.9，均达到或接近前沿闭源模型水平，证明了其在多步骤任务规划、复杂工具调用及长程检索执行上的高可靠性，能够较好的契合企业级 Agent 的落地需求。</li>
</ul>
<h2>04 在真实工作场景中，成为大家可靠的“工作伙伴”</h2>
<p>内测期间，我们面向真实工作场景征集了大量真实的用户任务需求，这些来自一线的真实“工作单”，可以看出 LongCat-2.0 在用户的真实工作场景中正在成为他们可靠的“工作伙伴”。</p>
<p><strong>Agent 搭建：一问即得，全闭环交付</strong></p>
<p>通过 LongCat-2.0 搭建的 AI SQL Agent，业务人员可以直接用自然语言查询数据。LongCat-2.0 自动完成全链路闭环——理解问题意图、规划查询步骤，并将数据结果转化为清晰的业务洞察。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>代码库迁移：读懂老代码，重构新架构</strong></p>
<p>给 LongCat-2.0 一个旧版插件代码库和一份新版SDK文档，它能自行分析整体架构、梳理核心逻辑，再将整个插件重构为符合新API的实现——保留全部原有功能，修复潜在隐患，编译一次通过。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>完整应用开发：从一句话到可运行产品</strong></p>
<p>描述一个“儿童AI游戏训练场”的创意，LongCat-2.0 会逐步生成技术选型、页面架构、游戏逻辑与视觉细节——从首页到三个完整可玩的游戏页面，全部代码一次产出，开箱即用。从一句话到可用的产品，将灵感轻松实现。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>3D交互演示：一句话，生成一个3D世界</strong></p>
<p>通过一句话描述，LongCat-2.0 即可生成完整 Three.js 3D 演示：透明烧瓶、荧光液体、泡沫喷发、液面下降和堆积效果全部可交互呈现。所有代码封装在一个 HTML 文件中，打开即用，让创意快速转化为可交互的3D体验。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>AI 小说工厂：从单点灵感到商业变现</strong></p>
<p>基于 LongCat-2.0 构建的“AI小说工厂”，将创意写作升级为自动化内容流水线。用户输入灵感后，系统编排多个 Agent，自动完成世界观构建、并行章节生成、质量评估与回流修订。并通过长上下文能力保障百万字级设定一致性。最终内容可自动适配多平台发布，并由 Web 面板实时监控生成进度与质量状态，实现持续稳定的连载输出。</p>
<p><a href="https://mp.weixin.qq.com/s/9XFcx3fmFcmbry5bHMJsow" target="_blank" rel="noopener noreferrer">查看视频</a></p>
<p><strong>立即体验</strong></p>
<ul>
<li><strong>API 开放平台：<a href="https://longcat.chat/platform/product" target="_blank" rel="noopener noreferrer">https://longcat.chat/platform/product</a></strong></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/ef19600fdb0e6868a3574c4a8c7ff746220482.png" type="image/png"/>
    </item>
    <item>
      <title>ICML 2026 | 美团技术团队学术论文精选</title>
      <link>https://tech.meituan.com/2026/06/29/ICML-2026.html</link>
      <guid>https://tech.meituan.com/2026/06/29/ICML-2026.html</guid>
      <source url="https://tech.meituan.com/rss.xml">ICML 2026 | 美团技术团队学术论文精选</source>
      <description>ICML是机器学习领域最具影响力的国际顶级学术会议之一。大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题，并通过征集和评估具有重要理论价值和实际影响的前沿研究成果，推动领域发展并引领未来研究方向。</description>
      <content:encoded><![CDATA[<p>ICML（International Conference on Machine Learning，国际机器学习大会）是机器学习领域最具影响力的国际顶级学术会议之一。大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题，并通过征集和评估具有重要理论价值和实际影响的前沿研究成果，推动领域发展并引领未来研究方向。2026年，ICML共收到全球篇论文23918投稿，最终6352篇被接收，接收率约为26.6%。本文解读了美团技术团队被收录的13篇论文，覆盖智能体推理、强化学习训练、复杂任务生成、智能体基准测试、监督微调等技术方向。</p>
<h2>01 MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning</h2>
<p><strong>MemOCR：面向高效长程推理的版面感知视觉记忆机制</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2601.21468" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/53ce71427cc5fb26c883af36a738b10569202.webp" alt=""></p>
<p><strong>论文简介</strong>：长时间跨度的智能体推理需要将不断增长的交互历史有效压缩到有限的上下文窗口中。现有的大多数记忆系统将历史序列化为文本，其中token级别的开销是均匀的，且与长度线性增长。为此，我们提出了MemOCR，一种多模态记忆智能体，通过视觉布局实现自适应信息密度的记忆空间分配，从而在紧张的上下文预算下提升长时间跨度推理能力。在长上下文多跳和单跳问答基准测试中，MemOCR优于强文本基线方法，并在极端预算条件下实现了更有效的上下文利用。</p>
<h2>02 ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training</h2>
<p><strong>ScaleEnv: 从零开始构建可扩展的环境合成系统用于通用交互式工具使用智能体的训练</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.06820" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/ccceeac77d665e5ffea65436222decc7118744.webp" alt=""></p>
<p><strong>论文简介</strong>：为智能体配备交互式环境和可验证任务以进行自我探索，对于培养能够适应多样化场景的通用智能体至关重要。我们提出了ScaleEnv，一个完全从零开始构建全交互式环境和可验证任务的框架。ScaleEnv通过程序化测试确保环境的可靠性，通过工具依赖图扩展和可执行动作验证来保证任务的完整性和可解性。在未见过的多轮工具使用基准测试上展示了显著的性能提升，突显了强大的泛化能力。</p>
<h2>03 V_0: A Generalist Value Model for Any Policy at State Zero</h2>
<p><strong>V_0：一种适用于任意策略在初始状态下的通用价值模型</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.03584" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/78419c635c8bc694f07882566afb116176626.webp" alt=""></p>
<p><strong>论文简介</strong>：大语言模型的强化学习训练中的价值模型面临耦合困境：它们需要与更新中的策略同步训练。我们提出了V_0，一种通用价值模型，通过将任务重新定义为上下文学习来预测未见策略的性能，从而将价值估计与特定策略参数解耦。实验结果表明，V_0在GRPO训练过程中追踪策略演化方面优于耦合价值模型，能够优化冷启动预算分配，并在推理路由中逼近性能-成本的帕累托前沿。</p>
<h2>04 Learning to Self-Verify Makes Language Models Better Reasoners</h2>
<p><strong>学习自我验证使语言模型成为更好的推理者</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.07594" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/75add83935b72c67529dc96ae4b6a9b268520.webp" alt=""></p>
<p><strong>论文简介</strong>：近期的大语言模型在为复杂任务生成有前景的推理路径方面表现出色，但在验证自身答案方面仍然薄弱。我们发现学习自我验证能够有效提升生成性能，产生更高效的推理轨迹。我们提出了一个多任务强化学习框架，将生成和自我验证作为两个独立但互补的目标进行联合优化。实验表明，该方法在生成和验证能力上均优于仅进行生成训练的方法。</p>
<h2>05 AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition</h2>
<p><strong>AgentNoiseBench：噪声条件下工具使用型大语言模型智能体的鲁棒性基准评测</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2602.11348" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/31e3e86e970c5c79e9b4d762b09326dd118430.webp" alt=""></p>
<p><strong>论文简介</strong>：随着基于大语言模型的智能体越来越多地部署在实际工作流程中，现有的智能体基准测试不足以刻画智能体在不完美用户指令和不可靠工具反馈下的鲁棒性。我们提出了AgentNoiseBench，一个用于系统评估大语言模型智能体交互式噪声鲁棒性的框架。该基准建模了用户侧指令噪声和工具侧结果噪声两种主要噪声来源，提供模块化噪声注入管道和多维度评估指标。通过对25个工具使用模型的评估，发现工具侧噪声通常比用户侧噪声引起更大幅度的性能下降。</p>
<h2>06 AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation</h2>
<p><strong>AJ-Bench：面向环境感知评估的智能体裁判基准</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2604.18240" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/2b3544e8ab174ad18492a3a6c98ed6b9127010.webp" alt=""></p>
<p><strong>论文简介</strong>：随着强化学习不断推动基于大语言模型的智能体训练规模化，在复杂环境中可靠地验证智能体行为变得日益困难。现有方法依赖基于规则的验证器或 LLM-as-a-Judge 模型，但这些方法难以泛化到狭窄领域之外。Agent-as-a-Judge 通过主动与环境和工具交互以获取可验证的证据来解决这一局限性，但其能力仍未得到充分探索。 我们提出了一个基准测试 AJ-Bench，用于系统性地评估"智能体充当评判者"在三个领域——搜索、数据系统和图形用户界面——中的表现，涵盖155个任务和516条标注轨迹。该基准全面评估了评判智能体在信息获取、状态验证和过程验证方面的能力。实验表明，相比 LLM-as-a-Judge 基线方法，该方法取得了稳定的性能提升，同时也揭示了基于智能体的验证中仍存在的重大开放性挑战。</p>
<h2>07 LUVE : Latent-Cascaded Ultra-High-Resolution Video Generation with Dual Frequency Experts</h2>
<p><strong>LUVE：基于双频率专家的潜空间级联超高分辨率视频生成</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.11564" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/adcdda2e2386d052a06f76362ffc24df164210.webp" alt=""></p>
<p><strong>论文简介</strong>：为解决超高分辨率视频生成中连贯性与算力难以兼顾的难题，该论文提出了基于双频专家的潜空间级联框架LUVE。该框架创新性地采用三阶段架构：先通过低分辨率生成保障运动一致性；接着利用潜空间上采样直接提升分辨率，大幅降低内存与计算开销；最后融合高低频专家细化高分辨内容，全面增强全局语义与局部细节。实验表明，LUVE展现出了卓越的逼真度与内容保真度，其核心思想现已成功应用于美团LongCat-Video模型中。</p>
<h2>08 Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory</h2>
<p><strong>Infinite-World：通过无位姿层次化记忆将交互式世界模型扩展至1000帧</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2602.02393" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/7e37532eff0ab36936a1b9cd21f869e7119212.webp" alt=""></p>
<p><strong>论文简介</strong>：Infinite-World 是面向真实场景中的长程交互式世界模型，其目标是在 1000+ 帧生成中保持稳定的视觉记忆和动作响应。针对真实视频中位姿噪声大、视角回访稀少的问题，论文提出三点创新：用无位姿层级记忆压缩器将历史 latent 压缩为固定预算记忆，降低长程建模成本；用不确定性感知动作标注提升噪声轨迹下的动作学习；再通过高回访数据微调增强 loop closure 能力。整体上，它让世界模型更适合从真实视频学习长时空一致性。</p>
<h2>09 WildActor: Unconstrained Identity-Preserving Video Generation</h2>
<p><strong>WildActor：无约束身份保持视频生成</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2603.00586" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/24933777ccb49e8a29a709b287221cd8309446.webp" alt=""></p>
<p><strong>论文简介</strong>：本文提出 WildActor，一种面向无约束身份保留的视频生成新框架，旨在应对现有方法在动态长镜头和视角剧烈切换时面临的全身体态不一致、面部漂移及姿态僵死伪影。在机制层面，WildActor 构建了含1.6M视频和18M多视角图像的大规模数据集 Actor-18M，有效解决原始数据中的正脸偏置；同时引入非对称身份保留注意力（AIPA）解耦身份与运动生成，并结合身份感知3D旋转位置编码（I-ROPE）显式分离时空 Token，配合视角自适应蒙特卡洛采样实现了鲁棒的任意视角条件控制。实验表明，WildActor 在新构建的 Actor-Bench 连贯叙事与泛化测试中，不仅全身一致性与文本对齐度显著超越现有开源及商业大模型，还验证了其在复杂现实场景下保持物理恒常性的优越性。</p>
<h2>10 Navigating the Pareto Frontier of Alignment: Spectrum-Adaptive Fine-Tuning for LLMs</h2>
<p><strong>SAFT：面向大语言模型的谱自适应微调方法</strong></p>
<p><strong>论文下载</strong>：<a href="https://github.com/sjtu-scx/SAFT/blob/main/SAFT.pdf" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/f7b88b332a240ef7176c970b7c6879cd170832.webp" alt=""></p>
<p><strong>论文简介</strong>：监督微调常用交叉熵作为目标函数，虽然学习高效，但它并非正确率的光滑近似，还会因为特别关注预测概率低的样本从而容易对噪音过度拟合并过度自信。DFT则在梯度层面等同优化正确率的光滑近似函数，在保持训推一致性的同时提升了鲁棒性，但也会削弱对可学习的难样本的学习效率。因此，SFT 与 DFT 构成效率—鲁棒性两个端点，而真实数据应选择哪种折中取决于其未知的内在 SNR。我们提出轻量的 pre-test protocol：用少量训练数据分别训练 SFT/DFT 并在验证集比较表现，SFT 更优则判定为高 SNR 并选择几何插值Geo-SAFT，DFT 更优则判定为低 SNR 并选择调和插值Har-SAFT。相比仍保留低置信梯度发散的线性插值，SAFT 通过数据自适应的几何/调和非线性插值匹配不同噪声 regime，从而获得更优的鲁棒性—效率 Pareto trade-off。</p>
<h2>11 TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios</h2>
<p><strong>TRIP-Bench：真实场景中长时域交互式智能体的基准评测</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2602.01675" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/99f9fc23599da395c9ace3cba6c7d90787516.webp" alt=""></p>
<p><strong>论文简介</strong>：本论文提出了 TRIP-Bench，一个面向长程交互式 Agent 的旅行规划评测基准。它基于真实世界数据构建，包含 18 个工具和 40 多类旅行约束，重点考察模型在多轮对话中保持全局约束、调用工具、处理用户需求变化和方案反复修改的能力。其困难任务最长可达 15 轮用户交互、150 次以上工具调用，甚至超过 20 万 tokens 上下文。实验表明，现有先进模型在该基准上仍表现有限。论文进一步提出 GTPO 多轮强化学习方法，通过奖励归一化和轮次级奖励差分提升模型鲁棒性，使 Qwen2.5-32B-Instruct 在评测中超过 Gemini-3-Pro。</p>
<h2>12 InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution</h2>
<p><strong>InfVSR：面向一致性驱动的流式生成视频超分辨率</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/pdf/2510.00948" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/8120868b5fc25080dc2c2986f2323c5468146.webp" alt=""></p>
<p><strong>论文简介</strong>：本文提出了 InfVSR，一种面向一致性驱动的流式生成视频超分辨率新框架，旨在解决扩散式视频超分方法在长视频场景中存在的推理效率低、显存占用大和时序不一致问题。其核心机制包括：将预训练视频 DiT 改为因果流式架构，引入滚动 KV 缓存以维持局部过渡平滑性；设计联合视觉引导通过交叉注意力注入全局语义锚点，抑制累积误差漂移。训练阶段结合分块像素监督与跨块分布匹配，双重约束时序一致性，并将扩散过程蒸馏为高效单步推理。实验表明，InfVSR 在多项基准上取得 SOTA 性能，时序一致性显著领先，推理速度提升 58 倍且长序列显存占用恒定。</p>
<h2>13 DRIVE: Distributional and Retrieval-Augmented Bidding with Value Evaluation</h2>
<p><strong>DRIVE</strong>：基于混合分布与检索增强的价值评估出价策略</p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2606.14192" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/3c5da2f5bb1f05cb0e55acd180e633f544634.webp" alt=""></p>
<p><strong>论文简介</strong>：针对标准Decision Transformer (DT)在复杂竞价环境中的三大痛点（“平均动作”陷阱、长尾幻觉、缺乏推理优化），提出“生成—检索—评估”闭环框架：1）用高斯混合模型替代确定性输出，解决多模态策略坍缩问题；2）引入检索机制增强长尾场景记忆，避免参数化模型幻觉；3）通过IQL Critic实现闭环择优，对生成动作与历史动作进行实时评估。该方案显著提升决策鲁棒性。</p>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/53ce71427cc5fb26c883af36a738b10569202.webp" type="image/webp"/>
    </item>
    <item>
      <title>LongCat 开源 VitaBench 2.0：长期动态智能体基准新标杆</title>
      <link>https://tech.meituan.com/2026/06/29/LongCat-VitaBench-2.0.html</link>
      <guid>https://tech.meituan.com/2026/06/29/LongCat-VitaBench-2.0.html</guid>
      <source url="https://tech.meituan.com/rss.xml">LongCat 开源 VitaBench 2.0：长期动态智能体基准新标杆</source>
      <description>VitaBench 2.0 是首个真实生活场景下面向长期动态用户建模的智能体评测基准，它系统性地评测大语言模型在长期、真实、动态的用户互动中个性化与主动性的能力。</description>
      <content:encoded><![CDATA[<p>一个经常加班的白领，一个带着孩子出游的父亲，你的AI助理能分清他们需要什么样的服务吗？</p>
<p>现实是，它常常分不清。</p>
<p>AI能执行你明确的指令，却很难记住那些藏在场景和身份背后的真实需求。它们是真的无法理解，还是“情商”不够高呢？</p>
<p>自去年10月发布了 <strong>VitaBench 1.0</strong>，首次定义了生活场景下智能体任务的复杂度，美团 Longcat 团队再次推出 VitaBench 2.0，它不再仅仅关注任务有多难，而是将目光投向了更深层次的挑战。</p>
<p><strong>VitaBench 2.0 是首个真实生活场景下面向长期动态用户建模的智能体评测基准，它系统性地评测大语言模型在长期、真实、动态的用户互动中个性化与主动性的能力</strong>。</p>
<p><strong>VitaBench 2.0 的 核心“硬核”看点</strong>：</p>
<ul>
<li>高难度业界首创：首次将智能体场景与丰富用户生态相结合，打造面向长期动态用户建模的智能体基准。其包含56名真实特征用户、819个复杂任务、超2000个动态偏好及66个可执行工具。</li>
<li>超长跨度动态追踪：平均每位用户包含 2093 个交互事件，平均时间跨度长达 1580 天，严格按时间线向 Agent 暴露，真实还原用户偏好的演进与漂移。</li>
<li>统一评测生态：针对长文本上下文学习（In-context learning）与智能体记忆策略（Memory Strategy）的统一评测平台。</li>
</ul>
<h2>01 设计原理：VitaBench 2.0的三维解构</h2>
<p>能得出这些结论，得益于VitaBench 2.0的核心设计。它不再是简单的问答，而是围绕三大创新构建了一个前所未有的评测体系。</p>
<p><img src="https://p0.meituan.net/meituantechblog/ecfdc52ee4ab7253a877d5df75217f21127484.webp" alt="图1：VitaBench 2.0 概览图"></p>
<h3>1.1 搭建“人生副本”：让AI在真实用户轨迹中接受考验</h3>
<p>不同于一次性的问答，VitaBench 2.0为56位虚拟用户，在送餐、到店、差旅等多个真实领域中，构建了包含2000多种动态偏好、跨度长达数年的生活轨迹。</p>
<p>这背后是庞大而真实的数据支撑。如下图所示，这些图表直观地展示了我们构建的用户画像和偏好分布的真实性与复杂性。</p>
<p><img src="https://p0.meituan.net/meituantechblog/54c8ca3a15f23f55b88d079885aedf63148034.webp" alt="图2：VitaBench 2.0 用户画像统计图"></p>
<p><img src="https://p0.meituan.net/meituantechblog/765450b81465c59972ae583ca0946e64149788.webp" alt="图3：VitaBench 2.0 用户偏好统计图"></p>
<p>具体来说，这个数据生态包含：</p>
<ul>
<li>56个拟真用户，每个用户都拥有基于真实世界统计数据构建的独特身份、习惯和需求。</li>
<li>819个可执行任务，贯穿于用户的整个生命周期。</li>
<li>用户的偏好不是静态标签，而是会随着时间、事件而动态演变，平均每个用户的偏好会发生超过48次动态变化。</li>
</ul>
<p>这些偏好被巧妙地嵌入到碎片化的互动历史中，包括对话记录和行为日志（如浏览、搜索、下单）。智能体必须像侦探一样，从这些混杂着“信号”与“噪音”的线索中，持续对用户进行理解。</p>
<h3>1.2  引入“时间标尺”：将持续理解作为核心目标</h3>
<p>传统的Agent评测关注“单个任务是否完成”，而VitaBench 2.0的核心目标是评测<strong>智能体是否在持续理解一个动态的人</strong>。</p>
<p>为此，我们将评测的时间轴拉长到了前所未有的尺度，用户的平均交互周期长达<strong>1580天（约4.3年）</strong>，最长甚至达到&nbsp;<strong>2,974</strong> 天。在这漫长的时间线里，智能体需要不断地<strong>提取、利用、并更新</strong>对用户的理解，才能在后续的任务中做出正确决策。这从根本上改变了评测的焦点，从单次任务的成功，转向了对用户偏好的考核。</p>
<h3>1.3  设立“记忆擂台”：对决AI的两种记忆模式</h3>
<p>为了探究记忆在长期用户建模中的作用，VitaBench 2.0搭建了首个真实用户场景下的统一长期智能体评测平台，通过可扩展的接口，让两种代表性机制在此对决：</p>
<ul>
<li><strong>智能体记忆</strong>： AI自己决定记住什么、忘记什么，主动维护一个精炼的用户档案。</li>
<li><strong>RAG记忆</strong>： 像一个外部搜索引擎，根据当前任务检索最相关的历史片段。</li>
</ul>
<p>通过对比这两种模式，我们可以清晰地看到不同记忆架构，以及同架构下的不同设计对个性化决策的真实影响，从而回答“AI应该如何记忆”这一关键问题。同时，为了考验AI的“眼力劲”，我们还设计了主动性任务。在这些任务中，AI必须意识到信息不足并主动提问，而不是盲目决策。</p>
<h2>02 核心洞察：用数据看清模型的短板</h2>
<p>VitaBench 2.0不仅给出了总分，更用数据揭示了模型们犯错的具体原因。如表1所示，这是主要模型在不同记忆设置下的性能排行榜。</p>
<p><img src="https://p1.meituan.net/meituantechblog/521cabb68ee8fad43452344cba3bb4a1649960.webp" alt="表1：主要模型在不同记忆设置下的性能表现"></p>
<p>从排行榜（表1）可以看出，即使在能看到全部历史记录的“开卷”模式下，最强的模型Claude-Opus-4.6的平均分也刚过0.5，说明从海量信息中准确提炼偏好本身就比较困难。而一旦切换到更真实的记忆模式，模型的表现出现了不同程度的下滑。</p>
<p><strong>洞察一：时间越长，AI忘得越快</strong></p>
<p>如下图所示，随着任务序列索引增加（即时间推移），所有模型的平均性能都在下降。这说明，无论是处理超长上下文的能力，还是记忆模块的累积误差，都严重限制了AI的长期服务能力。</p>
<p><strong>更关键的是，记忆并没有成为解药</strong>。对比实验结果发现，大部分模型在接入Agentic Memory或RAG Memory后，性能反而低于直接使用全历史记录的场景——<strong>记忆不是装上就好</strong>，如何正确更新、检索和利用，才是真正的挑战。</p>
<p><img src="https://p1.meituan.net/meituantechblog/212aa3a638a9bcacbbcadea7718d77d628306.webp" alt="图4：模型性能随任务序列（时间）的衰减分析"></p>
<p><strong>洞察二：高“智商”不等于高“情商”</strong></p>
<p>一个常见的假设是，开启模型的“思考模式”能提升其表现。然而，VitaBench 2.0 的实验结果给出了相反的答案：<strong>开启思考模式，在个性化任务上并不总是有帮助</strong>。</p>
<p>下图展示了模型在开启/关闭思考模式下的性能与效率关系。横轴是完成任务所需的交互轮数（越少越好），纵轴是平均性能（越高越好），理想的模型应位于左上角。可以看到，开启思考模式的点并没有稳定地比关闭模式更优越。</p>
<p><img src="https://p0.meituan.net/meituantechblog/5e633bfcc648e2d8d5b34eaaa9469a7048792.webp" alt="图5：开启/关闭思考模式下的模型性能与效率"></p>
<p><strong>洞察三：AI普遍缺乏“主动沟通”的意愿</strong></p>
<p>模型普遍缺乏在信息不足时主动提问的“眼力见”。所有模型家族在需要主动提问的任务上，得分都出现了“断崖式”下跌。例如，Claude家族的平均分从46.0骤降至27.4。这表明，AI倾向于“想当然”，而不是在不确定时“多问一句”。</p>
<p><img src="https://p0.meituan.net/meituantechblog/dc9b1835d1107a759336fabf3ba6870074674.webp" alt="图6：模型在主动性任务上的性能表现"></p>
<p><strong>洞察四：就算“喂到嘴边”，AI也未必会吃</strong></p>
<p>为了分离“提取偏好”和“利用偏好”这两个难题，我们直接把真实用户偏好告诉模型。虽然性能有所提升，但仍有很大进度空间。<strong>即便把真实偏好直接告诉模型，多数模型仍然失败</strong>。这说明，即使拥有了准确的用户画像，在高压、多约束的决策中正确应用这些偏好，本身就是一个巨大的挑战。</p>
<p><img src="https://p1.meituan.net/meituantechblog/cf75832fa9983f74bb404bf899cac91223446.webp" alt="图7：在提供真实偏好下的模型性能"></p>
<p><strong>洞察五：从“工具失误”到“情商不足”的瓶颈转移</strong></p>
<p>我们对模型的失败原因进行了分类统计。在由<strong>66个真实工具</strong>构成的复杂生活服务场景中，早期模型更多地犯下工具使用错误（A类），例如选错API或填错参数。而更强的模型（如DeepSeek-V4-Pro）虽然工具用得更好了，但在偏好理解和应用（B类）上的失败却成了主要矛盾。这表明随着模型基础能力的提升，<strong>个性化已是当前 Agent 的最大瓶颈</strong>。</p>
<p><img src="https://p1.meituan.net/meituantechblog/8cdd5784d215584793d4eabed47c184f59698.webp" alt="图8：模型失败模式分析（DeepSeek家族为例）"></p>
<h2>03 总结：定义下一代智能体评测范式</h2>
<p>VitaBench 2.0清晰地揭示了，当前AI在成为“高情商助理”的路上，依然任重道远。</p>
<p>它的核心价值，在于推动了评测范式的演进：<strong>从单点任务到长期陪伴，从被动执行到主动沟通，从黑盒到透明</strong>。这使得VitaBench 2.0成为一座连接技术与产品的“桥梁”，它用可量化的数据回答了“我的AI为什么不够好用”的问题，并为开发者指明了模型在“服务于人”这一终极目标上的具体短板。</p>
<p>我们希望，VitaBench 2.0能成为一个起点，激发更多研究关注智能体的个性化、记忆和主动性，共同推动AI从一个强大的“工具”进化为一个有温度的“伙伴”。</p>
<p><strong>VitaBench 2.0 已全面开源，欢迎各大模型前来接受“情商”大考</strong>。</p>
<p><strong>开源地址</strong></p>
<ul>
<li><strong>项目主页</strong>： <a href="https://vitabench2.github.io/" target="_blank" rel="noopener noreferrer">https://vitabench2.github.io/</a></li>
<li><strong>论文链接</strong>： <a href="https://arxiv.org/abs/2605.27141" target="_blank" rel="noopener noreferrer">https://arxiv.org/abs/2605.27141</a></li>
<li><strong>GitHub</strong>： <a href="https://github.com/meituan-longcat/vitabench-2.0" target="_blank" rel="noopener noreferrer">https://github.com/meituan-longcat/vitabench-2.0</a></li>
<li><strong>HuggingFace</strong>：<a href="https://huggingface.co/datasets/meituan-longcat/VitaBench-2.0" target="_blank" rel="noopener noreferrer">https://huggingface.co/datasets/meituan-longcat/VitaBench-2.0</a></li>
</ul>
]]></content:encoded>
      <enclosure url="https://p0.meituan.net/meituantechblog/ecfdc52ee4ab7253a877d5df75217f21127484.webp" type="image/webp"/>
    </item>
    <item>
      <title>美团技术团队顶会论文分享：搜索推荐ASX专场</title>
      <link>https://tech.meituan.com/2026/06/18/2026-ASX.html</link>
      <guid>https://tech.meituan.com/2026/06/18/2026-ASX.html</guid>
      <source url="https://tech.meituan.com/rss.xml">美团技术团队顶会论文分享：搜索推荐ASX专场</source>
      <description>美团业务研发平台/搜推 ASX (Agentic System X)团队聚焦构建大模型为基础的 Agent 技术体系，在大模型后训练、Agentic 强化学习以及多模态理解等核心前沿方向持续深耕，已在 ICLR、NeurIPS、CVPR、AAAI 等 AI 领域的国际顶会发表数十篇高质量研究成果。本文精选了6篇进行解读，希望对大家有所帮助或启发。</description>
      <content:encoded><![CDATA[<p>美团业务研发平台/搜推 ASX (Agentic System X)团队聚焦构建大模型为基础的 Agent 技术体系，在大模型后训练、Agentic 强化学习以及多模态理解等核心前沿方向持续深耕，已在 ICLR、NeurIPS、CVPR、AAAI 等 AI 领域的国际顶会发表数十篇高质量研究成果。本文精选了6篇进行解读，希望对大家有所帮助或启发。</p>
<h2>01 Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards</h2>
<p><strong>上下文轨迹老虎机：面向可验证奖励的强化学习</strong></p>
<p>论文下载：<a href="https://arxiv.org/abs/2602.08499" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/b59c0ffafdeba4539136582e0271b740362659.png" alt=""></p>
<p><strong>论文简介</strong>：现有基于规则奖励的强化学习后训练通常直接使用最近一轮 rollout 进行策略优化，其中，低质量样本会引入噪声，高质量样本又常在单次使用后被丢弃，导致训练不稳定、样本利用不足。本文提出在线样本调度算法 CBS，将样本选择建模为上下文多臂老虎机问题，把每个候选样本视为 arm，并以训练后带来的性能增益作为奖励；通过轻量神经网络预测样本价值，并结合在线反馈动态调度。实验表明，CBS 可与多种策略优化方法结合，在 6 个数学推理数据集上稳定提升性能和训练效率。</p>
<h2>02 ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning</h2>
<p><strong>ResRL：通过负样本投影残差强化学习提升大语言模型推理能力</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2605.00380" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/c3dfb092a8e1937a69abc1722d9331f0509496.png" alt=""></p>
<p><strong>论文简介</strong>：本文提出 ResRL，一个负样本强化学习的新算法，旨在解决RLVR 提升LLM推理能力却损伤了输出多样性的问题。我们发现根因是惩罚负样本时误伤了正负样本共享的有效语义。ResRL 用 SVD 正确子空间 +投影残差，让惩罚只打在“真正的错误方向”上--数学超 NSR 9.4%、代码刷新 CodeForces SOTA、ALFWorld 超 PPO 7.8%，且 Pass@1 与 Pass@k 兼得。</p>
<h2>03 CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling</h2>
<p><strong>CDRRM：对比驱动的评分准则生成以实现可靠且可解释的奖励建模</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2603.08035" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/8847ebcc0f8b9e40bc4e27cf77c58e83700241.png" alt=""></p>
<p><strong>论文简介</strong>：本文提出 CDRRM，一个对比驱动的评分准则生成与奖励建模框架，旨在提升LLM对齐中奖励模型的可靠性、可解释性与数据效率。传统奖励模型是“黑箱”且依赖昂贵标注；现有准则方法存在冗余与偏见。CDRRM采用“对比-聚合”流程：先对比好/差回答定位关键差异，再聚合为简洁的任务相关准则，指导评判模型。实验表明，CDRRM在三个基准上达最先进水平，缓解话痨、位置等偏见，且仅用3千样本让未微调模型超越全量微调基线，兼具高效与可解释性。</p>
<h2>04 LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services</h2>
<p><strong>LocalSearchBench:真实本地生活服务中的智能体搜索基准评测</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2512.07436" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p1.meituan.net/meituantechblog/169201562bedc76379b2721360d481a3524305.png" alt=""></p>
<p><strong>论文简介</strong>：本文针对本地生活服务领域智能体搜索的研究空白，构建LocalSearchBench评测基准。该基准涵盖国内 9 座城市、6 大服务品类，包含超 134 万商户数据与 900 道用户多跳问答任务，同时配套交互环境 LocalPlayground 与商户检索工具 LocalRAG。实验测评 16 款主流大语言推理模型后发现,当前模型在此类任务表现不佳，最优模型 DeepSeek-V3.2 答题正确率仅 35.60%，普遍存在信息完整性、可信度不足等问题。研究还剖析了模型工具调用、多跳推理等典型缺陷，为本地生活服务场景下智能体搜索的模型训练和基准测试提供了重要支撑。</p>
<h2>05 DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain</h2>
<p><strong>DiningBench：饮食领域感知与推理的层次化多视角基准</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2604.10425" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/147fffac098126cce65e2db924ae00c0336417.png" alt=""></p>
<p><strong>论文简介</strong>：本论文提出 DiningBench，一个面向饮食领域的层次化多视角 VLM 评测基准，旨在弥补现有数据集任务单一、视角有限和营养标注不足的问题。该基准包含细粒度分类、营养估计和视觉问答三类任务，覆盖 3,021 道菜品和多视角图像。通过评测 29 个主流VLM模型，揭示现有模型在细粒度识别、营养推理和多视角融合上的不足。</p>
<h2>06 Mem²Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation</h2>
<p><strong>Mem2Evolve：通过协同进化能力扩展与经验蒸馏实现自进化智能体</strong></p>
<p><strong>论文下载</strong>：<a href="https://arxiv.org/abs/2604.10923v1" target="_blank" rel="noopener noreferrer">PDF</a></p>
<p><img src="https://p0.meituan.net/meituantechblog/383439ef9a174a64e2bb1775919ae3c3476454.png" alt=""></p>
<p><strong>论文简介</strong>：本文提出 Mem2Evolve，一个面向大语言模型智能体的自进化框架，通过 Asset Memory 与 Experience Memory 双记忆机制，协同实现能力扩展与经验积累。该框架可在任务执行中动态复用或创建工具与专家智能体，并从成功和失败轨迹中蒸馏可迁移经验。实验覆盖 6 类任务、8 个基准，结果表明 Mem2Evolve 显著优于普通 LLM 及单一进化策略，展现出更强的持续学习与任务泛化能力。</p>
]]></content:encoded>
      <enclosure url="https://p1.meituan.net/meituantechblog/b59c0ffafdeba4539136582e0271b740362659.png" type="image/png"/>
    </item>
  </channel>
</rss>