本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。
本篇博客在美团内部发表之后获得了较多的关注,我们发现大家对Agent评测的热情非常高,因此我们决定将内部博客进行公开,想把这些经验分享给更多的同学,希望对大家有所启发或帮助。
评测的核心目的是为了回答 Agent 的好不好?以及到底哪里好,哪里不好? 从而为下一轮迭代指明方向。评测是Agent效果的“精密量具”。
这也是为什么 Agent 评测不能只停留在离线打榜,更不能只看某次 Demo 的表现。它必须服务于真实业务中的研发、上线、回归、优化和规模化落地。
而Agent评测的基石是观测,因此我们得出了Agent研发公式 —— 观测 + 评测 = 持续迭代
评测方法会随着 AI 形态变化而变化,大致经历了三个阶段:

传统机器学习更像在回答“算得准不准”。 大模型评测开始回答“模型能力强不强”。 而 Agent 评测真正要回答的是:
当模型被放进一个真实系统里,和 Prompt、Skill、工具链、记忆、状态管理、业务流程耦合在一起后,它能不能稳定交付好的结果。
这意味着 Agent 的评测对象已经不再是单一模型,而是一个“模型 + 系统 + 工具 + 流程”的复杂系统。
在真实场景中,两个 Agent 可能最终都“做对了”,但工程价值完全不同:
如果只看最终答案,这两者会被误判为同一水平;但从规模化、成本优化、用户体验的角度看,差别非常大。
因此,Agent 评测至少需要覆盖四层内容:
从这个意义上讲,自2023年GPT爆火以来,Agent发展从ChatBot形态快速发展至ClaudCode、OpenClaw这样的多功能长程Agent,Agent能力日渐强大,Agent评测正在从“答案评测”走向“行为评测”。
有一个朴素的认知:Agent 属于广义的 SaaS 层,大模型赋予Agent泛化能力但也带出随机性的问题,而用户仍旧期望得到一个稳定可靠的智能体。为了弥合“随机性”与“可靠性”之间的鸿沟,我们必须回归工程视角看待Agent —— 看不见的问题,几乎不可能被稳定解决。
Agent 的一次执行通常包含如下链路:

只要其中任意一层出问题,最终效果都可能劣化。为了结果稳定,我们需要过程稳定。但如果日志系统只能看到“用户说了什么”和“最后回复了什么”,就几乎无法判断问题根因。正是基于“我想看Case却发现没打日志”这个朴素的问题,工业界发展出了 Trace 系统,将黑盒内部的逻辑推理过程进行全路径的披露,将所有影响模型输出的输入信息都记录下来。
对 Agent 的每一个“隐形动作”进行精准观测,是实现从“概率性生成”向“工业级可靠性”跨越的必由之路。
经过前文的论述,我们知道Agent评测本质是在回答好不好,为迭代指明方向。而Agent评测本身既要关注结果(Response)也要关注过程(Trace或者叫做Trajectory)。
有的同学会好奇,为什么一定要“搭桥”?这是因为Agent评测体系必须追求业务价值与评测指标之间的解释性。而Agent 评测的难点之一,是模型能力指标和业务结果指标之间有天然鸿沟。

这两类指标不能直接映射,中间必须有一层面向任务系统的桥梁指标。我们提供一种分层思路如下:

以 AI 搜索为例,业务可能关心DAU、留存和点击;搜索系统本身关心召回率和点击率;Agent 层则关心意图识别是否准确、检索是否有效、结果整合是否可信。
只有把这些层次串起来,才能真正回答“为什么业务指标变差”以及“模型能力提升为什么没有带来业务收益”。这件事必须依赖真正懂业务流程的人来共同建立指标体系。
经过第一章的介绍,我们知道,Agent的核心目标就是要稳定地交付好的结果。行业内 Agent 评测大量借鉴了大模型评测的方法论,总体上可以拆成客观评测和主观评测:

因此更现实的做法通常是:
“好不好”是一个主观问题,主观的标准需要对齐,否则我们不能确定某次迭代之后,到底是指标的抖动带来的提升还是真实的效果提升。
在评测实践中,真正困难的不是“没有人会评”,而是“不同的人评得不一样,机器和人评得也不一样”。在过去一年,我们图灵团队深度BP业务方的过程中,我们发现多个团队相继踩入了相同的坑。
图灵评测积累的关键认知可以概括为“人人对齐和人机对齐”,具体如下:

具体如何进行对齐呢?最佳实践是把模糊指标下钻成更细的评测Rubric(或者叫评测维度:学界关于评测维度dimension和评测规则rubric的说法尚未统一,我们这里与开源项目Arize AI对齐),再把每个Rubric尽可能二元化。具体如下:
这种拆解法的价值在于:从“主观的模糊感受”转向“可判断的事实依据”,用下钻降低模糊度,从而降低人与人之间、人与机器之间的分歧。应用这套方法,数字站长的人机一致率可以达到99%。Beam以图灵的二元化方案改造评测体系,人机一致率从62%提升到92%。
下面我们分享两个案例。
案例一:如何评价初中生作文的好坏?(满分40分)

案例二:以骑手外呼场景模型回复是否“口语化”举例
经典错误示范 —— 请判断大模型的回答是否口语化,并按照0到10分打分。
下钻与二元化之后的改进版:
补充:标注和评测的关系是什么?
其中,标注是一种动作,而评测是一套目标导向的判断流程。机器预标注可以帮助人工提效,但只有在人机一致率保障才能称为自动化评测,否则只是机器标注。
从执行链路看,Agent 评测可以被拆成五个关键环节,
这5个环节与线上AB、持续观测共同构成了Agent迭代的数据飞轮。
绝大部分新上手Agent评测团队都有一个误区 —— 多方调研总结设计一个复杂精妙的评测指标体系,而越复杂的指标越难以执行和对齐。
而Agent评测是一门实践科学。起步阶段“让数据飞轮高效运转起来”的意义远大于“设计一个复杂精妙的评测体系”。评测体系的建立不是一蹴而就的,而是依靠 Good Case 和 Bad Case 喂养的。
因此 ,Agent 评测指标体系的搭建最佳实践路径如下:
其中,Bad Case 的价值往往更高,因为它最容易暴露能力边界和系统短板;而 Good Case 的作用则是帮助团队定义高质量完成的范式。
一个成熟的评测团队,核心能力不是一开始就搭出完美系统,而是能把线上问题、失败样本、模糊反馈不断转化成结构化评测资产。我们通过Bad Case和Good Case修正评测体系的目标,逐步修正“独裁者”与真实目标之间的负面偏差。例如履约数字站长业务,项目启动之处只有20多个评测指标,而经历1年时间推全之后,我们扩展到了近200个指标。
从GPT 3.5发布至今,虽然基座能力发生了天翻地覆的变化,但是模型能力终究不是万能的。在过去三年的Agent实践中,我们遇到过大量脱离实际的“许愿式”需求。我们要知道模型是训练出来的,模型本身拟合了Token的概率分布,即便在大规模参数下会产生能力的“涌现”,但模型能力的提升依旧强依赖语料的输入,尤其是高质量语料的输入。无论是早期的RLHF,还是如今的DPO、GRPO等算法,虽然训练架构在不断简化,但对高质量核心数据的依赖从未改变。
例如字节专门设立了众包专家标注平台 Xpert,用于生产地理、代码、法律、医学等专业领域的高质量数据,以此支撑豆包基座模型的迭代训练。基座模型能力的提升,大家的直观感受就是它在一个又一个垂直领域的表现越来越好。
因此,当我们在特定垂域面临业务知识语料匮乏(或公网无公开高质数据)的挑战时,通过引入行业专家的知识输入来补足模型/Agent的能力,就成了破局的关键——尤其是在项目的冷启动阶段。

呼应前文,评测的目的是回答“Agent好不好”,那么谁来定义“好不好”呢?靠最懂业务最有Sense的行业专家。
这个章节讲述的是图灵评测从履约的项目出发,又经过这1年多BP公司各个业务方的过程中沉淀的核心方法论。
FAQ
Q1:“独裁者”必须是1个人吗,还是1个团队共同遵循一套评测规范即可?
首先一个团队需要遵循同一套评测体系。独裁者的作用多方征求意见并整合评测体系,当项目方观念无法对齐的时候,由独裁者拍板定论,避免评测体系分化带来项目方各自为政以及内部拉扯带来的损耗。
Q2:评测体系依赖“独裁者”,存不存在风险?
我们要认清一个事实,评测体系是不断演进的。从业务冷启动到扩量再到全量,这个过程中用户从愿意尝鲜的AI爱好者扩展到全部用户,用户画像会发生明显的偏移。这导致评测目标需要随着业务的扩量不断地发生调整。独裁者的价值更多的体现在拉齐标准,评测目标更多的是由真实的业务场景中BadCase/Good Case修正并驱动的。当然,我们需要在评测标准建立之初选出最懂业务的人来制定评测体系。
Q3:冷启动阶段一定要设立种子评测集吗?能不能直接小流量开灰上线,直接收集Good Case和Bad Case来驱动评测呢?
冷启动阶段是否必须设立种子评测集,本质上是一个风险与成本的Trade-Off。
为什么建议设立种子集:大模型具有随机性,Corner Case 可能会导致Agent体验剧烈偏移。因此,需要通过回测保证Agent基线能力,不断融入Good Case和Bad Case来拓宽Agent的能力边界。
关于小流量开灰的策略:如果业务场景容错率高,或者构建高质量种子集的成本远超线上试错带来的负面反馈,可以尝试小流量上线收集线上case。
推荐落地方案:人工生产少量评测集后,AI辅助生成或扩写,以较低成本完成冷启动的种子评测集构建。
Q4:我们邀请的行业专家对“好”的定义不一致应该怎么办?
答:最朴素且有效的方法,邀请一批行业专家定义“好”的标准,从中抽取共性的部分建设评测体系。例如邀请金牌销售来定义优秀的销售SOP。
那么非共性的部分就没有价值了吗?并非如此。对于专家意见不一致的部分,往往意味着业务本身存在多种优秀策略。我们可以将这些分歧转化为 Agent 的不同风格或策略分支(例如:AI电销中,老练激进派 vs 细水长流派),并允许在不同的测试集(Benchmark)中独立评测。这些分歧点非但不是噪声,反而会成为 Agent 未来走向精细化迭代、覆盖更多长尾场景的重要养分。
2023年GPT爆火,2024年工作流出现,去年 Claude Code发布,再到今年的龙虾热、爱马仕热,长程Agent逐渐进入了大众视野。Agent Harness也全面进入长程Agent时代。
长程Agent(Long-horizon Agent)与短程Agent的区别,在于它如何处理“时间跨度带来的复杂性”:

这些差异会为观测评测带来怎样的变化呢?
短程Agent时代的评测对象相对简单。ChatAgent 时代的典型输入输出形态是:Query -> Answer。
这类场景的共同特点是:Agent 更多是在“回答问题”,进行少量的系统操作,而不是“进入操作系统执行任务”。典型应用场景,例如AI搜索、客服机器人。此类Agent评测重点通常落在回答本身,例如:

在过去1年的发展中图灵形成了成熟的解决方案,包括人工评测、机器评测,部分案例如下:

3.2.1 长程Agent带来评测范式变化
长程 Agent 解决的不是“回答一个问题”,而是“完成一个复杂任务”。它通常需要:
让我们回顾一下观测和评测的目标,带着这个目标去看长程Agent

3.2.2 Skill评测
在讲Skill评测之前,我们先分享一下我们关于26年春节后这一轮龙虾/Skill热潮的调研。
谁在提出龙虾和Skill的评测需求(2月至今龙虾/Skill热潮的用户画像)?
总结起来目前龙虾和Skill相关需求主要 广义的运营提效 场景,大致可以分成三类:

用户规模正在从少量专业角色扩展到更广人群
这会带来一个直接结论:
未来需要评测的人,不只是一小撮产运研同学,而可能是每一个会创建、修改、接入 Skill 的人。
这对评测系统提出了新的要求:
当前的本质痛点
本质在于 —— 大家不知道怎样写好 Skill,也缺乏对 Skill 全生命周期进行评测的工具。
为了方便大家理解,我们将Skill全生命周期拆解如下:

综上,Skill评测的痛点总体可以拆解成三个方面:

面向Task的评测
2026年1月9号,Anthropic发表了一篇博客揭秘AI Agent评估,在这篇博客中首次提到了面向Task的长程Agent评测。文中对Task,定义为“具有明确输入和成功标准的单个测试”。
我们综合了Anthropic以及开源软件对Task的定义,简化如下。

prompt定义了我们的问题/诉求,expeted behavior定义了我们预期Agent达成的行为,当我们在正式或测试环境中向Agent发送promt,通过trace获取到长程Agent真实的执行路径,就可以得到(prompt - expeted_behavior - trace)三元组,类似于短程Agent的(query - ground_truth - answer),即可进行评测。
3.2.3 长程Agent评测与短程Agent评测的差异
可以把两者的差异总结如下:

最本质的变化是:
ChatAgent 评测关心“说得好不好”,长程 Agent 评测关心“事情做成没有,以及是怎么做成的”。
3.2.4 人评主导走向机评主导
ChatAgent 时代常见流程是:核心评测员对齐 -> 外包对齐 -> 机评对齐
而在长程 Agent 场景下,这条链路有机会被明显缩短,甚至可以跳过外包对齐,直接进入:核心评测员对齐 -> 机评对齐 -> 规模化扩展
原因主要有三点:
这并不意味着人工不重要,而是意味着:
换句话说,AI 评测真正要放大的,不是“机器打分”本身,而是核心评测员的判断标准。
3.2.5 长程Agent评测基建至少应该具备哪些能力
如果未来要支撑公司内大规模 Agent 和 Skill 生态,评测基础设施至少应包含以下能力:
如果缺少这些能力,评测就容易停留在“单次分析”和“项目制支持”层面,无法真正成为生产系统的一部分。
综合来看,随着大模型能力的增强以及Agent Harness的持续演进,Agent 评测的演进可以概括为两句话:
第一,评测对象变了
过去评测的是“回答”,现在评测的是“任务系统”。
因此我们关心的不再只是输出内容本身,而是完整执行链路中的能力、稳定性、效率与风险。
第二,评测方法变了
过去主流是 Query -> Answer 的文本质量评测,现在逐步转向 Prompt -> Expected Behavior 的行为评测。
标准答案不再总是唯一,过程质量、任务完成度和轨迹质量成为新的核心对象。
因此,未来真正重要的,不只是能不能做几次评测,而是能不能建设出一套:看得见问题、说得清标准、跑得动规模、接得上流程、带得动迭代的 Agent 评测体系。
本月,美团 LongCat 2.0 已正式开源,总参数 1.6T,平均激活约 48B,动态范围 33B 到 56B,原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步,让 LongCat 2.0 在真实的工作任务中成为可靠的“工作伙伴”,才是真正的考验。
现在,搭载 LongCat 2.0 的美团全场景 AI Agent 平台 CatPaw 正式上线,将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。
不仅如此,依托美团十余年深耕本地生活的行业积累,CatPaw 将商家经营、服务履约与消费决策的深度认知融入其中,助力企业构建 AI 数字员工、推进业务智能化升级。
目前,CatPaw 已在美团内部大规模落地:累计覆盖 9 万员工、搭建 Agent 3 万个,并在多个真实业务场景中完成验证。
提供独立的移动端 App 与 PC 客户端,双端任务实时同步、无缝协作。移动端支持随时发起任务、查看进度与远程确认关键决策;PC 端专注本地深度执行,具备文件操作、浏览器控制与终端命令等完整能力。
云端模式支持 7 × 24 小时不间断运行,即使本地设备关机或断网也不受影响。长程任务与定时任务于云端持续运转,完成后随时打开手机或电脑即可查看成果。

在全场景通用 AI Agent 能力的基础上,CatPaw 进一步融入了美团在本地生活领域的全链路行业认知。从门店经营、评价体系、营销转化到履约配送,这些深度积累已被封装为即装即用的专家与技能,覆盖门店评价诊断与优化、商品文案生成、营销物料设计评估、活动策划、经营数据分析等场景。
CatPaw 既是人人可用的全能 AI 助手,也是真正懂本地生活生意的智能搭档。

CatPaw 支持 AI 专家,每位专家集成多项技能与子代理,高效完成特定领域的复杂任务。从专家广场一键安装即可使用,也可通过对话将自己的工作方式快速封装为专属专家,团队共享复用。
平台内置丰富的技能库,开箱即用。内嵌浏览器还支持操作过程一键录制,将日常高频流程自动生成专属技能,让个人与团队经验沉淀为可复用的数字化资产。
支持跨会话长期记忆,自动记忆用户的个性化偏好、操作习惯与历史上下文,跨设备、跨对话保持连续理解,越用越懂你。

只需明确最终目标,Agent 便会自主规划步骤并在授权范围内深度执行:读取文件、操作浏览器、运行终端命令,直接交付 Excel、可视化报告或代码等可用成果。
面对跨领域的复杂任务,系统动态进行任务拆解,调度多个具备专属工具的 Agent 并发处理,各 Agent 在独立环境中互不干扰,进度实时可见,结果自动汇总。

CatPaw Managed Agents 是企业级 AI Agent 开发与托管平台,提供开箱即用的工程底座,无需从零搭建底层基建,即可快速构建、部署与管理专属 Agent。
数字员工是运行在飞书、企微等 IM 中的 AI 虚拟同事,@ 即可唤醒使用。平台预置多种角色模板,扫码即用;美团在本地生活领域的长期积累也已沉淀为专属模板,不只是通用的聊天机器人,而是理解业务的行业 AI 助手。
同时支持通过 AI 对话描述需求,快速生成专属数字员工。从 Agent 创建到环境部署、会话初始化,全程自动完成,无需手动配置。
提示词、知识库、凭证、工具均支持在线管理,团队可按业务场景灵活搭建。

Agent 运行环境严格隔离,租户间数据互不可见。凭证集中托管,确保 Agent 全程零接触敏感资产。
支持分级权限管控与私有化部署,全面满足企业合规与安全审计要求。

支持按需配置运行环境,一键托管上线,资源动态扩缩。
沙箱环境轻量隔离,百毫秒级冷启动,闲时自动释放,兼顾响应速度与成本。

提供统一的运维管理界面,会话记录完整留存可追溯,支持在线调试实时排查问题,模型调用量与消耗清晰可见。
多维度数据统计与分析,帮助团队持续评估 Agent 表现、优化运行效果。

在全场景 AI 能力之上,CatPaw 提供组织级的管理与管控能力,满足商家**规模化落地 AI **的管理需求。
CatPaw 提供统一管理后台,支持团队账号体系。团队成员与权限集中管理,用量明细与消耗实时可查,成本清晰可控。AI 专家和技能支持按团队或角色集中配置与精准下发,一线员工开箱即用,AI 能力快速转化为实际生产力。
此外,CatPaw 还提供与美团业态深度关联的专属专家与技能,覆盖外卖、服务零售、医药健康等多个行业。以服务零售为例,美团商家运营专家整合了经营数据分析、评价管理、门店装修等核心场景,帮助商家实现智能化运营。
CatPaw 将持续深入行业场景,让 AI Agent 真正成为驱动经营增长的数字化伙伴。更多能力陆续开放中,诚邀美团合作商家抢先体验。
过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。

BrowseComp 的题目由人工设计,局限在于只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断:哪些条件真的难检索?哪些约束的候选空间足够大?正是这种局限,让我们开始思考另一种可能性:能不能让机器自己来出题?
美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准,就是把这种可能性变成了现实。
机器出题的前提,是让机器拥有全局视野。整个构建流程可以分为四个环节:建图 → 控制难度 → 质量把关 → 数据概览。下面逐一展开。
LoHoSearch 的第一步,是从完整的英文维基百科出发搭建一张大规模知识图谱:
这张图谱为后续在全局视角下挑选"难题"提供了基础。

有了图谱之后,下一个问题是:什么样的题目才算"难"?LoHoSearch 从两个维度来定义难度。
决定搜索难度的核心有两个维度,而它们恰恰是人工出题最难把控的:
针对这两个维度,LoHoSearch 设计了两种子图结构:

子图采样完成后,还需要转换为可阅读的自然语言题目。整个转换与验证流程分为三层:
经过三层筛选,自动化流程的整体质量表现如下:75.5% 的题目直接通过人工复核,22.3% 经标注员微调后接受,仅有 2.2% 因严重问题被丢弃。
LoHoSearch 最终收录 544 道 经人工核验的题目。对比树结构和图结构可以看出,图结构子图明显更稠密——节点更多、边数接近前者的两倍,这正对应它更高的结构复杂度。题目内容覆盖音乐、地理与地点、影视、体育等 11 个主题领域。



最强模型 GPT-5.5 准确率仅 34.74%,DeepSeek-V4-Pro、Claude-Opus-4.6 和 Kimi-K2.6 集中在 15.53%–15.99%,其余模型均低于 14%。这与它们在 BrowseComp 上 80% 以上的表现形成鲜明对照——LoHoSearch 对当前最先进搜索智能体构成了实质挑战。
用 DeepSeek-V4-Flash 作为探针对比两个基准:同一模型在 BrowseComp 上准确率 58.84%,在 LoHoSearch 上仅 10.02%。

解一道 LoHoSearch 题目,平均工具调用从 35 次增至 61 次(+74%),中位数从 26 次升至 59 次。图结构题目准确率仅 8.01%,远低于树结构的 11.89%,印证了结构复杂度是独立于搜索空间之外的额外难度来源。
对 DeepSeek-V4-Flash 采样 16 个独立回答,结果如图 5 所示。

pass@N 从 N=1 的 9.3% 升至 N=16 的 38.3%,重复采样收益可观,但 38.3% 仍处低位。尝试 16 次仍有六成以上题目无法攻克。三种聚合策略中 best-of-N 表现最优(24.6%),远低于 pass@16 上界,说明模型在答案置信度校准上存在明显不足。
以标准 ReAct 为基线,测试 Summary 和 Discard-all 两种策略,并加入 Verify 模块。

表现最佳的组合(Discard-all + Verify)将成绩从 10.02% 提至 16.82%,绝对提升仅 6.8 个百分点,而同一套策略在 BrowseComp 上可带来 14 个百分点的增益。收益收窄的原因在于 LoHoSearch 需要更长的推理链,简单的轨迹压缩或重启无法解决长程搜索中的信息丢失问题——这使其成为下一代上下文管理技术更有价值的试验场。
对比两个基准中"隐藏实体"的特征可以发现:

其一,BrowseComp 的隐藏实体流行度明显更高,人工出题难以精确控制实体知名度,导致实体偏易。
其二,即便将流行度控制在同一水平,LoHoSearch 的关系搜索空间仍显著更大,实体推断难度远高于 BrowseComp。
这说明人工构建存在系统性局限,知识图谱是系统化构造高难度题目不可或缺的基础。
LoHoSearch 的价值体现在三项具体贡献上:
LoHoSearch 已全面开源,欢迎各大模型前来接受"长程搜索"大考。
假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。
此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。”
我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么?
为了深入探索,美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。
MineExplorer 核心看点:
MineExplorer 不再是简单的看图问答,而是围绕一系列创新,构建了一个前所未有的评测体系。

创新点一:构建一个具备完整物理规则、会动态演化的世界
MineExplorer不是让模型看一张 Minecraft 截图做选择题,模型面对的是一个实时运行的3D沙盒世界。在评测中,每个任务实例会运行1800个环境步,每步执行 0.1 秒,对应一段3分钟的连续交互视频。也就是说在这3分钟时间里,环境一直在变:模型每做一个动作,世界状态就更新一次,它必须根据最新的画面不断调整策略。
创新点二:隐藏前置条件的长程多跳任务
这是 MineExplorer 最核心的设计,我们把任务按「跳数(hop)」分级,代表完成最终目标需要经过的隐藏前置步骤数量:
我们用一个数学化的方式来刻画这种结构。每个复合任务被定义为一个四元组 τ = (q, s₀, Gτ, Mτ):q 是自然语言指令,s₀ 是初始状态,Gτ 是任务之间的依赖图(DAG),Mτ 是规则化的里程碑检查器。关键在于:**指令 q 并不会枚举依赖图里的所有节点,智能体必须自己从环境里推断出隐藏的前置任务。**一个任务越难,意味着它需要越多样的能力、包含越多隐藏前置、依赖链越深。

创新点三:知识解耦——我们测的是「通用探索」,不是「背 Minecraft Wiki」
这是 MineExplorer 区别于以往所有 Minecraft 评测基准的一个关键设计。我们的做法是主动把游戏专有知识剥离掉。对每一个原子任务,我们用LLM裁判判断其主要依赖的是通用世界常识,还是Minecraft专有机制,并过滤掉后者。换句话说:我们测的不是「AI 会不会玩 Minecraft」,而是「AI 能不能在一个动态物理世界里自主探索」。

构建高质量的长程任务基准本身就是难题。我们的解法是让一组各有分工的 AI 协作来造题。MineExplorer 用一个多智能体协作流程,五个专业 Agent 在一个群聊里协作,由一个 orchestrator 控制发言顺序:

整个流程分初始化和辩论(debate)两个阶段,先生成初稿,再由专家和验证器找出问题并修订。
如下表所示,人工评估结果显示,多智能体流程把有效率拉高了约 30 个百分点,质量分提升约 0.5 分,在最难的4-hop任务上优势尤其明显。最终,我们保留了 813 个通过人工验证的高质量复合任务实例。

MineExplorer 借鉴 ReAct 范式,把开放世界探索拆解成三大能力维度,共 14 项细粒度能力:
如图所示,最终的基准在三大维度上都有充足的覆盖,其中空间感知、移动、采集等基础能力出现频率最高,常识推理、因果推理也占了相当比例。

MineExplorer不仅定义了考题,更给出了18个顶级模型的真实分数。如下表所示,这是横跨 Claude、GPT、Gemini 等八大家族的模型在整体任务成功率(TSR)上的排行榜。

我们发现,即便是表现最好的 Claude-Opus-4.6,整体成功率也只有 41 分。
| 洞察一:单跳尚可,多跳崩盘——问题就在隐藏前置条件
如图所示,最强模型Claude-Opus-4.6的表现,从1跳任务的77分,一路下滑到4跳任务的12分。每增加一层隐藏的前置依赖,模型就掉一个台阶。


| 洞察二:会看,但不会想 —— 感知强于推理
在几乎所有被测模型上,我们都观察到同一个规律:感知分数 > 行动分数 > 推理分数。如下图所示,以Claude-Opus-4.6为例,其整体感知分61.91,推理分54.71。瓶颈不在于看不见,而在于看懂了却无法串联成有效策略。

| 洞察三:近60%的失败原因,都是因为走不到目标
我们对 Claude-Opus-4.6 的失败案例进行了归因分析。如下图所示,导航失败是最大的错误来源,占比近 60%。

| 洞察四:给它更多步数、更多记忆,都不是解药
我们进一步做了消融实验,发现模型失败并非因为资源不足。


核心结论:瓶颈不在资源,而在模型没法把已有的信息和当前世界状态对齐。
MineExplorer 揭示了一个被乐观情绪掩盖的能力断层:当前的多模态大模型,已经具备了不错的感知力,但严重缺乏在动态世界中持续行动的探索力。
这对正在快速升温的具身智能赛道有几个直接的启示:
我们不是要给具身智能泼冷水。恰恰相反,把瓶颈定位清楚,比盲目乐观更有价值。MineExplorer提供的,正是这样一条诚实、可量化的能力基线。
看得见世界,不代表能探索世界。在一个会变化的世界里持续推理、持续行动——这才是AI走向真实世界,必须先跨过的那道门槛。MineExplorer 已全面开源,欢迎各大模型前来挑战开放世界。
🚀 开源链接
本周,美团万亿参数大模型 LongCat-2.0 正式开源!
HuggingFace | GitHub | ModelScope
作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型,LongCat-2.0 已全面开源。针对显存与带宽受限的国产算力芯片,我们在模型架构、芯片适配到部署策略上进行了深度协同优化,让万亿参数模型在存量卡上同样跑得稳、跑得快。 我们希望以真实 Agentic Coding 任务中的稳定表现为依托,通过开源将模型能力与推理优化成果完整开放,盘活更多存量国产算力,释放国产算力生态的长期价值。
美团 LongCat-2.0 总参数 1.6T,平均激活约 48B,为真实的 Agentic Coding 任务而生,架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力的同时,结合动态激活进一步强化了代码理解、生成以及执行的表现。
面对显存、带宽和互联的多重限制,LongCat-2.0 结合国产芯片特性,从模型、芯片适配与部署三个方向逐一突破,实现了万亿参数模型的流畅推理:
模型层面: Attention 通过 absorb 计算模式、Indexer 与 MLA prolog 并行处理以及 KVP 切分 KV-cache,有效缓解了超长上下文的 I/O 与显存压力。ScMoE 则利用国产芯片的控核能力,让 Dense 与 MoE 分支实现物理核心级并行执行,进一步压缩端到端延迟,实现了百万上下文在国产芯片上的高效推理;
芯片适配层面: 通过 Super Kernel 减少算子数量以降低启动开销,并以 Weight Prefetch 将 I/O 延迟隐藏在前序计算中;同时基于高速片间互联完成 layer-wise 的 KV-cache 传输,TP/SP/KVP 均在 scale-up 互联域内完成,在受限的显存和带宽条件下将硬件利用率最大化;
部署策略层面: 采用 PD 分离部署兼顾 TTFT 与 TPOT:Prefill 端通过缩小 Expert-Parallel 域与序列并行分担长序列计算压力,Decode 端以 KV-cache 切分与高并行度降低单卡显存占用,配合异步化 Expert-Parallel Load Balancing 解决大 EP 度下的负载不均。上述并行方案均已适配 constrained decoding、multi-step scheduling 和 MTP 等推理优化特性,实现了万亿参数模型在国产算力上的稳定服务。
LongCat-2.0 验证了国产芯片承载复杂大模型任务的成熟能力,并希望通过开源为行业提供一条可复现的技术路径,推动存量算力在真实场景中的应用价值。
LongCat-2.0 沿用了 LongCat-Flash 的整体设计,并围绕 LongCat-2.0 在长上下文、代码任务和智能体场景中的进一步升级,做了三项关键优化:
面向智能体任务中的长输入场景,LongCat-2.0 引入 LongCat 稀疏注意力机制(LSA),通过流感知索引、跨层索引和层级化索引三项策略减少碎片化访存和重复索引计算,在保持模型质量的前提下,加速百万级长上下文的训练与推理。

LongCat-2.0 在 MoE 专家之外引入 N-gram Embedding 作为新的参数扩展路径。在 MoE 稀疏度已接近 97% 的情况下,将 135B 参数投入 N-gram Embedding 的收益远超继续扩充专家。该模块占比控制在总参数 10% 以内,兼顾了参数收益与结构稳定性。

后训练阶段,LongCat-2.0 采用多教师在线蒸馏,将专家分为 Agent、推理和交互三类,分别聚焦自主执行、自适应推理和安全对齐等核心能力。最终通过 MOPD 架构在国产算力集群上无缝融合,使模型兼具深度推理、自主执行与精准交互的综合表现。

LongCat-2.0 的开源,是一次技术路径的公开,也是一次生态邀约。
本次开源同步提供 BF16、FP8 以及 INT8 等多精度版本,全面覆盖不同算力平台的部署需求。同时,我们深度拥抱开源社区,将针对国产算力极致优化的推理成果同步开源。这意味着,即使手上没有最新算力,也能基于现有硬件将 LongCat-2.0 稳定跑起来。
我们希望通过这套开箱即用的推理栈,让更多的国产卡包括老卡,都能流畅部署万亿大模型推理服务,在真实生产力场景发挥更大价值。
Tech Blog: https://longcat.ai/blog/longcat-2.0/
Model Weights:
Inference Code:
API Platform:
🏆 近日,ACL 2026 杰出论文奖在圣地亚哥揭晓,全球仅 18 篇入选,美团履约技术团队的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》上榜啦,一键直达视频回放👉🏻 小红书 | B站

如果你正在关注 AI 前沿,这篇内容值得收藏。
2026 年,美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇,进行了 5 大专场直播。
内容涵盖了大模型推理、智能体记忆与自进化、代码智能、多模态交互、超高清视频生成、本地生活搜索等方向——既有底层能力的突破,也有贴近生活服务的落地探索。
如果你错过了直播,或者想再看一遍👇 五场回放都在这里啦,找到你感兴趣的议题,随时开始。
特别感谢所有讲师与筹备团队的倾力支持!也感谢每一位关注美团技术成长的你!❤️
📚 论文简介及下载→ 点这里

出品人| Jichong Gao 美团高级技术专家、Jun Xu 美团高级技术专家
📚 论文简介及下载→ 点这里

出品人| Guojun Yin 美团研究员
📚 论文简介及下载→ 点这里

出品人| Qi Gu 美团研究员
👉 直播回放入口→ B站
📚 论文简介及下载→ 点这里

👉 直播回放入口→ B站
📚 论文简介及下载→ 点这里
