
摘要
日前,百度文心助手任务 Agent(Orion Mission Mode)以 94.6%的综合成功率、94.4%的平均得分,在全球工程向 AI 智能体评测榜单 PinchBench v2 中荣登榜首。
在 148 项真实任务的综合评测中,文心助手任务 Agent 超越 Anthropic Claude Opus 4.8-fast、阿里千问 Qwen3.7-max、英伟达 Nemotron-3 Ultra、OpenAI GPT-5.6-luna 等海内外主流大模型。 此次 PinchBench v2 榜单以 148 项真实企业自动化任务为核心测试标准,覆盖创意内容、写作、数据分析、研究知识、代码运维等多维场景。据榜单数据显示,文心助手任务 Agent 在创意内容、写作内容等多个赛道获得领先的评测认证,工具调用、多步骤任务自主规划与长程任务执行能力表现突出。此次评测流程,百度 AI 搜索团队以 Orion Mission Mode 的名称,在 GitHub 上开源。
据悉,文心助手任务 Agent 依托百度搜索二十余年技术积累与百度搜索猎户座 AI 引擎的多智能体框架能力,为智能体应用开发提供了自主可控、高性能的国产化底层模型底座。目前,该核心技术已全面应用于百度 APP 及文心助手。




