
WPS AI登顶TableBench,场景理解正成为AI时代的新变量
7月21日,国际表格问答基准TableBench更新最新榜单,金山办公旗下WPS AI以72.54分登顶Methodology Leaderboard(方法榜),位列全球第一。
这是WPS AI近期内第二次拿下表格类国际表格基准榜首,6月它曾以73.46%登顶SpreadsheetBench Full 912全量榜单。这意味着WPS的表格AI已从操作能力迈向推理能力,在表格理解、数据分析与可视化等核心维度达到全球领先水平。
TableBench:为什么比“读懂表格”更难
TableBench是面向复杂表格问答与数据推理的公开评测基准,包含886个经人工标注的测试案例,覆盖事实核验、数值推理、数据分析和可视化四大能力及18个细分类别。它衡量的不是AI能否完成单元格级别的操作,而是面对真实数据问题时,能否完成从理解问题、寻找证据、计算推导到分析表达的完整过程。
在最新方法榜中,WPS AI综合得分72.54分,排名全球第一:

其中事实核验与数值推理两个维度均突破90分,可视化也获得最高分。这说明WPS AI面对复杂表格时,已经能够做到的不只是回答“某个数字是多少”,还包括:从多处数据中定位支撑结论的证据、理解用户用自然语言描述的计算目标、执行多步推导并减少中间过程错误、识别数据中的趋势与异常,并将分析结论转化为可直接使用的图表。
这一成绩反映的不是某个基础模型的单次问答能力,而是一套表格Agent在任务规划、工具调用、代码执行和结果校验上的综合表现。
TableBench官网同时设有“方法榜”与“大语言模型榜”两个独立榜单,其中大语言模型榜排名第一的o4-mini-high(OpenAI旗下)得分为61.69分。WPS AI比o4-mini-high高出逾10分,这一结果表明,基础模型能力只是起点,面向专业场景的方法设计与工程化能力同样关键,技术积累和场景理解带来的工程化能力,会是金山办公在下一个时代的核心资产。
这一能力体系在此前已有验证。6月16日,WPS AI以73.46%登顶SpreadsheetBench Full 912全量榜单,超过论文公布的软限制条件下71.33%的人类专家基线。SpreadsheetBench考的是把复杂表格任务做出来的“执行力”,TableBench考的是把数据背后的问题想明白的“思考力”。短期内两项国际基准分别验证了这两类能力,构成了WPS表格AI从底层技术到完整产品能力的闭环。
从榜单到产品:让每个人都能调用专业数据能力
榜单成绩最终要转化为用户可用的生产力。在WPS表格中,用户可以直接用自然语言描述目标,由AI辅助生成公式并解释含义、发现数据中的异常与趋势;WPS多维表格则进一步将自然语言建表、AI字段、仪表盘、自动化流程和数据分析连接在同一套数据底座上,让同一张表同时承担信息采集、协同处理和业务流程驱动的功能。
过去38年,金山办公通过WPS让更多人能够高效地创建和处理表格;在AI时代,金山办公希望让每个人都能获得专业数据分析师的能力,让每个组织都能快速构建自己的智能工作流。这一愿景已落地成产品能力,表格AI正从辅助工具走向真正的数据智能基础设施。



