结论先行:OceanBase 团队提交的 Data Agent 方案在国际数据智能体基准 Data Agent Benchmark(DAB)上以 90.62% 的准确率位列第一,成为该榜单首个准确率突破 90% 的参评方案。更值得关注的是它的构成——由国产数据库 OceanBase 搭配国产大模型 GLM-5.2 构建,成绩超过多项基于 GPT、Claude Opus、Claude Fable 等海外模型搭建的 Data Agent 方案。该参评方案内部代号 Scout,相关能力后续将融入 OceanBase DataPilot。
DAB 是什么:它考的不是”会不会写 SQL”
要理解 90.62% 这个数字的分量,得先看清评测本身的设计。DAB 由 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 联合推出,评测覆盖互联网/本地生活、金融股票、生物医学、知识产权、企业运营、政务/公共管理、媒体/文娱等多个领域,并涉及 PostgreSQL、MongoDB、SQLite、DuckDB 等多种数据库。
从”转译正确”到”拿到答案”
传统 Text-to-SQL 类评测主要考察模型能否把自然语言准确转换成 SQL 语句,本质上是一次转译能力的考核。而 DAB 关注的是另一件事:AI 进入真实数据环境之后,能否从复杂、分散、形态各异的数据里找到正确答案。
在一个完整任务中,Data Agent 需要依次完成理解数据、选择数据、规划分析路径、完成查询计算,并对结果进行验证。它检验的是从”理解数据”到”拿到答案”的完整链路,任何一环断掉都拿不到分。
为什么它难:三层能力必须同时在线
DAB 考验的不是单一底层模型,而是”模型 + Agent + 数据系统”的综合能力。模型负责理解与推理,Agent 负责规划与执行,数据系统则要支撑数据发现、关联计算和结果校验。三者能否协同,直接决定 AI 能不能真正把企业数据用起来。这也是为什么很多”模型很强”的方案在这类榜单上并不能直接登顶。
90.62% 是怎么跑出来的:一个三段式闭环
OceanBase 此次参评的 Scout 方案,正是围绕上面这条完整链路来构建的,核心是一条”数据理解—规划执行—验证修复”的闭环。
第一步:用 DataLens 给数据画像
系统先通过 DataLens 构建数据画像,识别字段含义与数据之间的关系。这一步解决的是”AI 看不懂这张表到底在记什么”的老问题——没有画像,后续的选择和关联都是盲猜。
第二步:按任务复杂度规划执行路径
画像完成后,系统依据任务的复杂程度规划执行路径,依次完成数据选择、筛选、关联和计算。简单任务走短路径,复杂任务拆成多步,避免一次性生成的长链条 SQL 在中途失效。
第三步:证据追踪与答案校验
拿到结果后并不直接输出,而是通过证据追踪和答案校验回查计算过程与结果。一旦发现问题,会调整方案并重新验证。这个”自我回查”的环节,是 Scout 能把准确率推过 90% 的关键差异点。
与常见路线的差异对比
| 对比维度 | 传统 Text-to-SQL | DAB 考察的 Data Agent | OceanBase Scout 方案 |
|---|---|---|---|
| 核心目标 | 把自然语言转成 SQL | 从真实数据环境中拿到正确答案 | 同左,并增加结果校验环节 |
| 能力构成 | 以模型为主 | 模型 + Agent + 数据系统 | 国产模型 GLM-5.2 + Agent + OceanBase 数据底座 |
| 数据环境 | 多为单一、干净的数据集 | 多领域、分散、形态各异 | 覆盖 PostgreSQL、MongoDB、SQLite、DuckDB 等 |
| 错误处理 | 基本不涉及 | 要求结果可信 | 证据追踪 + 答案校验 + 修复重试 |
| 本次成绩 | — | — | 准确率 90.62%,榜单第一、首个破 90% |
表中数据来自 OceanBase 公布的评测结果及 DAB 榜单公开信息。
含金量在哪:验证的是”国产组合”的协同能力
这次 90.62% 的价值不只是”国产模型能完成数据查询”这么简单。在底层模型采用 GLM-5.2 的前提下,OceanBase 方案最终超过了多项采用 GPT、Claude Opus、Claude Fable 等海外模型构建的 Data Agent 方案。换句话说,被验证的是国产数据库与国产模型组合后,能否共同支撑复杂数据分析任务这一命题。
数据库的角色正在被改写
过去,数据库的核心职责是存储、查询和处理数据。随着 AI Agent 成为新的数据使用者,需求变了:AI 不仅要拿到数据,还要理解数据、关联数据、分析数据,并验证结果是否可靠。AI 时代的数据底座,正在从”把数据交给 AI”走向”帮助 AI 把数据用起来”。
从 DataPilot 看产品化路径
OceanBase DataPilot 是其面向 AI 数据分析场景的产品方向。本次以 Scout 代号提交的评测能力,后续将沉淀到 DataPilot 产品中,承接数据理解、任务规划、分析执行和结果验证等能力,让 AI 从”调用数据”走向”用数据完成任务”。
FAQ:关于这次登顶的常见疑问
Q1:90.62% 的准确率在 DAB 上算什么水平?
据 OceanBase 公布的评测结果,这是该榜单首个准确率突破 90% 的参评方案,并位列第一。由于 DAB 覆盖多个领域和多种数据库,跨领域的稳定表现比单领域高分更难维持。
Q2:为什么不用更强的海外模型反而跑得更好?
DAB 考察的是”模型 + Agent + 数据系统”的协同,不是单纯比拼模型能力。Scout 在数据画像、路径规划和答案校验上的工程设计与 OceanBase 自身的数据底座结合,弥补了单项能力的差距。
Q3:Scout 的能力会直接开放给用户吗?
Scout 是本次参评方案的内部代号,相关技术能力将沉淀并融入 OceanBase DataPilot 产品,逐步承接数据理解、任务规划、分析执行与结果验证等能力。
小结
这次登顶的意义,可以概括为数据库与 AI 关系的一次位移:过去数据库负责把数据存好、算好、取出来,如今还要帮助 AI 理解数据、组织数据并完成分析。对正在做企业数据智能化的人来说,一个更实际的启示是——与其只盯着模型榜单,不如同时关注”模型 + Agent + 数据系统”这条链路的协同效率,后者往往才是准确率的天花板所在。
