Agent 友好的 AI 数据库需要哪些特征
到 2028 年,预计有三分之一的企业软件交互将由智能体 (Agent) 完成。
这不是预测,是正在发生的现实。当 Agent 从"辅助工具"变成"主要使用者",数据库这门发展了半个多世纪的基础软件,第一次面临一个根本性问题:
为工程师设计的数据库,能不能服务好一个会犯错、需要试错、7x24 小时不间断运行的非人类用户?
6 月 29 日,OceanBase 发布湖库一体 AI 数据库,给出的定位不再是"支持 AI",而是要"Agent 友好"。这几个字背后,藏着 Agent 时代数据库的六条生存法则。
01. 实时上下文工程:Agent 的"记忆"不能靠外挂
人类工程师查数据库,可以等。Agent 查数据库,不能等。
为什么?因为 Agent 的每一次回答,本质上都是"一段上下文 + 一次模型调用"。上下文给得准不准,直接决定 Agent 答得对不对。而这段上下文从不区分"结构化还是非结构化",一笔订单的数字、一段客服录音、一张发票照片,本来就是一体的。
传统方案怎么做?关系库存结构化数据,向量库存语义数据,对象存非结构化文件,中间靠应用层做拼接。Agent 一次简单查询,幕后可能是五六次网络调用和多次格式转换,任何一个环节超时,整条链路就挂了。
Agent 友好的数据库第一条特征: 上下文工程必须是原生的 。
不是外挂一个向量插件,不是事后做 ETL 同步,而是在内核层面统一存储和检索 Agent 的记忆、上下文、状态与行动记录,通过向量、全文、结构化数据的混合搜索,一次性把最相关的信息精准组织成喂给模型的上下文。
OceanBase 的做法是把"上下文层"作为数据库引擎与应用层之间的独立层级,包含数据上下文 (业务语义) 和应用上下文 (Memory、RAG)。数据上下文让 Agent 理解企业在做什么,应用上下文让 Agent 理解用户在问什么。两层打通,Agent 才能真正"读懂业务"。
02. 混合搜索原生能力:Agent 需要"关系 + 语义"的混合嗅觉
向量搜索是 AI 场景最广泛的检索模式,但仅有向量搜索远远不够。
实际业务中,Agent 的查询往往是这样的:先通过关系过滤把全局数据缩小到候选集 (比如"近三个月、华东区、金额大于 10 万"),再在候选集内做向量相似度搜索、全文检索、图遍历,最后做智能重排 (Re-rank)。
传统数据库怎么做?"先向量召回、再逐条过滤"的串行模式。数据量一上来性能就崩,因为查询优化器根本感知不到向量索引的代价模型,没法在向量检索和关系过滤之间做联合优化。
Agent 友好的数据库第二条特征: 混合搜索必须是内核级融合,不是应用层拼接 。
OceanBase 的混合搜索在数据库内核层面同时深度融合关系过滤、向量相似度搜索、全文检索、图计算等多种模式,实现统一召回与重排。在 Vector DB Benchmark 中,同等召回率下性能优于 Milvus、Elasticsearch、PostgreSQL;在 MS MARCO 数据集上,混合搜索性能比 Elasticsearch 高出 30% 以上。
更重要的是,这一切发生在单次查询中。Agent 不需要知道背后有几种索引,它只需要一个准确的答案。
03. 试错与回滚:Agent 会犯错,数据库要容得下
人类工程师写 SQL 之前会先在测试环境跑一遍。Agent 不会,它直接在生产环境试错。
Agent 和人最大的区别是:Agent 会犯错,而且需要频繁犯错来进化。也就是说,Agent 友好的数据库从一开始就要支持"安全试错"。
Agent 友好的数据库第三条特征: 必须提供类 Git 的数据分支机制 。
OceanBase 的 Fork Database 支持秒级创建完整的数据库实例或租户沙箱,用于 AI 实验、并行试错和评测。开发者在分支上做实验,失败可零成本回滚,成功则合并提交。这相当于给数据库加上了版本控制,让 Agent 的每一次试错都有退路。
对比一下:传统数据库要搭一套测试环境,导数据、配权限、调网络,折腾半天 Agent 可能已经超时了。Fork Database 把试错成本从"小时级"压到"秒级",这是 Agent 规模化运行的前提。

04. Schema 爆炸的解法:百万 Agent 不能百万张物理表
未来三到五年,AI 场景将会有千亿级乃至万亿级 Agent。每个 Agent 都可能创建自己的表、自己的数据库。如果每个 Agent 都采用独立的物理表,没有任何一个数据库能撑得住。
这不是夸张。蚂蚁灵光的实践已经验证了这一点:3000 万个由 AI 生成的闪应用,每个应用仅有百余行数据,99% 处于沉睡,被唤醒时却要秒级响应。
Agent 友好的数据库第四条特征: 必须解决 Schema 爆炸问题 。
OceanBase 的解法是"逻辑表",对于每个 Agent,它看起来是一张自己独立的表,但映射到数据库底层,大量逻辑上独立的表被整合到少量物理表中。Agent 可以用标准 SQL 完成过滤、聚合、Join 等计算,但底层不需要为每个 Agent 维护独立的物理 Schema。
这相当于在数据库内核里做了一层"虚拟化":Agent 感知不到,但数据库扛得住。3000 万闪应用能在同一套基础设施上低成本运行,靠的就是这个机制。
05. 多模态一体化:非结构化数据不能是"二等公民"
据此前预测,全球超过 80% 的数据是非结构化的。但过去五十年,数据库的"一等公民"一直是结构化数据,整数、字符串、时间戳。文档、图片、音视频长期被丢在对象存储里,和数据库里的业务数据之间隔着一条语义鸿沟。
Agent 需要看到的不是"一张表格",而是完整的多模态世界。一笔交易记录、一段客服录音、一张发票照片、一份合同文本,只有被放在一起理解,才构成完整的业务事实。
Agent 友好的数据库第五条特征: *非结构化数据必须是"一等公民" *,和结构化数据在同一套事务边界内管理。
OceanBase 的多模表让结构化字段、文本、图片、音视频、JSON、LOB、向量等数据形态进入同一张表的语义之下。"多模列/AI 列"进一步把模型能力引入数据处理链路,基于原始数据生成摘要、标签、特征、向量等语义结果,以"列"的形式进入数据库。
企业不必把数据反复搬出数据库、交给外部模型处理后再写回。Embedding、打标等 AI 计算可以在数据原地完成,并保证原子性:要么全部成功,要么全部失败。结构化与非结构化数据的强一致性,第一次在同一个事务边界内得到保障。

06. 安全与隔离:Agent 的权限边界就是数据主权
Agent 会接触敏感数据,也会执行关键操作。这意味着它的执行环境安全性是一个必须正视的话题。
当海量 Agent 共享同一个数据底座时,谁来保证 Agent A 不会读到 Agent B 的数据?谁来保证一个越权的 Agent 不会把企业核心数据泄露出去?
Agent 友好的数据库第六条特征: 安全必须是设计之初的核心特性 ,不是事后打补丁。
OceanBase 的 Unified Catalog 提供统一的元数据目录服务,所有外部请求在进入计算引擎前先经过安全权限过滤,支持最细粒度的行级权限控制 (ACL),并兼容大数据生态 (如 HMS)。
这不是简单的"用户名 + 密码",而是在数据库内核层面实现的、面向 Agent 的细粒度访问控制。每个 Agent 或轻应用拥有相互隔离的数据空间,在不影响主干数据的前提下试错、运行和演进。
07. OceanBase 的答卷:不是"适配 Agent",而是"为 Agent 而生"
OceanBase AI 数据库,不是只给了一个引擎,而是给了一整套工具。最底下是 Lakebase,负责把结构化、非结构化、向量数据统一管起来,相当于数据底座;中间是 DataStudio,负责数据接入、加工、治理这些脏活累活,把分散的数据资产变成可管理、可调用的服务;最上面是 DataPilot,让业务人员用自然语言就能问数据、出报表,相当于一个懂业务的智能分析助手。三层打通,数据从入库到被 Agent 调用,中间不需要搬来搬去。
Agent 友好的数据库 ,不是传统数据库的增量升级,而 是一个新品类 。
OceanBase CTO 杨传辉在发布会上说了一句话:"Agent 和人最不同的区别是,Agent 强调实时性。 实时性会成为 AI 数据库的第一需求 。"
当数据库的使用者从人类变成 Agent,很多过去"可以妥协"的事情,变成了"生死线"。
- 一致性:Agent 直接面向用户拍板 (风控、内容安全),错一条就是业务事故,从"高标准"变成"生死线"。
- 实时性:Agent 的判断发生在毫秒之间,数据底座必须跟得上,从"隔夜跑批"变成"在线实时"。
- 扩展性:从"把一个库做大"变成"让一百万个库低成本共存",像水电一样按需供给。
- 可靠性:Agent 全天候运转,没有运维人员盯着,从"有人兜底"变成"智能体的生命线"。
OceanBase 的选择是从内核出发,把在金融级场景中锤炼了十五年的事务一致性、高可用、实时处理和弹性扩展能力,延伸到湖、非结构化数据和多模态数据之上。这不是"湖 + 库"的简单拼接,而是以成熟的数据库内核为基础,让"库"的强一致与实时能力和"湖"的开放、海量、多模态能力在统一架构中协同运行。

结语:数据库正在从"存放数据"走向"承载智能"
Agent 时代,数据库的角色正在发生一次根本性转变。过去,数据库是把一笔交易、一张订单老老实实存下来。今天,数据库需要成为 Agent 的"外脑",存储记忆、供给上下文、支撑试错、保障安全、按需扩展、闲时归零。它不再只是支撑业务的后台系统,而是 AI 价值兑现的战略制高点。
这次 OceanBase AI 数据库发布会,本质上是在回答一个问题:当 Agent 成为数据库的新使用者,数据库应该长什么样?
六条特征,就是答案的轮廓。而轮廓里面,是接下来十年数据库行业的核心战场。

Have a nice day ~ ☕











