有望对标Databricks,OceanBase押注AI数据底座的万亿市场

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
有望对标Databricks,OceanBase押注AI数据底座的万亿市场
7813点击    2026-09-20 11:10

有望对标Databricks,OceanBase押注AI数据底座的万亿市场


企业AI转向“小模型微调+多模态底座”,数据基建新市场。


AI落地的真正拐点,已经不在模型本身。


当通用大模型足够强、足够便宜之后,企业突然发现:真正卡脖子的,是自己的数据。散落在各处的交易记录、文档、图片、日志,以及那些还没被整理的向量,能不能被Agent真正用起来?


正是这一问,把数据层推到了台前。当数据库的使用主体从人变成了海量Agent,数据类型从结构化扩展到多模态,要求也从“存得下”变成了统一管理、实时检索、语义理解与安全合规。


这些变化正在重写整个数据市场的边界。


9月10日,2026 Inclusion·外滩大会《数智进化:让多模态数据成为AI核心燃料》见解论坛上,IDC中国企业软件市场研究经理王楠发布最新研究


研究重新划定了“AI数据基础设施”的版图,并给出清晰判断:中国市场将从2025年的约149亿美元,增长到2030年的738亿美元,到2035年有望达到约1万亿人民币规模。


万亿级新市场正在打开,而最先卡位的,将是那些真正能把数据变成AI燃料的底座。


大模型不适配真实生产环境


企业选择“小模型微调+多模态底座”


通用大模型直接搬进企业生产环境,会遇到几堵绕不过去的墙。


第一堵墙是成本。


通用大模型参数量大、推理开销高,企业业务中每一次调用都在消耗算力。对于高频、规模化的生产场景,全量调用通用大模型的token成本和GPU算力开销,企业实在吃不消。


第二堵墙是延迟。


企业在线业务对响应时间的要求是毫秒级,而通用大模型动辄数秒的生成速度,无法嵌入交易、风控这类实时链路。


第三堵墙是幻觉与口径。


通用大模型缺乏对企业自有数据口径、业务规则和行业知识的理解,直接使用会导致回答失真。IDC在报告中提到,口径不一会导致AI回答失真,企业因此正在优先考虑数据质量、数据血缘和元数据,以确保AI输出的一致性和可信度。


第四堵墙是数据隐私与领域适配。


在金融、政务等强监管行业,数据不能出域,通用大模型无法直接接触企业核心数据;而行业知识散落在企业内部的文档、报表、流程系统中,通用模型既不掌握,也难以获取。


瓶颈既然在数据,解法也落在数据。


IDC此次研究给出的企业选型建议中,明确列出了一条关键路径:拥抱“小模型+多模态底座”模式——聚焦构建强大的多模态数据底座,结合行业知识与场景数据,通过小模型微调实现高效、可控的生产级AI落地。


企业不需要在每一个业务环节都调用参数量最大的通用模型,而是用自有场景数据微调出小模型,让模型在特定任务上足够专、足够快、足够便宜


而微调的前提,是企业能够把散落在各处的数据——结构化的交易记录、半结构化的日志、非结构化的文档图片,以及AI原生需要的向量数据——统一管理起来,形成可供模型消化的“燃料”


这解释了为什么多模态数据底座成为必选项。


IDC数据显示,企业新生成的数据资产中约90%为非结构化形态,文档、图片、音视频正在成为数据资产的主体。传统数据架构主要围绕结构化数据设计,处理这部分数据的能力缺口直接制约了AI落地。


新路径给数据基础设施带来冲击


万亿新市场诞生


“小模型+多模态底座”的生产级路径,对传统数据基础设施的冲击是全方位的。


蚂蚁集团基于OceanBase的实践显示,当Agent成为基础设施的使用方,其数量级远超人类工程师。据介绍,蚂蚁内部的AI应用平台“灵光”已累计生成数千万个“闪应用”,平均每个仅百余行数据,99%处于沉睡状态,极少数被唤醒时却要求秒级响应。


这意味着数据底座要解决的不再是把一个库做大,而是让百万级、千万级的库高密度共存、按需唤醒。


数据体量本身也在快速膨胀。IDC预计,中国数据生成量将从2025年的76.05ZB增长至2030年的146.65ZB,五年接近翻倍


面对这个被重构的市场,IDC此次没有沿用传统的数据库、数据仓库分口径统计,而是重新划定了“AI数据基础设施”的市场边界,将其划分为三大子市场


  • AI数据管理平台承担多模态数据的统一管理和处理,是AI应用的数据底座。这是规模占比最高的子市场。


  • AI数据智能利用AI提升数据治理、分析和使用效率,包括AI辅助数据治理(用生成式AI提高数据目录、分类分级、质量检测、知识抽取和文档理解效率),以及Data Agent与数据产品。这是增速最快的子市场。


  • AI数据服务从传统数据标注向更复杂的数据工程和数据运营体系升级,RAG知识库持续运营、Agent轨迹数据集构建、行业数据集更新等持续性服务占比持续提升,多模态非结构化数据爆发带动多模态、合成数据服务扩张。


有望对标Databricks,OceanBase押注AI数据底座的万亿市场


据IDC数据,2025年中国AI数据基础设施市场规模约为149亿美元。IDC预测,2030年达到738亿美元,2025年至2030年复合增长率37.7%;到2035年达到1548亿美元(约合人民币1万亿元),较2025年增长超过10倍


有望对标Databricks,OceanBase押注AI数据底座的万亿市场


数据基础设施市场的天花板,已经从百亿级的数据库市场,切换到万亿级的AI数据基础设施市场。


OceanBase的新卡位:


AI数据基础设施的底座与入口


IDC报告还提出,未来的竞争在于谁能够率先形成覆盖“数据管理—数据智能—数据服务—Agent消费”的完整闭环,而OceanBase的产品体系正在这一方向上布局。


2026年6月29日,OceanBase发布面向AI时代的湖库一体AI数据库,核心思路是将数据湖的开放与海量存储能力、数据库的事务处理与分析能力,以及多模态数据处理能力,统一到一套数据架构中,为AI应用和Agent提供统一的数据基础。


  • OceanBase Lakebase湖库一体的AI湖库,原生支持结构化、半结构化、非结构化等多模态数据统一管理与处理,并融合实时分析、混合搜索及开放计算等能力。


有望对标Databricks,OceanBase押注AI数据底座的万亿市场


  • Lakebase同时提供DataStudio等数据生产、治理和服务能力面向Agent场景的数据沙箱,支持大规模生产级Agent基于真实数据快速创建隔离环境,用于Agent评测、实验和验证。


有望对标Databricks,OceanBase押注AI数据底座的万亿市场


  • OceanBase DataPilot面向经营分析和业务决策的数据智能Agent,作为企业业务数据的智能入口,让业务人员通过自然语言完成数据分析、报告生成和可信答案获取,将底层数据能力进一步转化为业务智能。


有望对标Databricks,OceanBase押注AI数据底座的万亿市场


  • AI数据生态OceanBase同时通过seekdb、ConyrxtSeek等开源项目持续拓展AI数据与Agent生态,进一步打通从数据到AI、从AI到Agent的技术链路,让数据基础设施能够更直接地支撑AI应用的构建与运行。


这套产品组合正好对应IDC给出的市场分类的核心板块:Lakebase和seekdb对应AI数据平台,DataPilot和AgentSeek对应AI数据智能,DataStudio和持续数据服务对应AI数据服务。


OceanBase,承担起了AI应用和Agent的统一数据底座与数据入口的新角色。


目标是Databricks


OceanBase的增长空间才刚刚打开


市场格局变化了,OceanBase的价值自然需要重新定位。


传统数据库公司的估值逻辑,看的是市场份额、收入、利润和云化进度。在这个框架下,OceanBase面对的是分布式事务型数据库市场,天花板清晰可见。


然而,AI数据平台的估值逻辑看的是另一组指标:TAM(总可触达市场)、平台化能力、Agent数据入口、生态闭环、全球对标


按照这个标准,OceanBase的价值定位标杆就是Databricks


这家2013年由Apache Spark创始团队创立的公司,2026年8月13日完成50亿美元战略融资,估值1900亿美元。


仔细看这两家的产品,你会发现一个小细节:Databricks把面向Agent的数据库产品命名为Lakebase,OceanBase把湖库一体引擎也命名为Lakebase。


两家从相反方向出发的公司——Databricks从数据湖和数据分析起家,向数据库和企业应用延伸;OceanBase从分布式数据库和核心交易系统出发,向企业全量数据管理、Agent数据供给和数据服务拓展——把产品命名收敛到了同一个词上。


用OceanBase CTO杨传辉自己的话说就是:“不同的路,同一个终点。”


立足当前行业格局,OceanBase正处于高速成长的黄金起步阶段。


据彭博2026年7月29日消息,OceanBase正在推进首轮A轮融资,目标融资规模20亿至30亿元人民币,这也是其自诞生以来首次引入外部市场化资本。商业化层面,OceanBase 2026年年化收入突破14亿元,同比增速高达70%


若以Databricks估值1900亿美元为目标,OceanBase的增长空间,将没有天花板。


结语:AI下半场的胜负手


在于数据基础设施


IDC在报告中写道:未来企业AI落地的竞争焦点将彻底从“模型军备竞赛”转向“数据基建比拼”。


头部模型的通用能力趋同且足以够用。当好模型不再稀缺,稀缺的就变成了数据层的能力差异。


数据层的和模型层的逻辑不太一样。数据基础设施的构建周期长、涉及环节多、迁移成本高,一旦形成技术壁垒和客户黏性,后来者很难在短时间内追上。这意味着,先行者的优势会随着时间推移不断放大。


放在中国市场来看,这个判断更加成立。中国不缺数据,也不缺场景。缺的是能把数据变成AI燃料的基础设施。这个空白正在被填补,而填补它的公司,或将定义下一代企业数据平台的形态。




文章来自于微信公众号 “智东西”,作者 “智东西”

关键词: AI新闻 , AI基建 , OceanBase , AI数据
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
知识库

【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。

项目地址:https://github.com/labring/FastGPT

3
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

4
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner