生成式人工智能正在改变数据库与商业智能产品的交互方式。过去,业务人员提出问题后,往往需要分析师理解需求、编写 SQL、核对指标并制作图表;如今,越来越多的数据平台开始提供自然语言问数、自动生成查询、可视化分析和数据代理能力。最新一轮产品演进的重点,也已从“能把问题翻译成 SQL”转向“能否基于统一语义、安全权限和可信样例给出可验证答案”。这一变化意味着,自然语言分析正在从演示功能进入企业数据治理体系。
一、AI 数据库进入“语义驱动”阶段
早期自然语言查询主要依赖大模型读取表名、字段名和少量样例,再生成 SQL。当数据结构简单时,这种方式可以快速完成探索;但在企业环境中,“客户”“收入”“活跃用户”等词通常具有特定业务定义,仅靠字段名称很难准确理解。当前主流产品因此普遍引入语义模型、指标定义、业务术语、查询指令和已验证查询,让模型不只理解数据库结构,还能理解组织内部的计算口径。Snowflake 的语义视图与 Verified Query Repository、Google Cloud 数据代理的自定义元数据和 verified queries,都是这一方向的代表。Snowflake 官方文档、Google Cloud 官方文档。citeturn1search11turn1search21
这也说明,自然语言分析的准确率不只是模型能力问题,更取决于数据准备质量。指标是否唯一、表关系是否清楚、字段描述是否完整、历史标准查询是否经过审核,都会直接影响答案。企业部署时,应把语义层建设视为核心工程,而不是在模型上线后再补充说明。
二、Snowflake:强化 Cortex Analyst 的可信问数能力
Snowflake Cortex Analyst 是面向结构化数据的托管式自然语言分析能力,可将业务问题转换为 SQL,并通过 REST API 集成到内部应用、聊天机器人或分析门户。其近期演进重点是围绕语义视图、已验证查询和评估机制形成质量闭环:团队可以保存“自然语言问题—标准 SQL”组合,帮助系统回答相似问题;还可以执行评估,比较生成结果与标准答案,观察正确性、延迟和回归情况。Cortex Analyst 介绍、评估功能文档。citeturn1search9turn1search10
这一方案适合数据主要位于 Snowflake、希望把自然语言分析嵌入现有业务系统的团队。其价值不只是减少 SQL 编写工作,还在于能够把业务规则、审核样例和测试过程纳入持续维护。不过,语义视图与标准查询仍需数据团队长期运营,否则新增指标和口径变化可能造成回答质量下降。
三、Databricks:从 Genie 问数扩展到统一 AI 体验
Databricks 已将 Genie 扩展为覆盖不同角色的 AI 产品家族,其中 Genie One 面向业务用户,Genie Agents 用于配置特定业务领域的数据、指标和规则,Genie Code 则服务于开发者与技术人员。答案以组织数据为基础,并通过 Unity Catalog 进行治理。与此同时,Databricks AI/BI 将对话分析、AI 仪表板和可复用语义能力放到同一平台中,强调从数据治理到分析消费的一致体验。Genie 官方文档、Databricks AI/BI 文档。citeturn1search13turn1search15
值得关注的是,Genie 的定位不再局限于单个聊天窗口,而是逐步连接仪表板、应用和开发流程。数据团队可配置数据集、示例查询、指标及业务规则,再由业务人员用自然语言探索。这种模式更适合已经采用湖仓架构、同时存在 SQL、Python、机器学习和 BI 工作负载的组织,但也要求 Unity Catalog 中的元数据、指标视图和访问权限足够成熟。
四、BigQuery:自然语言贯穿数据探索与工程流程
Gemini in BigQuery 已覆盖数据洞察、对话式分析、Data Canvas、SQL 与 Python 辅助、数据准备以及数据工程代理等场景。用户既可以直接与表、视图、图数据和 Lakehouse 表进行一次性对话,也可以创建带有业务术语、指令和已验证查询的数据代理。Data Canvas 则允许用户通过自然语言查找、连接和查询数据,并继续完成结果可视化。Gemini in BigQuery 概览、对话式分析文档。citeturn1search19turn1search22
BigQuery 的特点是把自然语言能力延伸到分析生命周期的多个环节,而不是只提供问答入口。对于已经使用 Google Cloud、BigQuery 和 Looker 的团队,这有利于减少工具切换。不过,官方同时提醒生成结果可能看似合理但存在事实错误,因此生产使用仍需保留 SQL 检查、结果验证和权限审计。责任使用说明、配置与权限文档。citeturn1search21turn1search23
五、Microsoft Fabric:数据代理连接 Power BI 与 Copilot
Microsoft Fabric 数据代理可以面向 Lakehouse、Warehouse、Power BI 语义模型、KQL 数据库、镜像数据库和本体提供自然语言问答,并按照用户的 Microsoft Entra ID 身份和数据权限执行查询。数据代理还可在 Power BI Copilot、Microsoft 365 Copilot、Copilot Studio 以及 MCP 端点中被调用,使问数能力从独立分析页面进入日常办公和业务应用。Fabric 数据代理文档、Power BI 集成说明。citeturn1search30turn1search25
这一方向的关键价值是把分析入口移动到用户已有的工作环境中。业务人员不必先找到具体报表,再逐层筛选数据,而可以提出问题并选择有权访问的语义模型、报表或数据代理作为答案来源。但数据代理并不会替代语义模型建设和专业分析人员;模型关系、度量值定义与业务背景仍需要人工维护。Power BI Copilot 说明、Fabric Copilot 概览。citeturn1search27turn1search28
六、企业选型应重点评估什么
- 数据生态:优先考虑与现有仓库、湖仓、BI 和权限体系一致的方案,避免为自然语言功能复制大量数据。
- 语义治理:检查产品是否支持统一指标、业务术语、表关系、示例问题和已验证查询。
- 可解释性:确认能否查看生成的 SQL、使用的数据源、筛选条件及中间步骤。
- 质量评估:建立覆盖高频问题、边界条件和权限场景的测试集,持续监控正确率、延迟与回归。
- 成本控制:除模型调用成本外,还要计算数据库扫描、计算资源、并发查询和语义层维护成本。
- 安全边界:验证行级与列级权限、敏感字段处理、跨区域数据传输、日志审计及第三方模型的数据保留策略。
总结
AI 数据库与自然语言数据分析的最新进展,可以概括为三个趋势:从简单的文本转 SQL 转向语义驱动的可信分析,从单次问答转向可配置的数据代理,从独立聊天窗口转向 BI、办公软件和业务应用中的统一入口。Snowflake 强调可嵌入与可评估,Databricks 强调湖仓治理和多角色体验,BigQuery 将自然语言覆盖到探索、查询与数据工程,Microsoft Fabric 则突出 Power BI 与 Copilot 生态联动。
真正决定项目成败的,不是模型能否生成一条 SQL,而是组织能否提供统一指标、可靠元数据、严格权限和持续评估机制。自然语言降低的是操作门槛,不会自动消除数据质量与业务口径问题。