智能问数产品现况与选型观察

从“AI 写 SQL”到“语义层驱动的可信数据智能体”,主流产品正在把问数、图表、权限、指标口径、洞察报告和 Agent 工作流接到一起。

ChatBI Text-to-SQL Semantic Layer Agentic BI
4 类商业 BI、云数据平台、国内厂商、开源自建
1 条主线从自然语言转 SQL 走向可信语义与治理
30-50建议 MVP 先用高频问题集验证准确率
不是模型成败核心是指标口径、权限和持续运营

一眼看清:产品正在往哪里走

智能问数已经不再只是把一句中文翻译成 SQL。越成熟的产品,越强调语义模型、指标治理、权限、安全执行、可解释回答和反馈评测。

商业 BI AI 化

从看板到对话

Power BI、Tableau、ThoughtSpot、FineBI 等把自然语言入口放进已有 BI 体系,优势是权限、报表、图表和交付成熟。

云平台原生

从数据底座发力

Snowflake、Databricks、Looker、QuickSight 更重视和数仓、湖仓、目录、权限、计算资源的结合。

国内场景

中文与私有化

Quick BI 小Q、FineChatBI、Smartbi、观远、衡石等更强调中文业务术语、私有部署、信创和行业交付。

开源自建

更可控但更费工

SQLBot、SuperSonic、WrenAI、DB-GPT 等适合 PoC 和二开,但企业级治理、评测和运维需要自己补齐。

市场地图:成熟度与可控性的取舍

越靠右表示企业级成熟度越高,越靠上表示自研可控性越强。多数团队真正要选的不是“最强产品”,而是“最符合自身数据底座和交付约束的路线”。

海外产品:从 Copilot 到 Agentic Analytics

海外头部产品普遍不再讲单点 NLQ,而是把自然语言入口和语义模型、数据权限、报表创作、嵌入式分析、Agent 工作流绑定。

Power BI Copilot

微软生态

适合已有 Power BI/Fabric 的组织。强项是报表总结、DAX 辅助、语义模型驱动问答和办公生态协同。

优势
  • BI 底座成熟
  • 权限和容量统一管理
  • 报表作者提效明显
限制
  • 需要付费容量
  • 非英文与区域限制需验证
  • 绑定微软生态

Tableau Agent

视觉分析

更像分析师的建图和探索助手。适合用自然语言生成图表、计算字段、过滤排序和探索建议。

优势
  • 可视化表达强
  • 适合分析创作
  • 与 Tableau UI 协同好
限制
  • 不是开放式机器人
  • 复杂数据混合受限
  • 仍依赖数据建模

ThoughtSpot Spotter

AI Analyst

搜索式分析代表产品,强调自然语言问答、可视化、自助分析和企业 trust layer。

优势
  • 业务用户体验成熟
  • 搜索式分析积累深
  • 嵌入式分析能力强
限制
  • 商业成本较高
  • 依赖模型和字段治理
  • 国内部署需评估

Looker Conversational Analytics

LookML 语义层

基于 Gemini 和 LookML,让自然语言在受治理的 Explore 和 Data Agent 中执行。

优势
  • 语义层强
  • 口径一致
  • 可做 data agent
限制
  • LookML 门槛高
  • 绑定 Google/Looker
  • 合规边界需审查

Snowflake Cortex Analyst

API-first

更像 Snowflake 原生问数 API。通过 semantic model 或 semantic views 把业务问题转为可信 SQL。

优势
  • 与 Snowflake 权限结合
  • API 集成灵活
  • 语义模型路径清晰
限制
  • 需自建前端体验
  • 绑定 Snowflake
  • 多轮仍有边界

Databricks Genie

湖仓问数空间

围绕 Genie Space 创建领域化问数入口,由分析师配置数据集、示例 SQL、业务说明和评测。

优势
  • Unity Catalog 治理
  • SQL/表格/可视化闭环
  • 支持 API 和外部嵌入
限制
  • 绑定 Databricks
  • 需要持续策划空间
  • 计算成本需控制

国内产品:中文业务、私有化和行业交付更关键

国内产品常把智能问数放在 BI、数据门户、经营分析、移动办公和私有化项目里一起交付。它们的优势不只在模型,而在中文业务术语、权限、报表闭环和现场实施。

产品 主要特色 优点 注意点
Quick BI 小Q问数 PC/移动端自然语言问数、数据集问答、仪表板问数、多轮对话 阿里云和 Quick BI 生态衔接好,中文体验和移动办公友好 增值模块、版本和区域有限制,绑定 Quick BI 数据集
FineBI / FineChatBI 可信查数、智能模式/极速模式、结合 FineBI 报表和数据门户 国内交付成熟,私有化和复杂报表能力强 商业闭源,二开空间有限,依赖前期数据治理
Smartbi AIChat 智能问数、复杂计算、图表生成、下钻引导、歧义澄清 重视同环比、累计等复杂指标计算,适合政企金融 宣传准确率需用真实业务数据做 POC 验证
观远问数 Agent 意图识别、知识召回、问题理解、数据查询、可视化和洞察建议 场景化强,贴近经营会议和业务分析 依赖业务知识库和指标口径运营
衡石 Data Agent Text2Metrics、指标管理、Agentic BI、嵌入式 BI 用指标层约束问数,减少纯 SQL 幻觉,适合 ISV 指标体系建设成本较高,不适合只做轻量查表
网易知数 / 有数 ChatBI 指标体系、知识库、数据分析智能体 互联网数据分析实践沉淀,适合运营和增长场景 公开资料相对少,需 POC 确认产品边界

开源方案:适合验证,但生产化要补课

开源产品的价值在于可控和可学习。真正上线时,要特别关注许可证、权限模型、SQL 安全、评测体系和长期维护。

SQLBot

中文 PoC

基于大模型和 RAG 的智能问数系统,能较快跑通 ChatBI、SQL 和图表闭环。

上手
可控
治理

SuperSonic

语义层

统一 ChatBI 和 Headless BI,内置语义模型、自动补全、多轮和三级权限。

上手
可控
治理

WrenAI

Agent GenBI

面向 AI Agent 的开放上下文层,用 MDL、业务定义、示例和记忆生成可信 BI。

上手
可控
治理

DB-GPT

数据助手

覆盖 SQL、Python 分析、技能、RAG、沙箱、图表和 HTML 报告,适合做数据分析 Agent。

上手
可控
治理

QueryWeaver

Graph Text2SQL

用图结构理解 schema,提供 REST API、MCP 和前端,适合复杂表关系研究。

上手
可控
治理

Chat2DB / SQLChat / PandasAI

工具型

更适合开发者、DBA、分析师或 Notebook 场景,不建议直接作为大量业务用户的正式问数入口。

上手
可控
治理

选型时看三件事

不要只比较“能不能回答”。真正决定长期价值的是语义治理能力、产品集成方式和运营评测闭环。

可信

是否有语义层

能否定义指标、维度、同义词、口径、表关系、行列权限。没有语义层,复杂问题很难稳定。

可用

是否闭环到业务入口

是否能进入门户、看板、IM、移动端、报告和订阅。用户不会为了问数再打开一个陌生工具。

可运营

是否可评测和纠错

能否沉淀标准问题、标准 SQL、失败案例、用户反馈和回归测试。智能问数越用越准,靠的是运营。

落地难点:不是模型不够聪明

大模型能提升交互,但它不能自动修复口径混乱、字段命名混乱、权限缺失和历史数据质量问题。

1

表字段不懂业务

库表名、字段名和注释不足时,模型只能猜。

2

指标口径不统一

同一个“人数”在不同部门可能含义不同。

3

多表关系复杂

join 路径、时间粒度和聚合层级最容易出错。

4

权限必须前置

问数必须先过角色、行列级权限和脱敏规则。

5

没有评测就会退化

模型、提示词、表结构变化后,要能回归测试。

关键判断 纯 Text-to-SQL 可以做演示,但生产系统应走“自然语言 → 业务语义层 → 查询计划 → SQL → 校验执行 → 可解释答案”的路线。

自研项目路线:先小而准,再扩业务域

建议用一个业务域跑通闭环,而不是一开始接入全库。比如招生、财务、人事、教学、科研中选一个,先把 30-50 个高频问题做准。

阶段一
2-4 周
  • 选择一个业务域和 5-10 张核心表。
  • 整理 30-50 个高频问题、标准 SQL 和口径说明。
  • 跑通问答、SQL、安全执行、图表和解释。
阶段二
1-2 个月
  • 加入权限、脱敏、SQL 白名单、超时和审计。
  • 支持多轮追问、同比环比、下钻和图表切换。
  • 接入门户或 IM,建立反馈和失败案例修复流程。
阶段三
3-6 个月
  • 扩展到多个业务域,建设统一指标和数据目录。
  • 做自动评测、回归测试和问题推荐。
  • 封装 API/MCP,让报告生成、门户和其他智能体复用。

资料来源

以下为主要参考入口,产品细节以官方文档和实际 POC 为准。