三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

DataFocus平台介绍与落地使用实践

DataFocus平台介绍与落地使用实践

摘要

数字化转型背景下,企业普遍存在业务人员取数门槛高、IT 团队被临时取数需求挤占精力、传统 BI 工具操作复杂、指标口径难以统一等痛点。搜索式智能 BI 平台 DataFocus 作为国内成熟的 NL2SQL 自然语言数据分析产品,依托自研 NLP 语义解析引擎、内存计算与一体化数据底座,打通从数据接入、自然语言查询、可视化分析、智能洞察到报表共享的全流程,支持业务人员使用日常口语直接查询数据,大幅降低数据分析门槛。本文系统介绍 DataFocus 产品定位、技术架构、核心功能,完整梳理标准化部署流程、实操使用方法、语义层治理、权限管控、运维运营规范,并结合落地经验总结优势、现存局限与最佳实践,同时对比同类智能问数平台,为企业选型、实施与常态化运营提供完整参考方案。

一、DataFocus 产品概述

DataFocus 由杭州汇数智通科技研发,是国内较早实现商业化落地的搜索式智能 BI 平台,对标海外 ThoughtSpot,同时兼顾国内企业数据环境与中文自然语言理解需求,定位一站式自助数据分析与 ChatBI 解决方案。区别于传统拖拽型 BI 工具,DataFocus 以 “搜索交互” 为核心体验,用户无需掌握 SQL、无需熟练拖拽组件,通过自然语言提问即可完成数据查询、多维度统计、可视化生成与异常洞察。

平台整体产品矩阵包含 DataFocus Cloud 云端 SaaS 版本、私有化本地部署版本两大形态,配套 DataSpring 流批一体 ETL 工具、FocusGPT 智能分析体、Focus Search 独立 NL2SQL 引擎组件。既可作为完整 BI 平台独立使用,也可将 NL2SQL 能力通过 API 嵌入企业内部系统、数据中台,搭建自研智能问数模块,与 DataPilot 属于同赛道企业级自然语言数据分析产品。

当前企业落地场景覆盖零售、制造、金融、运营商、互联网、教育等行业,典型应用包括经营指标自助查询、销售数据分析、供应链监控、客户行为分析、运维指标探查等。平台核心目标是弥合业务团队与数据团队的鸿沟,推动数据自助分析,减少重复性取数需求,构建企业内部数据驱动文化。

二、DataFocus 技术架构与核心原理

DataFocus 采用分层模块化架构,整体分为数据源接入层、数据预处理与存储层、语义解析引擎层、智能分析计算层、前端交互应用层,配套权限控制、元数据管理、审计日志体系。

2.1 分层架构详解

  1. 数据源接入层支持 MySQL、PostgreSQL、Oracle、SQL Server、Hive、ClickHouse、MaxCompute 等主流数据库与数仓,同时兼容 CSV、Excel 文件导入,支持 API 实时数据接入。平台提供增量同步、全量同步两种模式,支持 CDC 实时数据捕获。生产落地规范中,禁止直连 OLTP 业务库,优先对接 DWD/DWS 数仓分层表,避免查询冲击交易系统。

  2. 数据预处理与存储层内置轻量级 ELT 引擎,支持清洗、字段转换、多表关联建模;搭载列式内存计算引擎,亿级数据集可实现秒级响应。平台支持两种运行模式:一是数据回写到平台内置存储,依靠内存加速查询;二是直查模式,直接下发 SQL 至底层数仓执行,适合数据量巨大、不允许数据外迁的企业。

  3. 语义解析引擎(核心模块 Focus Search)区别于通用大模型直接生成 SQL 的技术路线,DataFocus 采用自研NL→DSL→SQL 二级转换机制。先将用户自然语言转化为平台领域中间语言 DSL,再依据元数据、业务知识库生成标准可执行 SQL。该方式能够有效约束字段、表范围,缓解大模型幻觉问题。引擎内置实体识别、维度识别、聚合函数识别、时间语义解析,支持 “上月”“近 90 天”“同比”“环比” 等口语化时间条件解析。

  4. 智能分析与机器学习层集成 FocusGPT 多轮对话智能体,支持连续追问、下钻分析、自动生成分析结论;内置智能洞察算法,自动识别指标波动、突增突降、异常拐点,主动推送预警信息;支持自定义公式、派生指标,满足毛利率、复购率等复杂指标计算。

  5. 应用与共享层包含搜索问答面板、可视化看板、定时报表、数据订阅、嵌入式组件、报告导出能力,支持将图表、问答页面嵌入飞书、钉钉、企业微信、业务后台,实现分析能力向外输出。

2.2 部署模式选型

  • SaaS 云版本(DataFocus Cloud):适合中小企业、快速试点,无需自建服务器,开箱即用,运维成本低;缺点是敏感经营数据存储于云端,大型集团、金融、政务行业通常受限。

  • 私有化部署版本:数据全部存储在内网,支持集群横向扩容,适配国产化服务器与操作系统,支持 LDAP、SAML 单点登录,提供完整 API 接口,是大中型企业主流选择。

  • 组件化输出:单独输出 Focus Search NL2SQL 引擎,嵌入企业自有数据平台,类似 DataPilot 独立服务化部署模式。

三、DataFocus 核心功能介绍

3.1 自然语言搜索问答(核心能力)

用户在搜索框输入中文自然语言,例如 “2025 年各区域有效订单销售额,按月统计”,系统自动完成意图识别、匹配数据表、生成 SQL、执行查询,并自适应推荐折线图、柱状图、饼图等可视化图表。支持多轮连续对话,基于上一轮查询上下文追加筛选条件,实现逐层下钻分析。系统内置搜索建议,自动提示指标、维度名称,降低用户提问难度。

3.2 数据集建模与语义层管理

数据集是 DataFocus 业务建模最小单元,将多张物理数据表通过主键关联形成逻辑主题域,例如 “销售数据集” 整合订单表、商品表、用户表、退款表。语义层能力是保障查询准确率的关键,平台提供四类核心配置:

  1. 同义词配置:统一业务术语,如 “营收 = 销售额”“客户 = 用户”,兼容业务部门不同口头叫法;

  2. 自定义关键词:封装复杂筛选条件,例如 “有效订单” 预先定义剔除测试订单、退款订单;

  3. 派生指标:录入复合计算指标,固化口径,避免 AI 自由发挥计算逻辑;

  4. 元数据注释完善:录入表含义、字段业务说明,辅助语义引擎理解数据含义。

语义层能力与 DataPilot 知识库、指标字典设计思路高度一致,是抑制 NL2SQL 幻觉最核心手段。

3.3 可视化看板与自助报表

用户将问答结果保存为图表,拖拽布局搭建经营看板,支持地理分布图、热力图、明细表、折线图等几十种图表类型。看板支持权限隔离、定时刷新、邮件 / 企业微信订阅推送,支持导出 PDF、图片、Excel 文件。同时支持设置数据预警,当指标超出阈值自动推送消息。

3.4 FocusGPT 智能分析体

作为平台 AI 升级模块,FocusGPT 不仅返回数据结果,还能够自动解读数据变化原因、计算同比环比、输出文字分析总结,一键生成完整数据分析报告。支持对异常数据进行根因探查,适合业务人员开展探索式分析。

3.5 权限体系、审计与数据安全

平台采用三层权限模型:平台访问权限、数据集访问权限、行列数据权限。可以实现行级数据隔离,例如销售仅查看自身负责区域数据;支持字段脱敏配置,手机号、身份证等敏感信息自动脱敏展示。系统完整记录审计日志,保存用户提问语句、生成 SQL、查询时间、导出行为,满足合规审计要求。

3.6 开放 API 与嵌入式能力

提供完整 REST API,支持外部系统调用自然语言查询接口,获取数据与图表配置;支持 iframe 嵌入,将问答页面、看板集成至内部 OA、业务系统,构建统一数据入口。

四、DataFocus 标准化落地与实操使用流程

企业落地 DataFocus 分为试点规划、数据接入与建模、语义治理、用户试用推广、持续运营五大阶段,整套流程可直接复用至同类 ChatBI 平台实施。

4.1 阶段一:前期规划与环境准备

首先明确使用范围,优先选择单一业务线试点(销售、运营等),梳理核心指标清单,统一指标业务口径,避免口径混乱。技术团队完成网络开通、服务器资源规划;私有化部署需规划独立资源池,禁止与业务库共用计算资源。同时梳理数据源清单,确认数据表、更新频率、数据质量,清洗脏数据。

4.2 阶段二:数据源接入与数据集构建

  1. 选择同步模式,配置数据库连接,设置增量同步周期;

  2. 创建业务数据集,完成多表关联关系配置,梳理主外键;

  3. 校验数据一致性,对比源库数据,排查同步延迟、缺失值问题。 实操禁忌:一次性接入数百张无关数据表,会扩大语义检索范围,大幅提升幻觉概率,建议按业务域拆分数据集。

4.3 阶段三:语义层治理(决定平台使用效果的关键)

大量企业上线后查询准确率偏低,根源在于忽略语义层配置。标准化操作步骤:

  1. 导入全部核心指标,录入指标定义、统计口径、计算公式;

  2. 批量配置同义词、业务黑话;

  3. 录入高频示例问答,沉淀标准提问案例,辅助引擎匹配最优查询逻辑;

  4. 统一时间规则,明确 “上月”“年初至今” 等时间范围计算标准。 完成配置后开展批量测试,收集错误 Query,持续优化语义配置。

4.4 阶段四:用户使用与功能实操规范

面向业务用户制定统一使用规范,引导规范提问:问题尽量包含时间范围、统计维度、指标名称,减少 “最近业绩怎么样” 这类模糊提问。标准操作流程:

  1. 登录平台,选择对应业务数据集;

  2. 在搜索框输入自然语言查询,查看图表结果;

  3. 通过多轮追问进行维度下钻、筛选;

  4. 将常用查询保存至个人收藏,或添加到看板;

  5. 结果确认无误后分享、订阅或导出数据。 同时明确红线:AI 查询结果必须人工复核,不可直接作为经营决策唯一依据。

4.5 阶段五:持续迭代运营

建立定期优化机制:每周收集用户反馈的错误查询,更新语义知识库;每月梳理新增指标,同步录入平台;监控慢查询、高危查询,优化同步策略与数据集模型。

五、DataFocus 优势、现存局限与落地最佳实践

5.1 产品核心优势

第一,本土化中文 NLP 能力突出,深度适配国内业务人员口语化表达,时间语义、业务术语解析优于海外同类产品 ThoughtSpot; 第二,一站式全栈能力,自带数据同步、存储、建模、分析能力,中小企业无需额外采购 ETL 工具; 第三,二级 NL-DSL-SQL 架构相比单纯大模型直出 SQL,幻觉控制效果更好,适合对数据准确性要求较高的经营分析场景; 第四,部署灵活,支持私有化、SaaS、组件输出多种模式,开放程度高,便于嵌入企业现有技术体系; 第五,上手门槛低,业务人员经过短期培训即可独立使用,实施周期远短于传统 BI。

5.2 当前产品局限

第一,生态丰富度相比 Power BI、FineBI 等传统成熟 BI 较弱,高级可视化自定义能力有限; 第二,面对超复杂多表嵌套、多层子查询场景,自动生成 SQL 能力仍存在短板,复杂分析场景依然需要数据人员支撑; 第三,SaaS 版本数据合规存在约束,大型集团、金融行业优先选择私有化部署,实施成本更高; 第四,原生机器学习建模能力偏弱,重点聚焦描述性分析,预测类分析场景需要搭配其他工具。

5.3 落地最佳实践

  1. 严格做好业务域隔离:按业务线拆分数据集,用户仅开放对应数据集访问权限,缩小语义检索范围;

  2. 建立口径变更流程:指标口径调整必须同步更新平台语义层,同步通知所有使用者,杜绝新旧口径并行;

  3. 查询资源管控:配置最大返回行数、查询超时时间,拦截无分区全表扫描等高风险 SQL,防止冲击底层数据库;

  4. 分层用户培训:区分业务用户、数据管理员,管理员重点掌握建模、语义配置,业务用户重点学习规范提问;

  5. 构建质量监控闭环:持续收集错误案例,定期迭代知识库,形成 “用户反馈 - 问题标注 - 语义优化 - 验证” 闭环;

  6. 避免过度预期:清晰界定平台定位,作为自助取数辅助工具,复杂深度分析仍然依靠数据分析师。

六、DataFocus 与 DataPilot 同类产品简要对比

DataFocus 与 DataPilot 同属面向企业的 NL2SQL 智能问数平台,核心目标一致,但产品设计存在差异。DataFocus 是完整一体化 BI 产品,自带可视化、看板、数据存储、ETL 能力,开箱即用,偏向完整自助分析场景;DataPilot 更多定位智能查询 Agent,侧重于自然语言生成 SQL 能力,常与企业现有 BI、数据仓库配套使用,轻量化集成属性更强。

选型参考:企业缺少统一 BI 平台,希望一站式完成数据接入、建模、可视化,优先考虑 DataFocus;企业已有成熟数仓与 BI 体系,仅需要补充自然语言取数能力,希望轻量化嵌入现有平台,适合选择 DataPilot 或独立 NL2SQL 引擎组件。

七、总结

在智能数据分析普及浪潮下,以 DataFocus 为代表的搜索式 BI 平台重构了企业数据分析交互方式,打破 “必须懂 SQL 才能取数” 的壁垒。DataFocus 依靠自研语义解析引擎、一体化数据底座、灵活部署模式,为国内企业提供本土化自助分析解决方案。但平台价值能否充分释放,并不单纯依赖产品功能,更取决于完善的数据治理、标准化语义层建设、常态化运营机制。

企业在落地使用过程中,应当遵循分阶段实施策略,先试点验证价值,持续完善指标口径与业务知识库,同时建立安全管控、权限审计规范,平衡便捷取数与系统稳定、数据安全。客观看待 AI 分析能力边界,坚持 “AI 辅助查询、人工校验结论”,避免盲目依赖自然语言生成结果。合理运用 DataFocus,能够有效释放数据团队精力,赋能业务人员自助探查数据,持续推动企业构建数据驱动的经营体系。

← 返回列表