Skip to content

Databricks数据湖仓集成金蝶云星空(湖仓分析 + 反向ETL)解决方案 ​

更新: 10/8/2026 字数: 0 字 时长: 0 分钟

业务背景 ​

源系统成集云目标系统
Databricks(数据湖仓 / 数据科学平台)金蝶云星空

企业的核心交易数据沉淀在 金蝶云星空——物料、客户、供应商、销售订单、应收应付、库存与总账都在这里实时发生;而 Databricks 是集数据湖与数据仓库于一体的湖仓平台,数据团队在此构建客户信用评分、销售预测、需求计划、成本还原与风险预警等分析与机器学习主题。两套系统长期靠人工导表互通,带来明显痛点:

  • 分析用数滞后且割裂:金蝶数据靠人工导出 CSV 再上传湖仓,时效以"天/周"计,且多份拷贝口径不一,分析结论跟不上经营节奏。
  • 模型成果无法驱动业务:Databricks 算出的客户信用分、销售预测、补货建议、成本还原结果,无法自动写回金蝶去驱动授信、采购与核算,分析沦为"看板上的摆设"。
  • 缺乏统一数据底座:交易明细散落多系统,缺少统一的湖仓 ODS 层做清洗与建模,数据科学团队反复"找数造数"。
  • 大体量同步性能差:交易明细量大,靠逐条 API 写入既慢又贵,缺乏高吞吐的批量入湖通道。

解决方案 ​

基于成集云数据集成平台,打通 金蝶云星空 OpenAPI 与 Databricks SQL Statement Execution API 两条通道:一方面以增量抽取把金蝶的物料、客户、供应商、销售订单、应收应付、库存与总账凭证同步进 Databricks 的 Unity Catalog 表(经由 SQL REST 批量写入),供分析建模与机器学习;另一方面把 Databricks 计算产出的信用评分、销售预测、补货建议、成本还原与预算数通过湖仓结果集经成集云回写金蝶对应业务对象,形成"交易进湖仓、洞察回业务"的双向数据闭环。

业务流程 ​

一、金蝶业务数据入湖仓流程 ​

二、湖仓分析建模流程 ​

三、洞察成果回写金蝶流程 ​

四、湖仓 + 反向ETL 双向总览 ​

对接说明 ​

一、基础资料与交易入湖仓(金蝶 → Databricks) ​

金蝶对象关键字段Databricks 目标表同步方式
物料物料编码、名称、规格、计量单位ods_material增量抽取 + SQL 批量写入
客户 / 供应商编码、名称、税号、信用额度ods_customer / ods_supplier增量抽取 + SQL 批量写入
销售订单 / 应收单据号、客户、金额、日期ods_sale_order / ods_ar增量抽取 + SQL 批量写入
采购订单 / 应付单据号、供应商、金额、日期ods_purchase / ods_ap增量抽取 + SQL 批量写入
库存余额仓库、物料、数量ods_inventory定时快照 + SQL 批量写入
总账凭证科目、借贷、期间ods_gl增量抽取 + SQL 批量写入
  • 高吞吐入湖:金蝶抽取出的增量经由成集云拼装为批量 INSERT/COPY 语句,调用 Databricks SQL Statement Execution API(POST /api/2.0/sql/statements)写入 Unity Catalog 表,性能优于逐条 API 写入。
  • 增量抽取:基于金蝶单据的创建/修改时间戳做 CDC 增量,配合成集云调度按 5~15 分钟频率拉取,保证湖仓时效。
  • 主键映射:以金蝶业务编码作为 Databricks 表主键/自然键,写入时实现 upsert,避免重复。

二、分析成果回写(Databricks → 金蝶) ​

Databricks 分析主题计算口径金蝶目标对象说明
客户信用评分 / 账期建议回款、逾期、交易额建模客户信用档案 / 授信额度驱动销售授信与发货控制
销售预测时序与归因模型销售预测单 / 需求计划指导生产与备货
库存补货建议安全库存与 lead time 模型采购申请 / 补货计划触发采购执行
成本还原 / 标准成本作业与分摊模型成本调整单 / 核算维度提升核算精度
预算数 / 控制数经营预算模型预算控制方案支撑费控与预算执行监控
  • 回写通道:Databricks 计算结果经成集云导出为结果集,调用金蝶 OpenAPI 写入业务对象;或由成集云直接驱动金蝶写接口。
  • 鉴权:Databricks 使用 Personal Access Token 或 OAuth 令牌访问 SQL Statement Execution API,按最小权限授予目标库表的操作角色。

三、同步规则与过滤条件 ​

  • 双向编排:在成集云中以"金蝶抽取任务 → 入湖 → 建模 → 回写金蝶"为一条编排流水线,失败可断点重跑。
  • 幂等与去重:入湖以业务编码做 upsert;回写以"分析版本号+业务编码"做唯一键,重复结果自动跳过。
  • 数据质量闸口:入湖前做空值、类型与编码校验,异常数据进入成集云质量队列并告警,不污染湖仓。
  • 异常隔离:单表同步失败不影响其他表与其他方向,保障整链稳定。
  • 安全合规:金蝶与 Databricks 凭据均以密钥托管方式存于成集云,传输加密,不落明文。

业务价值 ​

  • 用数时效从天级到分钟级:金蝶交易数据近实时入湖仓,经营分析与 BI 看板不再等"月底导表",决策更快。
  • 分析真正驱动业务:客户信用、销售预测、补货与成本还原结果自动回流金蝶,授信、采购与核算从"凭经验"走向"凭模型"。
  • 统一数据底座:以金蝶为交易事实源、Databricks 为统一湖仓分析层,核心指标单一口径,支撑机器学习规模化落地。
  • 高吞吐低成本:SQL 批量写入替代逐条 API 写入,大体量明细同步性能与成本显著优化,释放 ERP 查询压力。

接口文档 ​

  • 金蝶云星空开放 API(Web API):物料、客户、供应商、销售订单、采购订单、应收、应付、库存、总账凭证、信用档案、成本调整
  • Databricks SQL Statement Execution API 2.0(POST /api/2.0/sql/statements,Personal Access Token / OAuth Bearer 鉴权):执行 SQL 查询与 INSERT/MERGE 批量写入 Unity Catalog 表
  • 成集云 iPaaS 连接器:金蝶云星空连接器 + Databricks 连接器,支持增量抽取、SQL 批量入湖、结果集回写与双向编排