Databricks数据湖仓集成金蝶云星空(湖仓分析 + 反向ETL)解决方案
更新: 10/8/2026 字数: 0 字 时长: 0 分钟
业务背景
| 源系统 | 成集云 | 目标系统 |
|---|---|---|
| Databricks(数据湖仓 / 数据科学平台) | ![]() | 金蝶云星空 |
企业的核心交易数据沉淀在 金蝶云星空——物料、客户、供应商、销售订单、应收应付、库存与总账都在这里实时发生;而 Databricks 是集数据湖与数据仓库于一体的湖仓平台,数据团队在此构建客户信用评分、销售预测、需求计划、成本还原与风险预警等分析与机器学习主题。两套系统长期靠人工导表互通,带来明显痛点:
- 分析用数滞后且割裂:金蝶数据靠人工导出 CSV 再上传湖仓,时效以"天/周"计,且多份拷贝口径不一,分析结论跟不上经营节奏。
- 模型成果无法驱动业务:Databricks 算出的客户信用分、销售预测、补货建议、成本还原结果,无法自动写回金蝶去驱动授信、采购与核算,分析沦为"看板上的摆设"。
- 缺乏统一数据底座:交易明细散落多系统,缺少统一的湖仓 ODS 层做清洗与建模,数据科学团队反复"找数造数"。
- 大体量同步性能差:交易明细量大,靠逐条 API 写入既慢又贵,缺乏高吞吐的批量入湖通道。
解决方案
基于成集云数据集成平台,打通 金蝶云星空 OpenAPI 与 Databricks SQL Statement Execution API 两条通道:一方面以增量抽取把金蝶的物料、客户、供应商、销售订单、应收应付、库存与总账凭证同步进 Databricks 的 Unity Catalog 表(经由 SQL REST 批量写入),供分析建模与机器学习;另一方面把 Databricks 计算产出的信用评分、销售预测、补货建议、成本还原与预算数通过湖仓结果集经成集云回写金蝶对应业务对象,形成"交易进湖仓、洞察回业务"的双向数据闭环。
业务流程
一、金蝶业务数据入湖仓流程
二、湖仓分析建模流程
三、洞察成果回写金蝶流程
四、湖仓 + 反向ETL 双向总览
对接说明
一、基础资料与交易入湖仓(金蝶 → Databricks)
| 金蝶对象 | 关键字段 | Databricks 目标表 | 同步方式 |
|---|---|---|---|
| 物料 | 物料编码、名称、规格、计量单位 | ods_material | 增量抽取 + SQL 批量写入 |
| 客户 / 供应商 | 编码、名称、税号、信用额度 | ods_customer / ods_supplier | 增量抽取 + SQL 批量写入 |
| 销售订单 / 应收 | 单据号、客户、金额、日期 | ods_sale_order / ods_ar | 增量抽取 + SQL 批量写入 |
| 采购订单 / 应付 | 单据号、供应商、金额、日期 | ods_purchase / ods_ap | 增量抽取 + SQL 批量写入 |
| 库存余额 | 仓库、物料、数量 | ods_inventory | 定时快照 + SQL 批量写入 |
| 总账凭证 | 科目、借贷、期间 | ods_gl | 增量抽取 + SQL 批量写入 |
- 高吞吐入湖:金蝶抽取出的增量经由成集云拼装为批量 INSERT/COPY 语句,调用 Databricks SQL Statement Execution API(
POST /api/2.0/sql/statements)写入 Unity Catalog 表,性能优于逐条 API 写入。 - 增量抽取:基于金蝶单据的创建/修改时间戳做 CDC 增量,配合成集云调度按 5~15 分钟频率拉取,保证湖仓时效。
- 主键映射:以金蝶业务编码作为 Databricks 表主键/自然键,写入时实现 upsert,避免重复。
二、分析成果回写(Databricks → 金蝶)
| Databricks 分析主题 | 计算口径 | 金蝶目标对象 | 说明 |
|---|---|---|---|
| 客户信用评分 / 账期建议 | 回款、逾期、交易额建模 | 客户信用档案 / 授信额度 | 驱动销售授信与发货控制 |
| 销售预测 | 时序与归因模型 | 销售预测单 / 需求计划 | 指导生产与备货 |
| 库存补货建议 | 安全库存与 lead time 模型 | 采购申请 / 补货计划 | 触发采购执行 |
| 成本还原 / 标准成本 | 作业与分摊模型 | 成本调整单 / 核算维度 | 提升核算精度 |
| 预算数 / 控制数 | 经营预算模型 | 预算控制方案 | 支撑费控与预算执行监控 |
- 回写通道:Databricks 计算结果经成集云导出为结果集,调用金蝶 OpenAPI 写入业务对象;或由成集云直接驱动金蝶写接口。
- 鉴权:Databricks 使用 Personal Access Token 或 OAuth 令牌访问 SQL Statement Execution API,按最小权限授予目标库表的操作角色。
三、同步规则与过滤条件
- 双向编排:在成集云中以"金蝶抽取任务 → 入湖 → 建模 → 回写金蝶"为一条编排流水线,失败可断点重跑。
- 幂等与去重:入湖以业务编码做 upsert;回写以"分析版本号+业务编码"做唯一键,重复结果自动跳过。
- 数据质量闸口:入湖前做空值、类型与编码校验,异常数据进入成集云质量队列并告警,不污染湖仓。
- 异常隔离:单表同步失败不影响其他表与其他方向,保障整链稳定。
- 安全合规:金蝶与 Databricks 凭据均以密钥托管方式存于成集云,传输加密,不落明文。
业务价值
- 用数时效从天级到分钟级:金蝶交易数据近实时入湖仓,经营分析与 BI 看板不再等"月底导表",决策更快。
- 分析真正驱动业务:客户信用、销售预测、补货与成本还原结果自动回流金蝶,授信、采购与核算从"凭经验"走向"凭模型"。
- 统一数据底座:以金蝶为交易事实源、Databricks 为统一湖仓分析层,核心指标单一口径,支撑机器学习规模化落地。
- 高吞吐低成本:SQL 批量写入替代逐条 API 写入,大体量明细同步性能与成本显著优化,释放 ERP 查询压力。
接口文档
- 金蝶云星空开放 API(Web API):物料、客户、供应商、销售订单、采购订单、应收、应付、库存、总账凭证、信用档案、成本调整
- Databricks SQL Statement Execution API 2.0(
POST /api/2.0/sql/statements,Personal Access Token / OAuth Bearer 鉴权):执行 SQL 查询与 INSERT/MERGE 批量写入 Unity Catalog 表 - 成集云 iPaaS 连接器:金蝶云星空连接器 + Databricks 连接器,支持增量抽取、SQL 批量入湖、结果集回写与双向编排

