
近5年几乎大部分时间都在做数据研发平台支持数仓、贴源、应用等系统使用。总结以下这几年的经验设计思路数据研发设计平台是服务数据条线的平台将研发环节的需求拆解、模型设计、脚本开发、调度运行、血缘依赖等等主要环节进行统一的平台集成与管理更好的支持环节中各角色的工作简要流程从需求接入开始结合数据资产中的数据字典数据建模的过程中去完善加工口径设计人员转译需求为可落地的物理模型由开发人员进行脚本编写开发验证脚本出数正确后投产上线下面结合自己亲身做的功能分析一下设计各模块功能关键点Ⅰ 模型设计方案采用的是基于粒度建模搭建的整合模型实现方式可视化建模、一般建模涉及资产对象数据标准字典至少要融入进来主体必要功能企业级的话最好能共建共享个人空间正式空间审批流变更记录版本管理管理变更影响通知导入在线可视化建模感官强点但是to B 的能把导入做的编辑才是最主要的DDL能根据不同的数据库类型生产DDL产出口径描述模型除了结构外更要在此说明好加工口径自动化自动化建模、自动化检核、自动化审批Ⅱ ETL设计方案管理各系统的脚本生成实现方式在线可视化编写脚本、文档生成脚本涉及资产对象非强制绑定模型主体必要功能数据隔离不像模型需要互相引用脚本更多属于内部编写SQL做好版本系统数据隔离文档与脚本能实现一套结构化文档与脚本能互相正反向转换在线编辑如果没有思考好怎么实现navicat的多窗口调试AI嵌入就简单做个基础版数据库报错返回DDL能根据不同的数据库类型生产DDL产出血缘血缘要做好需要大量脚本验证最好是结合图数据库关系型量一上来撑不住前端可视化界面要做要实现字段级溯源最后最好做成问答界面去实现血缘结果返回调度脚本编写完成后能结合一键自动调度实际测试结果如果环境隔离要能够直接出调度文件Ⅲ界面样例