
DolphinScheduler 5 分钟部署指南用可视化工作流跑通每日数据同步【免费下载链接】dolphinschedulerApache DolphinScheduler is the modern data orchestration platform. Agile to create high performance workflow with low-code项目地址: https://gitcode.com/GitHub_Trending/dol/dolphinscheduler半夜跑批的同步脚本挂在 crontab 上失败没人知道第二天早上看报表才发现数据缺了一整天。DolphinScheduler 是一个开源的 DAG 工作流调度系统能把这类脚本组织成可视化工作流定时触发、按依赖顺序执行、失败自动重试并告警把盯人的活变成看面板。 先跑起来5 分钟 Docker 部署环境要求只有一条装好 Docker 1.13.1 以上版本。体验版用官方 standalone 镜像一条命令拉起全部组件docker run --name ds-standalone -p 12345:12345 -p 25333:25333 -d \ apache/dolphinscheduler-standalone-server:3.3.0浏览器打开 http://localhost:12345/dolphinscheduler/ui默认账号密码是admin/dolphinscheduler123。登录后第一屏是工作流概览页当前项目下最新的实例列表、任务实例状态统计一眼能看出今天哪些流程跑完了、哪些卡住了。注意standalone 镜像用内存数据库 H2 存元数据容器一停数据就没了只适合快速体验。想长期跑用仓库里的 docker-compose 方式进入 deploy/docker/ 目录依次执行docker-compose --profile schema up -d初始化库表和docker-compose --profile all up -d启动 api、master、worker、alert 四个服务加 PostgreSQL、ZooKeeper各服务独立成容器重启后元数据保留建议给 Docker 留 4GB 以上内存。 能力拆解脚本多了记不住谁依赖谁怎么办解决拖拽式 DAG 画布。在画布工具栏拖出任务节点用箭头连出依赖关系谁先跑谁后跑在图上直接可见。怎么用工作流定义页面里创建任务、连依赖、保存全程不需要写代码改依赖就是改一条箭头。结果一条数据链路上十个脚本跑完一轮的顺序和耗时在画布上一清二楚新人接手不用翻代码找入口。业务库到数仓的同步要接好几套工具解决内置任务插件覆盖抽取、转换、加载三段。抽取有 DataX、Sqoop转换有 Spark、Flink、Shell加载有 Hive CLI 和 SQL 任务背后接 MySQL、PostgreSQL、Hive、Trino 等 20 多种数据源。怎么用以 DataX 任务为例在任务配置里选一个已建好的数据源把同步 JSON 配置贴在任务参数里这个节点就和 Shell 节点一样参与编排。结果一条 ETL 链路的全部环节都挂进同一个工作流统一触发、统一看日志不用在多个平台的界面之间来回切。任务挂了第二天才知道解决监控页 告警组件。监控页实时展示 master、worker 节点和数据库的状态、服务器资源负载不用登录机器做健康检查。怎么用在告警中心配置邮件等接收人给关键任务实例绑定告警规则状态失败即触发。结果任务失败后告警邮件直接进收件箱处理时间从隔夜缩到分钟级。️ 一个完整流程每天凌晨自动跑一次数据同步目标Shell 脚本完成同步HTTP 任务发完成通知每天 02:00 自动执行。建租户安全中心 → 租户管理新建一个租户。它是任务真正执行时使用的 Linux 用户绕不开的概念。分配租户安全中心 → 用户管理把租户分配给 admin分配后才能跑任务。建项目项目管理页创建项目按业务域隔离工作流比如建一个叫dw-sync的。画工作流进入dw-sync的工作流定义页拖一个 Shell 任务填同步脚本路径再拖一个 HTTP 任务填通知接口地址用箭头把前者连到后者——先同步、后通知。上线并试运行保存后点上线再点运行触发一次去工作流实例页确认状态从执行中变成成功。配定时调度在工作流调度里填 cron0 0 2 * * ?第二天凌晨两点它自己跑。每一步的具体界面操作可以参考官方快速上手教程docs/docs/zh/guide/start/quick-start.md。⚠️ 避坑与提效技巧任务报 ClassNotFoundException3.3.0 起二进制包不再内置插件依赖先执行bash bin/install-plugins.sh 3.3.0补齐不需要全部插件的话在conf/plugins_config里只列出你要的启动更快。脚本在机器上能跑进工作流就没权限任务是以租户对应的 Linux 用户身份执行的提前给该用户授好目录和文件权限别拿启动用户的权限去测。全量同步越来越慢利用内置参数如${system.biz.date}做增量只取上次成功日期之后的数据同步时间和存储一起降下来。一个大任务 30 分钟才挂不知道断在哪拆成抽取—转换—加载多个小任务给每个任务单独设失败重试次数断点定位到具体环节。Docker 里服务频繁 OOM给容器分配不少于 4GB 内存compose 部署时观察监控页的负载再调。DolphinScheduler 适合每天有成百上千个定时脚本、多数据源同步需求的数据和运维团队它只负责编排和调度不做计算本身standalone 镜像仅限体验生产环境建议 compose 或 K8s 部署。延伸阅读Docker 部署文档docs/docs/zh/guide/start/docker.md数据源配置指南docs/docs/zh/guide/datasource/【免费下载链接】dolphinschedulerApache DolphinScheduler is the modern data orchestration platform. Agile to create high performance workflow with low-code项目地址: https://gitcode.com/GitHub_Trending/dol/dolphinscheduler创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考