尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Miles云沙箱完全指南:4个平台Daytona、E2B、Modal、AgentENV配置一步到位

Miles云沙箱完全指南:4个平台Daytona、E2B、Modal、AgentENV配置一步到位 Miles云沙箱完全指南4个平台Daytona、E2B、Modal、AgentENV配置一步到位【免费下载链接】milesMiles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.项目地址: https://gitcode.com/GitHub_Trending/miles1/milesMiles 是一个面向企业的 LLM/VLM 强化学习后训练框架fork 自 slime 并协同演进在做 Agent 强化学习时每个训练样本episode都需要一个独立的执行环境——Miles 的云沙箱能力让 Harbor、OpenEnv、HUD、NeMo Gym 这 4 类任务连接器把容器交给 Daytona、E2B、Modal、AgentENV 四大沙箱平台按“每 episode 一个沙箱、用完即销毁”的方式运行互不污染、无需常驻基础设施。本文带你 4 步完成云沙箱选型、凭据配置与一键验证。为什么 Agent 强化学习需要云沙箱 传统训练只需要数据加载而 Agent 训练SWE-bench 修代码、Terminal-Bench 跑命令、HUD 玩 2048需要真实执行环境装包、跑测试、看屏幕。Miles 的沙箱模型是每个 episode 从任务官方镜像拉起一个独立沙箱episode 结束即删除。好处很直接——无 Docker socket、无共享服务器不用为常驻基础设施做容量规划和清理各 episode 零状态残留天然隔离跨样本不串扰各家平台自带 TTL 回收调用方挂了沙箱也会自动清理。四大沙箱平台速览先选对再配置沙箱平台接入方式HarborHUDNeMo GymOpenEnvDaytona云端声明式构建按镜像定义哈希缓存✅✅✅✅E2B云端沙箱 命名模板预热✅✅Modal图像分层缓存改一层只重建一层✅✅AgentENV自托管Firecracker microVM原生 E2B API✅✅选型建议一句话版求稳选 Daytona覆盖最全追求秒级启动选 E2B 或自托管 AgentENV重图像构建选 ModalHUD 环境包走 Daytona 云端构建。完整支持矩阵见官方文档docs/user-guide/sandbox-providers.md第 1 步配置凭据所有平台通用规则所有平台的凭据都是两种给法二选一# 方式 A环境变量 export E2B_API_KEYe2b_... # 方式 B密钥文件launcher 只转发文件路径不转发内容 mkdir -p ~/.config/e2b echo e2b_... ~/.config/e2b/api_key⚠️ 多机集群注意密钥文件必须放在 rollout worker 能读到的路径共享文件系统或各节点同路径因为 launcher 只传递文件的路径。第 2 步按平台填写凭据E2B云端最快上手mkdir -p ~/.config/e2b echo e2b_... ~/.config/e2b/api_key # 或 export E2B_API_KEY不设置其他变量时SDK 直连 E2B 官方云自托管 E2B 兼容服务如 AgentENV则需指定两个平面地址export E2B_API_URLhttp://server:8000 # 控制平面 export E2B_SANDBOX_URLhttp://server:8000 # 数据平面Daytona覆盖所有连接器mkdir -p ~/.config/daytona echo dtn_... ~/.config/daytona/api_key # 或 export DAYTONA_API_KEY注意账号有总磁盘配额并发沙箱数 × 单沙箱磁盘要小于配额Harbor 配方可用HARBOR_OVERRIDE_STORAGE_MB调整单沙箱磁盘。Modal令牌对配置uv tool install modal modal token new # 写入 ~/.modal.toml也可用MODAL_TOKEN_IDMODAL_TOKEN_SECRET环境变量只设一半视为未配置MODAL_PROFILE/MODAL_ENVIRONMENT用于切换工作区。AgentENV自托管Kimi K3 团队出品基于 Firecracker microVM快照启动/恢复亚秒级原生 API 就是 E2B API因此 Miles 通过标准e2bSDK 直接驱动、无需定制代码。部署要点Linux 主机带/dev/kvm、内核 6.8官方在 AWSm7i.metal-24xl上验证启动 server 容器时设置AENV_SANDBOX_PROXY_DOMAINS用 sslip.io 免 DNS 配置并同时发布 80 端口——episode I/O 走 WebSocketURL 不带端口号只发 8000 会导致 episode 全部连不上指向 E2B SDKexport E2B_API_URLhttp://server:8000 export E2B_SANDBOX_URLhttp://server:8000 export OPENENV_E2B_URL_SCHEMEhttp # 纯 HTTP 部署才需要 export E2B_API_KEYe2b_000000000000000000000000000000000000000000官方在单台m7i.metal-24xl上持续支撑了64 并发 microVM、55 轮 rollout、约 3400 个 episode的完整 GRPO 训练。详见 examples/experimental/agentenv/README.md。第 3 步一条命令启动训练以 OpenEnv Terminal-Bench-2 GRPO 配方为例选定后端只需一个环境变量export OPENENV_TB2_TASKS_DIR/workspace/terminal-bench-2 OPENENV_SANDBOX_BACKENDdaytona python run-openenv-tbench2.py # 或 e2b / modal / agentenv各后端的行为差异值得知道平台镜像缓存策略特点Daytona按镜像定义哈希的构建缓存首 episode 付构建后续命中缓存无快照配额消耗E2B / AgentENV每任务一个命名模板唯一支持**提前预热pre-bake**的后端python tb2_sandbox_e2b.py --tasks-dir ... --all避免首个 rollout 大部分时间耗在构建镜像上Modal每条命令一个图像层层哈希即缓存键编辑配方只重跑编辑点以下的层注意其沙箱超时不可延长OPENENV_MODAL_SANDBOX_TTL_S必须大于OPENENV_MAX_ROLLOUT_TIME_SECONDS第 4 步无 GPU 一键验证再上卡训练 ✅沙箱配错的代价是“烧着 GPU 得 0 分”所以 Miles 提供了分层验证沙箱冒烟scripts/sandbox_smoke/run.py --connector harbor --backend name跑通“镜像解析→创建→执行→验证→销毁”全链路入口见 scripts/sandbox_smoke/黄金回放OpenEnv 配方的 examples/experimental/openenv/scan_golden.py 用官方答案回放完整沙箱评分链路TB2 全集预期 82/89 通过API 基线examples/experimental/openenv/eval_tbench2_via_api.py 用任意 OpenAI 兼容 API 代替策略跑同一条 agentic 循环得到训练前的解题率基线。常用调节旋钮完整清单见 examples/experimental/openenv/README.mdOPENENV_BACKEND_CREATE_CONCURRENCY默认 4并发创建数按平台承载能力调自托管 AgentENV 单机验证过 16OPENENV_MAX_ROLLOUT_TIME_SECONDS默认 3600单 episode 墙钟上限超时判 0OPENENV_E2B_SANDBOX_TTL_S默认 1800E2B 沙箱存活期keepalive 线程自动续期。关键文件与模块路径速查平台凭据与端点配置docs/user-guide/sandbox-providers.md平台注册表新增沙箱平台只需在此加一条miles/rollout/agentic/credentials.py添加新平台指南docs/developer/adding-a-sandbox-provider.mdOpenEnv 云沙箱训练配方examples/experimental/openenv/AgentENV 自托管部署examples/experimental/agentenv/Harbor 进程内云沙箱模式examples/experimental/harbor/NeMo Gym 沙箱连接器examples/experimental/nemo-gym/HUD每 episode 一个 Daytona 沙箱的 GUI 强化学习examples/experimental/hud/无凭据自动跳过的 CI 沙箱黄金测试tests/e2e/agentic/test_sandbox_golden.py小结 Miles 云沙箱的配置逻辑非常统一选定后端 → 放好凭据环境变量或密钥文件→ 设OPENENV_SANDBOX_BACKEND/HARBOR_ENV_TYPE→ 先跑无 GPU 验证再上训练。Daytona 覆盖最全E2B 与 AgentENV 走同一套 SDK 且支持模板预热Modal 的图像分层缓存让迭代最快。按这四步走任何 Agent 强化学习配方都能在 10 分钟内具备独立的执行环境。【免费下载链接】milesMiles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.项目地址: https://gitcode.com/GitHub_Trending/miles1/miles创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表