尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Agent Lightning 在 Minikube 运行 Calc-X 时因内存不足被杀掉怎么解决?

Agent Lightning 在 Minikube 运行 Calc-X 时因内存不足被杀掉怎么解决? Agent Lightning 在 Minikube 运行 Calc-X 时因内存不足被杀掉怎么解决【免费下载链接】agent-lightningThe absolute trainer to light up AI agents.项目地址: https://gitcode.com/GitHub_Trending/ag/agent-lightning在 Agent Lightning 的 Calc-X 示例里K8s 模式会用 Minikube 搭建一个单节点 Kubernetes 集群Agent 以 Kubernetes Job 的形式在这个集群里执行 rollout。如果你的 Minikube 可用内存不足文档明确警告Minikube needs at least 64 GB of memory; otherwise, it may be killed due to insufficient memory.也就是说这个现象不是训练代码或 Agent 的问题而是 Minikube 虚拟机分到的内存不够。下面的排查和修复路径都来自 Calc-X 示例文档 和 run_minikube.sh。确认 Minikube 启动时是否申请了 64 GB 内存Calc-X 的 K8s 入口脚本 examples/calc_x/run_minikube.sh 中已经内置了足额的启动参数minikube delete -p minikube /dev/null 21 || true minikube start --memory65536 --cpus16 --driverdocker这里有两点需要注意--memory65536单位是 MB即 64 GB正好满足文档要求的最低内存--cpus16和--driverdocker一并保留。脚本执行前会先minikube delete -p minikube这会删除你机器上已存在的同名 Minikube 集群然后重新创建。如果你之前手动启动过一个内存较小的集群例如默认配置直接跑脚本即可被足额的集群替换如果你希望保留现有集群就不要走这条删除重建路径改为手动按同样参数重建minikube delete -p minikube minikube start --memory65536 --cpus16 --driverdocker执行前先确认两件事已安装docker和minikubeK8s 模式的前置要求并且宿主机能够为 Minikube 的 Docker 驱动提供 64 GB 可用内存。如果宿主机本身达不到这个量级参考文末的替代路径。运行训练并验证集群按预期工作在准备就绪后按 Calc-X 文档 的步骤执行安装 Calc-X 依赖项目虚拟环境中执行uv pip install openai httpx sympy autogen-agentchat autogen-ext[openai] mcp1.11.0,2 mcp-server-calculator。将 Calc-X 数据集解压到examples/calc_x/data/确保存在train.parquet、test.parquet、test_mini.parquet、sample.jsonl。启动训练source .venv/bin/activate cd examples/calc_x bash run_minikube.sh脚本的完整动作是启动 ray head 节点、删除并重建 64 GB 的 Minikube 集群、执行minikube image build -t calc-x-agent:dev -f Dockerfile .构建 Agent 镜像、启动agl-server端口 8181和agl-controllerrunner_typek8s通过http://host.minikube.internal:8181访问 Gateway最后运行python train_calc_agent.py。需要注意脚本的副作用它启动时会清理残留的agl-server、agl-controller进程和 ray退出时包括 CtrlC会自动执行清理——minikube stop、pkill -f agl-server、pkill -f agl-controller、ray stop --force。这些命令只影响脚本启动的组件和默认集群但如果你有其他同名的agl-server/agl-controller进程在跑也会被pkill匹配终止运行前留意这一点。验证方式有两处都来自脚本本身脚本启动时会打印agl-server log:和agl-controller log:两个路径位于/tmp/下日志会持续写入这两个文件可用来确认 server 和 controller 没有异常退出。脚本在启动 controller 前会轮询 Gateway 的健康检查curl -sf http://localhost:8181/healthz该命令在 60 次重试内成功返回说明agl-server已就绪训练才会继续推进。若训练进程随内存充足后持续推进、集群不再被 kill即说明问题已解决。替代路径宿主机给不出 64 GB 时用 Local 模式如果你的机器无法为 Minikube 提供 64 GB 内存Calc-X 文档同时提供了不依赖 Kubernetes 的 Local 模式Agent rollout 直接作为本地子进程运行由 controller 的 local runner 管理。source .venv/bin/activate cd examples/calc_x bash run_local.shrun_local.sh 与 Minikube 版本流程基本一致同样启动 ray、agl-server、controller 与train_calc_agent.py区别是 controller 使用runner_typelocal且完全不启动 Minikube。退出时同样会清理它启动的 server、controller 和 ray。这是文档支持的绕开 Minikube 内存限制的路径适用于验证训练流程本身是否正常。边界说明64 GB 的要求只针对 Minikube 集群内存Calc-X 示例本身的硬件需求是 1× A100 80GB模型为Qwen/Qwen2.5-1.5B-Instruct两者分别对应宿主机 GPU 和 Minikube VM不要混为一谈。文档说明 Minikube 只用于演示最小化的 Kubernetes 工作流生产部署应替换为生产级 Kubernetes 集群此时内存规划由生产集群自身决定。【免费下载链接】agent-lightningThe absolute trainer to light up AI agents.项目地址: https://gitcode.com/GitHub_Trending/ag/agent-lightning创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表