
browser-use 并不完全依赖 LLM 的视觉能力它采用了混合策略# browser-use 内部工作流程1.Playwright 获取页面 DOM 结构HTML/CSS/JavaScript2.将 DOM 转换为结构化文本描述3.发送给 LLM 进行分析和决策4.LLM 返回操作指令点击、输入等5.Playwright 执行操作2️⃣两种模型的工作方式qwen-vl-max视觉语言模型✅优势可以同时看到页面截图 DOM 结构适用场景复杂布局、动态元素、需要视觉判断的任务例如识别验证码、理解图片内容、判断按钮位置qwen-plus纯文本模型✅优势处理结构化文本信息能力强适用场景基于 DOM 结构的导航和文本提取例如查找特定文本、点击已知链接、提取表单数据3️⃣为什么你的任务两者都能成功看到了你的任务指令非常详细和结构化这正是关键所在✅成功的关键因素1.详细的步骤指引task **任务步骤** 1. 导航到页面 2. 定位支店入驻管理规范明确的文本匹配 3. 点击链接明确的操作 4. 提取特定字段明确的文本搜索 这种基于文本的任务描述非常适合纯文本模型因为✅ DOM 中包含了所有必要的文本信息✅ 操作步骤清晰明确✅ 不需要视觉判断如点击红色按钮2.结构化输出定义classAlipayRuleTime(BaseModel):支店入驻管理规范下面的时间:str本规则首次发布时间:str本规则首次生效时间:strPydantic 模型强制 LLM 输出标准格式减少了错误。3.使用 extract 工具extract:query:Find本规则首次发布时间and本规则首次生效时间[extract](file://e:\browser-use\browser-use\browser_use\skill_cli\python_session.py#L275-L278) 工具直接搜索页面文本内容不依赖视觉分析。两种模型的对比测试让我创建一个对比测试来展示差异总结回答你的问题为什么两者都能得到正确结果任务特性适合纯文本模型你的任务是基于文本的查找和提取不需要视觉判断如识别图片、验证码DOM 中包含了所有必要的信息详细的任务指令弥补了视觉能力的不足明确告诉 Agent 要找什么文本清晰的步骤减少了歧义使用 [extract](file://e:\browser-use\browser-use\browser_use\skill_cli\python_session.py#L275-L278) 工具直接搜索文本结构化输出保证格式正确Pydantic 模型约束了输出格式即使 LLM 理解有偏差最终输出也是标准的实际区别在哪里维度qwen-vl-maxqwen-plus成功率⭐⭐⭐⭐⭐ (95%)⭐⭐⭐⭐ (80-90%)速度较慢需处理图像较快仅文本成本较高较低稳定性更稳定可能偶尔失败适用场景所有场景简单文本任务建议✅继续使用 qwen-plus 的情况任务主要是文本提取预算有限可以接受偶尔重试⚠️必须使用 qwen-vl-max 的情况生产环境关键任务需要处理复杂 UI涉及验证码或图片要求高可靠性你的这个任务恰好处于纯文本模型也能胜任的范围内所以两者都能成功