
用本地 Chrome + DeepSeek 实现浏览器自动化:browser-use 实战与踩坑记录最近在研究 AI 驱动的浏览器自动化,发现了一个很有意思的项目叫browser-use,它能让 LLM 直接控制浏览器完成各种操作,比如点击、输入、滚动等。官方示例大多用的是 OpenAI 或 Anthropic 的模型,但我手头有 DeepSeek 的 API key,而且不想每次启动都开一个新的浏览器实例(用自己日常的 Chrome 多方便),于是决定折腾一下。这篇文章记录了我从零开始配置、踩坑到最终跑通的全过程,希望能帮到有类似需求的朋友。1. 环境准备首先,我之前做playwright的项目的时候,安装过一个能通过 CDP(Chrome DevTools Protocol)连接的 Chrome 浏览器。启动时需要带上调试端口:Windows 用户类似:"C:\Program Files\Google\Chrome Dev\Application\chrome.exe" --remote-debugging-port=9222启动后,Chrome 会打开一个空白页,同时监听 9222 端口。注意不要关闭这个窗口,我们的 Python 脚本会通过这个端口连接到当前浏览器。接着安装必要的 Python 包:browser_use2. 初次尝试:导入问题根据官方文档,我一开始这样写:frombrowser_useimportAgent,Browser,ChatOpenAIfromdotenvimportload_dotenvimportos load_dotenv()llm=ChatOpenAI(model='deepseek-chat',api_key=os.getenv('DEEPSEEK_API_KEY'),base_url='https://api.deepseek.com/v1')browser=Browser(cdp_url="http://localhost:9222")agent=Agent