这两年想给 Web 自动化挑个工具,比以前要难了。
以前好办,无非在几个老框架里挑,挑来挑去最后无非也就 Playwright 和 Selenium 两派。现在打开任何一份工具清单,一半以上是带 AI 特性的新面孔,腾讯、微软、亚马逊都在往里挤,开源的工具,star 涨得一个比一个快,比如,腾讯 6 月放出来的 BrowserSkill,三个月就冲到七千多 star 了。

变化最大的点是 Coding Agent 出来之后,工具的用法跟着变了。以前的框架是给人写脚本用的,每一步点击、每一次输入都要自己写成代码,选择器一写死,页面改个版脚本就挂。现在的工具反过来了,一句自然语言说出要干什么,模型自己看页面、自己找按钮,文案改了也认得。浏览器自动化这件事,从写代码变成了下指令。
今天给大家分享 20 款 Web 浏览器自动化工具,几乎涵盖了目前市面上最主流常用的浏览器自动化工具合集了,为了方便区分,按用法大体分为四类。
工具排名不分先后,想到哪,写到哪
先从六个传统框架说起。后面三类工具中,一半以上都是基于传统框架演变的,browser-use 和 Nova Act 包着 Playwright,Notte 的 patchright 是 Playwright 的分支,Stagehand 建在 Playwright 上。名字大家都熟,接下来挑重点说。
整个工具清单里被依赖最多的一个。微软出品,截止目前已经有 96,651 个 star,三大浏览器引擎全支持。
自动等待、失败回放、脚本录制这些测试刚需都内置了,写起来快,挂了好排查。新项目不知道选什么,选它基本不会错。

官网地址 https://playwright.dev
开源地址 https://github.com/microsoft/playwright
值得补充下,Playwright 发展到今天已经不是单一框架,是一套工具集,官方按用途分了五块。

写测试选 Test,写脚本选 Library,给 agent 配手就用 MCP 或 CLI,后面第 09、10 节会把这两个单独展开。
W3C WebDriver 标准就是从它这套体系来的。语言支持最全,Java、Python、C#、Ruby 都是一等公民。
强项是兼容和存量。配合 Grid 能把用例分发到几十台机器、几十种浏览器版本上并行跑,浏览器兼容测试是它的主场。会它的人也最多,教程、问答、现成方案堆成山,团队换人接手成本最低,老项目和多语言团队到现在都离不开它。

官网地址 https://selenium.dev
开源地址 https://github.com/SeleniumHQ/selenium
Chrome DevTools 团队官方出品,95,618 个 star,最早把 CDP 底层协议用起来的就是它。
强项在轻和快。一个浏览器实例能开几十上百个页面,内存占用小,一台机器并发跑上千个页面不难,无头模式跑起来跟普通进程一样,塞进服务器定时任务很自然。DevTools 里能干的事它基本都能干,性能采集、请求拦截都是现成 API。爬虫、网页截图、生成 PDF 这些活用它最多,但在测试圈反而出镜率一般。

官网地址 https://pptr.dev
开源地址 https://github.com/puppeteer/puppeteer
测试代码直接跑在浏览器里,报错时每个时间点的页面快照都能回放,排错像放录像,前端工程师写它最顺手。
开发体验是它最下功夫的地方。代码一保存测试自动重跑,写用例像写热更新的脚本。接口可以随意 stub,填一个假响应就绕开后端,还没渲染出来的状态也能提前断言。要说短板,跨域访问和多标签页是它的软肋。

官网地址 https://cypress.io
开源地址 https://github.com/cypress-io/cypress
一套框架管三端,Web、手机 App、桌面应用全覆盖,端多的团队用它省掉几套技术栈。
组织能力强。用例能按设备、按浏览器分组,一次配置几十种环境批量跑,失败截图、测试报告、接进持续集成的路子都是现成的,插件装上就用,人少端多的团队维护成本压得最低。

官网地址 https://webdriver.io
开源地址 https://github.com/webdriverio/webdriverio
不用装任何浏览器驱动,任意浏览器、远程机器、手机真机都能直接跑,环境配置全省。内置自动等待,由 DevExpress 维护。
免驱动还有一层好处。同一个用例,本地 Chrome、远程 Linux、手机真机跑的都是同一份脚本,环境之间不用各配一遍。一条命令还能同时开几个浏览器并发跑同一批用例,跨浏览器回归一次完成,怕折腾环境的人会喜欢它。

官网地址 https://testcafe.io
开源地址 https://github.com/DevExpress/testcafe
接下来,给大家推荐几款可以直接装在 Claude Code、Codex、Cursor 这类 Coding Agent 身上,让 Agent 直接替你操作浏览器。接法分两种,CLI 是命令行调用,MCP 是挂进客户端的服务,一个省 token,一个上手快。
今年 6 月份才开源,三个月冲到了 7,168 个 star,腾讯出品,MIT 协议。
它解决的就是登录这道坎。Agent 不用再开一个干净的无头浏览器去硬闯扫码和滑块,而是直接借用你日常在用的 Chrome,登录态、cookie 全都现成,人登录过的系统它抬手就进。
思路是把最难的部分交还给人。验证码、扫码、风控这些 agent 搞不定的环节,你自己登录一遍,剩下的交给它。公众号后台、企业内网这些没有开放 API 的地方特别合适,要 agent 替你操作这类要登录的系统,选它最省事。

开源地址 https://github.com/Tencent/BrowserSkill
专攻反爬封锁这一段。CLI 是商业产品,配套 Skill 仓库开源,2026 年 2 月建仓,七个月 6,007 个 star。
突破验证码和风控只是基础,细节做得比较全。任务卡住可以暂停转人工,人处理完接着跑,长任务不用人盯着。多任务并行、多账号会话隔离,采集和批量操作的重活扛得住,还提供 n8n 工作流组件,能接进现有的自动化流程。要常跑外站采集、总被风控纠缠的团队重点看它,之前写过它的安装实战,这里不展开。

官网地址 https://browseract.com
开源地址 https://github.com/browser-act/skills
Cursor、Claude 这类客户端接浏览器的默认选择,微软官方出品,一年半涨到 37,554 个 star。
页面信息用无障碍树喂给模型,比截图省也稳,元素有角色有名字,点哪个填哪个说得清,误操作比看图少。装好就能用一句自然语言指挥浏览器,配置方法官方文档写好了几步,跟着做就行。探索页面、调试流程、批量改数据这类活最合适。

开源地址 https://github.com/microsoft/playwright-mcp
官方定位说得很清楚,MCP 要往上下文里塞工具清单和无障碍树,太烧 token 了,而 CLI 模式直接走命令行调用,同样的活花得更少。常用操作都做成了短命令,开页面、点按钮、填表单、读内容,agent 一步一步调,每步只带回需要的结果,重度 agent 用户和长任务最适合。

开源地址 https://github.com/microsoft/playwright-cli
这里把 CLI 和 MCP 怎么选也额外补充一下。
两个都是属于 Playwright 工具体系下的,接法不同。
MCP 是挂进客户端的常驻服务,工具清单和页面快照塞在上下文里,每一步都能在客户端里可视化确认,适合在 Cursor、Claude 这类对话式客户端里做页面探索、调试和临时操作。
CLI 是按次调用的命令行,agent 敲一条命令拿一段结果,适合写进 Claude Code、Codex 这类终端 agent 的日常工作流,任务越长、批量越大,token 的差距越明显。
随手用、要人机来回确认,选 MCP,长任务、固定流程、token 预算紧,选 CLI。
门槛最低的一个,Chrome 装个扩展就能用,操作的就是你日常那个浏览器,书签、登录态全在。但需要说明一下,从 2025 年 4 月后项目没再更新了。
从安装到能用不超过十分钟,扩展装好、客户端一连就能开干。深度能力别指望,但想先体验一下 agent 开浏览器,再决定要不要上重型方案,它是最合适的起点。

官网地址 https://browsermcp.io
开源地址 https://github.com/BrowserMCP/mcp
接下来,给大家分享几个自动化框架,通过写代码调用,把 AI 的自然语言和视觉能力嵌进自动化工程里,TypeScript、Python 都有,适合要长期维护这套东西的团队。
把 agent 能力做成 act、extract、observe 几个原语嵌进 TypeScript 代码,写代码的人保留主控权。底层使用 Playwright,MIT 协议。
亮点是容错和工程的结合。
你写点击登录,按钮文案从「登录」改成「立即登录」,它照样点得中,extract 抽数据也是一句话说清要什么字段,页面结构变了不用重写选择器。代码本身是普通 TypeScript,版本管理、代码审查、持续集成这些配套照常用,AI 的灵活和工程的稳定可以一起要。

官网地址 https://stagehand.dev
开源地址 https://github.com/browserbase/stagehand
这批工具里 star 最高的一个,11.6 万,2024 年 10 月由 Gregor Müller 和 Magnus Žunič 两个人发起。
Python 库,几行代码起一个自然语言 agent,你下指令,它自己拆成点击和输入。模型不挑,OpenAI、Claude、开源模型都能接,自带视觉能力,看得懂页面截图。生态也热闹,命令行工具、云服务、和 LangChain 这类编排框架的集成都有现成的,踩了坑基本都能搜到答案,做 agent 原型第一个试它。

官网地址 https://browser-use.com
开源地址 https://github.com/browser-use/browser-use
别的工具读 DOM,它直接看截图交给视觉模型,页面再乱、内容画在 canvas 里也不影响,不依赖选择器,特别适合没人维护的内部老系统,定位偏 RPA。
每一步操作和截图它都记下来,任务跑完能完整回放,卡在哪一步一眼看到,人工审核有据可查。任务还能编排成工作流,登录、填表、下载串成一条链,表单搬运、批量文档操作这类重复劳动很合适。注意 AGPL 协议,商用要掂量。

官网地址 https://skyvern.com
开源地址 https://github.com/Skyvern-AI/skyvern
字节 Web Infra 团队出品,中文文档齐全,国内团队上手成本最低。
特色是按测试思路设计,YAML 写用例、自然语言写断言,跑完有可视化报告,AI 每一步点了哪里、为什么这么判断都能回放。除了写代码,它还提供浏览器扩展,装上就能在页面上直接下指令体验,不用先搭工程。一套 API 覆盖 Web、移动和桌面三端,测试团队最顺手的一个。

官网地址 https://midscenejs.com
开源地址 https://github.com/web-infra-dev/midscene
亚马逊官方 SDK,Python 写的,底下包着 Playwright,深度绑定 AWS 生态,官方示例直接演示 agent 调 IAM 管 S3,账号、权限、存储这些周边对 AWS 团队全是现成的。
它主打可靠,官方说法是模型会对每步动作自评再执行,长链条任务不容易跑偏。

官网地址 https://nova.amazon.com/act
开源地址 https://github.com/aws/nova-act
在浏览器和模型之间加了一层感知层,把整页 DOM 压成摘要再喂给模型,同样的任务 token 开销小一截。
会话跑在云端,起一个浏览器几秒就绪,配了隐身和验证码处理,登录类站点也能对付,底层用的是 Playwright 的隐身分支。长任务跑下来,token 账单和响应速度两头都占便宜,适合已经跑通流程、被成本烫到的团队。

官网地址 https://notte.cc
开源地址 https://github.com/nottelabs/notte
Agent 跑浏览器有三个新需求,并发要大,IP 要干净,验证码要能过。自己机房养浏览器集群是最重的一种活,于是有了这一类,把浏览器做成云服务,API 一调就拿到一个现成会话,用完即毁。但这一类大多是商业产品,大家了解一下即可。
Stagehand 的母公司,SDK 开源圈开发者,浏览器云收费。官网写着支持一万以上并发会话,API 起一个会话只要几行代码。
会话相互隔离,每个 agent 一个干净环境,自带代理和隐身处理,封 IP 的风险低,还能录像回放,出问题不用猜。几百个 agent 并发跑采集或操作任务的团队,就是给它准备的。

官网地址 https://www.browserbase.com
整套开源,Apache-2.0 协议,既能用官方云,也能整套部署到自己机器上,数据不出门。
官方定位是给 Agent 和 App 的浏览器沙箱,会话即起即用,断线能重连,日志和截图齐全,排错省事。自托管一套 Docker 就能跑在自己服务器上,合规要求高、数据不能出公司的团队,这一层里最值得看它。

官网地址 https://steel.dev
开源地址 https://github.com/steel-dev/steel-browser
官网一句话就给出了定位,Browser Infra for AI Agents。
API 随取随用的云端浏览器,Puppeteer、Playwright 脚本直接接上去就能跑,验证码处理和隐身会话都提前配好,不用自己碰基础设施。
简单需求还有现成的抓取接口和 MCP 端点,一个请求进去页面数据直接返回,接进 Claude 这类客户端也顺。商业服务,想把 agent 任务快速跑起来的团队从它上手很快。

官网地址 https://hyperbrowser.ai
传统那一类最好办。新项目直接 Playwright,存量项目接着用 Selenium,爬虫、截图这类轻活交给 Puppeteer。
给 coding agent 配手,先试微软官方那两款。在 Cursor、Claude 里临时指挥浏览器,Playwright MCP 装上就能跑;任务长、token 预算紧、要写进固定工作流的,换 Playwright CLI。
官方两款之外按短板补,要登录态、进内网,用 BrowserSkill 接管日常在用的 Chrome;常跑外站采集、总被风控拦的,选 BrowserAct。
要写代码把 AI 嵌进工程的,先分清自己做的是哪件事。做 agent 原型、验证想法,优先用 browser-use,生态最大,踩了坑基本都能搜到答案。
测试团队想把 AI 引进回归,用 Midscene 阻力最小,YAML 用例、中文文档、可视化报告都是现成的,主力回归照样用 Playwright 或 Cypress 上,AI 层先做辅助断言。
最后说句泼冷水的。
新工具如果还在 0.x 版本,star 数代表近期热度高,但并代表稳定性。拿它们短期提效试试水可以,但真想拿它们扛核心回归,最好先小范围跑三个月再定。
工具不在多,在于适配自己,能解决自己的问题才是好工具,新东西冒出来,先想清楚它是给谁用的,往哪一类放,用起来心里才有数。