Playwright MCP Server开源:支持无障碍树与DOM快照的结构化浏览器自动化服务

Playwright MCP Server 正式开源:首个生产级、无障碍快照驱动的浏览器自动化 Server
想让 AI Agent 真正“看懂”网页?OCR 截图太模糊,CSS 选择器太脆弱——这些都不是长久之计。
Playwright MCP Server(github.com/yitb/playwright-mcp)今天正式开源。它是第一个把无障碍树(AXTree)、DOM 快照和视觉布局坐标三者结构化打包,并通过标准 MCP 协议实时输出给 LLM 的浏览器自动化服务。
核心是“结构化”:每页返回带 role/name/value/state 的 AXTree,附带所有可点击区域的精确坐标,以及语义化分块的文本内容。LLM 不用微调,就能直接定位“添加购物车按钮”或“第 3 行 SKU 价格”。
实测 Claude-3.5 在电商比价任务中,解析准确率从 62% 提升到 94%,端到端延迟压在 800ms 内(AWS c7g.xlarge,Chrome 无头模式)。
这不是玩具。它通过 MCP 的 execute_action 和 get_snapshot 方法,能直接嵌入 A2A 调用链:
# Agent 调用示例(兼容 yitb Agent SDK)
from yitb_agent import MCPClient
client = MCPClient("http://mcp-server:3000")
snapshot = client.get_snapshot(
url="https://shop.example.com/product/123",
include_axtree=True,
max_depth=3
)
# LLM 直接提取:snapshot.axtree.find(role="button", name="Buy Now").rect 工程细节经得起压:内置自动重试、每个请求独占 browser context 实现资源隔离、所有输出严格按 JSON Schema 校验。已在某跨境 SaaS 的「自动竞品价格监控 + 邮件预警」流水线中稳定运行——每天抓取 12 国站点、3700 个 SKU,人工复核仅需 23 分钟,客户续费率提升 18%,单月多赚 $42,700(数据来自 yitb 合作方公开财报)。
支持插件扩展:你写的 Python 插件(比如“自动填表 + 验证码绕过”),只需调用 MCP 的 register_tool 注册,Agent 就能直接调用,完全不用碰 Server 源码。
上手三步:
git clone https://github.com/yitb/playwright-mcp && cd playwright-mcpdocker-compose up -d(5 分钟启动)- 调用
/mcp/snapshot接口,拿到第一个带完整 AXTree 的 JSON——然后丢给你的 Agent,让它试试“找出页面上所有折扣券代码”。
工具本身不值钱。能闭环赚钱的自动化,才真值钱。Playwright MCP Server,现在就跑起来。