Playwright MCP Server上线:基于DOM快照的稳定AI浏览器自动化方案
摘要:想用AI自动填表、抓数据、跑审批流?别再调OCR模型、修截图坐标、等VLM返回不可靠的文本了。 Playwright MCP Server 正式上线 yitb.com —— 这是首个通过真实业务验证的 MCP 协议浏览器自动化实现。它不截图、不调视觉大模型,直接从 Playwright 渲染引擎提取带语义的 DOM 快照(含 `role`、`label`、`name`、`value`、`a...

想用AI自动填表、抓数据、跑审批流?别再调OCR模型、修截图坐标、等VLM返回不可靠的文本了。
Playwright MCP Server 正式上线 yitb.com —— 这是首个通过真实业务验证的 MCP 协议浏览器自动化实现。它不截图、不调视觉大模型,直接从 Playwright 渲染引擎提取带语义的 DOM 快照(含 `role`、`label`、`name`、`value`、`aria-*` 等无障碍属性),输出结构清晰的 JSON。LLM 拿到的就是可读、可定位、可操作的网页“源代码级”视图。
为什么关键?
- **稳定**:DOM 快照无像素漂移,同一页面每次返回结构一致;
- **可审计**:所有操作日志 + 快照存档,合规场景(如金融填报、政务提交)能回溯每一步;
- **协议原生**:完全兼容 MCP v0.4 和 A2A 标准,Agent 只需发 `execute_action` 请求,无需封装 Selenium 或 Puppeteer 适配层。
我们已在客户侧跑通两个赚钱闭环:
✅ 某跨境电商代运营团队用它做「多平台价格监控」:每天自动登录 Shopee/Lazada/Amazon 后台,提取 SKU 库存、售价、促销状态,对比后触发飞书告警 + 自动调价脚本。部署后人力节省 12 小时/天,月均多赚 ¥37,200(基于 237 个 SKU × 平均毛利 ¥157)。
✅ 某律所 AI 助理用它做「法院文书自动填报」:识别立案页表单字段 → 填入当事人信息 → 上传 PDF → 提交成功截图校验。错误率从人工 8.3% 降至 0.6%,单案处理时间从 22 分钟压到 92 秒,已接入 17 家合作律所,按件收费 ¥120/次,月流水超 ¥21 万。
技术上怎么用?
只需三步:
1. `docker run -p 3000:3000 yitb/playwright-mcp:latest`
2. 在你的 Agent 中调用 MCP `list_tools`,发现 `navigate_to`、`fill_form`、`click_element` 等原生工具;
3. 写一段 Python 调用(示例): import requests
r = requests.post("http://localhost:3000/mcp/v1/execute_action", json={
"tool": "navigate_to",
"arguments": {"url": "https://example.com/login"}
})
snapshot = r.json()"result" # 直接拿到 DOM JSON
LLM 可直接 parse snapshot["nodes"] 找到邮箱输入框 id
这不是玩具 demo。它已在 4 家 SaaS 公司生产环境跑满 92 天,平均 uptime 99.98%,单节点支撑 147 个并发 Agent 流程。
MCP/A2A 协议落地卡点在哪?不是协议看不懂,是缺真正能扛住真实网页复杂性的执行端。Playwright MCP Server 就是那个“最后一公里”——让协议从 RFC 文档变成可卖钱的自动化流水线。
现在就去 yitb.com → 「工具集成实战」栏目,
👉 下载一键部署脚本
👉 获取预置的表单自动填报 Agent 模板(含 Claude-3.5 + MCP 工具调用链)
👉 用你自己的登录页测一遍:5 分钟内跑通第一个结构化 DOM 抓取。