Web Scraping Capability
When to Use
Use this capability to extract public structured data from web pages, such as product listings, headings, metadata, FAQ content, pricing tables, schema markup, or competitor landing page elements.
Preferred Implementation
- Use lightweight HTTP clients and HTML parsers for static pages.
- Dynamic Pages: For pages that require JavaScript rendering or interaction, use Chrome DevTools MCP (
chrome-devtools-mcp) tools (such as chrome-devtools/evaluate_script or chrome-devtools/take_snapshot) or Puppeteer/Playwright scripts first.
- Prefer small, respectful, rate-limited, and task-specific extraction.
- Use Computer Use only if a page cannot be accessed with scripts and the user approves UI-based extraction.
Inputs
- URLs.
- Data fields to extract.
- Rate and scope limits.
- Allowed pages.
- Output format.
Outputs
- Extracted data table or JSON.
- Source URL per row.
- Extraction notes.
- Errors or missing fields.
- Data quality warnings.
Security and Ethics
- Scrape only public data or user-authorized data.
- Do not bypass access controls, CAPTCHAs, login gates, or paywalls.
- Do not collect credentials, private customer data, or sensitive personal data.
- Respect site terms and rate limits.
1---2name: web-scraping3description: Web Scraping Capability4---5# Web Scraping Capability67## When to Use89Use this capability to extract public structured data from web pages, such as product listings, headings, metadata, FAQ content, pricing tables, schema markup, or competitor landing page elements.1011## Preferred Implementation1213- Use lightweight HTTP clients and HTML parsers for static pages.14- **Dynamic Pages:** For pages that require JavaScript rendering or interaction, use Chrome DevTools MCP (`chrome-devtools-mcp`) tools (such as `chrome-devtools/evaluate_script` or `chrome-devtools/take_snapshot`) or Puppeteer/Playwright scripts first.15- Prefer small, respectful, rate-limited, and task-specific extraction.16- Use Computer Use only if a page cannot be accessed with scripts and the user approves UI-based extraction.1718## Inputs1920- URLs.21- Data fields to extract.22- Rate and scope limits.23- Allowed pages.24- Output format.2526## Outputs2728- Extracted data table or JSON.29- Source URL per row.30- Extraction notes.31- Errors or missing fields.32- Data quality warnings.3334## Security and Ethics3536- Scrape only public data or user-authorized data.37- Do not bypass access controls, CAPTCHAs, login gates, or paywalls.38- Do not collect credentials, private customer data, or sensitive personal data.39- Respect site terms and rate limits.