crawlbase文档
登录

概述

搜索引擎抓取器将 Google 或 Bing 的结果页面转换为结构化 JSON:自然列表、广告、知识面板、相关搜索和"其他人还问" - 所有页面元素,一个解析器,一份账单。浏览器层面的繁琐处理(同意墙、JS 渲染、反机器人、地理路由)都在服务器端完成;你直接获得已解析的结构。

常见用例:

  • 排名跟踪:每天监控一组关键词,将你的域名(以及竞争对手域名)的位置存储在 organic[].url 中,并在位置变动时告警。
  • SERP 功能监控:检测 Google 何时推出"其他人还问"框、知识面板或 AI 概览,从而将自然结果挤到折叠线以下。
  • SEO 研究:抓取 related_searchespeople_also_ask 用于内容缺口分析,无需订阅第三方 SaaS。
  • AI 训练数据集:构建"Google 对查询 X 显示什么"的快照语料库,用于检索增强生成和答案引擎评估。

地理位置和语言是显式的:在请求中传入 country + language,抓取器就会访问正确的 Google 域名(例如 country=DE 对应 google.de),从而使你看到的 SERP 与该市场用户看到的一致。当你需要在深层结果页之间进行粘性会话分页时,可将其与 Smart Proxy 结合使用。

Google

完整的 Google SERP - 自然结果、广告、摘要、相关搜索和"其他人还问"。目录中最常用的抓取器;当你需要发现 → 丰富流程时,可自然地与电商 *-product-details 抓取器搭配。

  • Google SERP - Google 搜索结果页面 - 自然结果、广告、知识面板、相关搜索。

Bing

Bing 搜索结果页面。当你需要为 SEO 研究提供第二个数据源时,或当你的受众偏向企业/Windows(此时 Bing 的份额明显高于其整体市场份额所暗示的水平)时,会很有用。

调用示例

下面是一次 google-serp 调用。当你需要区域版页面时,请在 URL 之外传入 countrylanguage - Google 会同时根据你的 IP 位置和 hl/gl URL 参数来决定其 SERP,因此我们显式设置它们。

curl 'https://api.crawlbase.com/?token=YOUR_TOKEN' \
  --data-urlencode 'url=https://www.google.com/search?q=samsung+social+accounts' \
  --data-urlencode 'scraper=google-serp' \
  --data-urlencode 'country=US' -G

响应示例

{
  "query": "samsung social accounts",
  "results": [
    {
      "title": "Samsung Mobile (@SamsungMobile) / X",
      "url": "https://x.com/SamsungMobile",
      "snippet": "The official Samsung Mobile X account…"
    }
  ],
  "related_searches": ["samsung instagram", "samsung official tiktok"],
  "people_also_ask": [
    {
      "question": "Does Samsung have a TikTok?",
      "answer": "Yes, Samsung is on TikTok at @samsung."
    }
  ]
}

完整参考(参数、全部 4 种 SDK 语言、边界情况): Google SERP - 完整参考