crawlbase文档
登录

概述

评价和问答页面承载着网络上信号最强的一些用户生成内容 - 经过验证的产品反馈、来自亲身体验的回答,以及真实客户描述问题时所使用的语言。这些抓取器将这些内容转换为 JSON,你可以将其馈入 LLM、情感模型或产品研究仪表板,而无需手动抓取每个域名。

常见用例:

  • 产品研究:从 g2-product-reviews 中呈现你正进入的某个品类或你正评估的某个竞争对手的真实优缺点。
  • VoC 分析(客户之声):将经过验证的买家评价馈入情感模型,并按评价者角色 / 公司规模进行细分,以发现哪些客户画像喜欢或讨厌某项功能。
  • 内容发现:遍历 quora-question 讨论串,找到买家在描述你的产品所解决的问题时所使用的确切措辞 - 这是着陆页文案和 SEO 的输入。
  • AI 训练:为答案引擎或特定领域的 copilot 构建高质量问答对的检索索引。

G2 和 Quora 抓取器在内部处理分页 - 单次 G2 产品调用返回评分分布和可见的评价批次;对较旧的页面传入 page。Quora 讨论串一次性返回问题 + 所有已加载的回答。Product Hunt 抓取器在一次调用中返回某个排行榜的排名发布,或单个产品的点赞数、创客、主题和评价。

G2

G2 软件产品评价。返回总体评分、评价总数、评分分布,以及已解析的评价,在 G2 显示时包含评价者角色和公司规模。

  • G2 Product Reviews - G2 上的软件产品评价、评分分布、单条评价、优缺点。

Quora

Quora 问题页面 - 问题、所有回答、作者信息和互动计数。

Product Hunt

Product Hunt 发布页面 - 每日和每周排行榜,以及带有点赞数、创客、主题和评价的单个产品页面。

Stack Exchange

Stack Exchange 网络的问答 - 跨 Stack Overflow、Super User、Ask Ubuntu、Server Fault、MathOverflow 以及每个 *.stackexchange.com 站点的问题列表和完整问题讨论串。每种页面类型一个解析器,在整个网络中与主机无关。

  • Stack Exchange Questions - 将问题、标签或搜索结果页面作为结构化数组返回,包含分数、回答数与浏览量、标签和分页。
  • Stack Exchange Thread - 单个问题及其完整正文,外加每个回答和评论,包含分数、采纳状态和作者。

调用示例

下面是一次 g2-product-reviews 调用。响应包含产品级别的汇总数据以及一批已解析的评价 - 标题、评分、评价者角色和公司规模。

curl 'https://api.crawlbase.com/?token=YOUR_TOKEN' \
  --data-urlencode 'url=https://www.g2.com/products/zoom/reviews' \
  --data-urlencode 'scraper=g2-product-reviews' -G

响应示例

{
  "product_name": "Zoom",
  "overall_rating": 4.5,
  "total_reviews": 52840,
  "reviews": [
    {
      "title": "Reliable for daily standups",
      "rating": 4.5,
      "reviewer_role": "Engineering Manager",
      "reviewer_company_size": "51-200 employees"
    }
  ]
}

完整参考(参数、全部 4 种 SDK 语言、边界情况): G2 Product Reviews, 完整参考