任意 Yandex URL 输入。HTML 或 JSON 输出。
Crawling API,实时输入。获取渲染后的 HTML,或切换到通用提取器以获取 JSON。悬停以暂停并阅读。
一个 API,应对 Yandex 抛来的一切。
Yandex 结果由 JavaScript 渲染,地域限定于俄罗斯和独联体,并由 SmartCaptcha 守护。Crawling API 在真实浏览器中渲染 SERP,通过所在地区的住宅 IP 访问,并向你交付干净的 HTML 或 JSON。
完整 JavaScript 渲染
真实浏览器执行页面,因此动态渲染的结果、标题、摘要和结果 URL 全部被捕获,而不仅仅是初始 HTML。
1.4 亿住宅 IP
每次请求都会在 30 个地区轮换一个住宅 IP,覆盖俄罗斯和独联体,让你像真实的本地访客一样访问 Yandex。
为你处理 SmartCaptcha
Yandex SmartCaptcha、机器人墙和速率限制会被自动清除。无需求解,无需维护。
HTML 或 JSON
获取完全渲染的 HTML,或添加 scraper=generic-extractor 以将标题、内容、图片和链接作为结构化 JSON 返回。
截图与异步
同一次调用可以捕获整页截图,或通过 Webhook 和云存储异步运行。
渲染后的 HTML,或干净的 JSON。
默认情况下你将获得渲染后的 HTML。添加 generic-extractor 后,同一页面将以类型化的 JSON 返回。
页面
title · string canonical · string favicon · string
元数据
meta.description · string meta.keywords · string
内容
content · string
媒体
images · array og_images · array
链接
links · array
从 URL 到数据,一次调用完成。
每个 Yandex 请求都经过相同的路径。你发送一个 URL,中间的一切由我们处理。
发送 URL
使用你的令牌传入任意公开的 Yandex 搜索 URL:一个查询、一个带 lr 参数的地区,可在 yandex.com 或 yandex.ru 上。
轮换代理
一个能干净访问 Yandex 的住宅 IP 和地理位置,覆盖俄罗斯和独联体,取自遍布 30 个地区的 1.4 亿 IP。
渲染页面
真实浏览器加载 SERP,因此 JavaScript 渲染的结果、摘要和结果 URL 会在捕获之前渲染完成。
清除反机器人
Yandex SmartCaptcha 和速率限制会被自动处理。无需求解,无需维护。
返回 HTML 或 JSON
返回完全渲染的 HTML,或在你添加通用提取器时返回类型化的 JSON。
团队用 Yandex 数据构建什么。
排名追踪
追踪关键词在 Yandex 上跨查询和地区的位置,以监控在俄罗斯和独联体市场的可见度。
SERP 监控
关注结果页面的排名变化、新竞争者以及随时变动的 SERP 特性。
SEO 研究
拉取标题、摘要和结果 URL,以研究俄罗斯和独联体市场的意图与竞争格局。
链接与线索发现
从搜索页面挖掘结果 URL 和域名,以构建链接、潜在客户和线索列表。
训练数据与 RAG
通过一个 API 将干净的 Yandex SERP 文本喂入模型、RAG 管道和智能体。
任意 URL,一个 API
抓取 Yandex 查询和地区,以及你需要的任何其他网站。
抓取 Yandex 时值得了解的事。
像真实浏览器一样渲染
Yandex 结果由 JavaScript 渲染;Crawling API 运行真实浏览器,因此自然结果、标题、摘要和结果 URL 会在捕获之前加载完成。
默认 HTML,按需 JSON
你将获得完全渲染的 HTML。添加 scraper=generic-extractor 即可解析标题、内容、图片和链接,或者你也可以自行从 HTML 中解析结果标题、摘要和 URL。
针对俄罗斯和独联体的地理定位
Yandex 结果受地域限定,因此设置国家和 lr 地区参数即可返回来自俄罗斯和独联体的本地 SERP,通过匹配地区的住宅 IP 送达。
自动清除 SmartCaptcha
Yandex SmartCaptcha 和访问量速率限制会为你处理,因此稳定的 SERP 采集无需人工求解即可持续运行。
为大规模抓取 Yandex 而生。
Crawling API 运行在服务于 46,000+ 付费客户和 70,000+ 开发者的同一网络上。无需购买代理,无需运行浏览器,Yandex 变动时也无需修补任何东西。
一个令牌,面向 Python、Node 和 Ruby 的官方 SDK,底层是 99.99% 正常运行时间的网络。