crawlbase文档
登录

API 用法

Crawling API 请求中添加 &scraper=kaggle-dataset。在 url 参数中对目标 URL 进行 URL 编码。

curl 'https://api.crawlbase.com/?token=YOUR_TOKEN' \
  --data-urlencode 'url=https://www.kaggle.com/datasets/uciml/iris' \
  --data-urlencode 'scraper=kaggle-dataset' -G
from crawlbase import CrawlingAPI

api = CrawlingAPI({'token': 'YOUR_TOKEN'})
res = api.get(
    'https://www.kaggle.com/datasets/uciml/iris',
    {'scraper': 'kaggle-dataset'}
)

import json
data = json.loads(res['body'])
const { CrawlingAPI } = require('crawlbase');
const api = new CrawlingAPI({ token: 'YOUR_TOKEN' });

const res = await api.get(
  'https://www.kaggle.com/datasets/uciml/iris',
  { scraper: 'kaggle-dataset' }
);
const data = JSON.parse(res.body);
require 'crawlbase'
api = Crawlbase::API.new(token: 'YOUR_TOKEN')

res = api.get('https://www.kaggle.com/datasets/uciml/iris', scraper: 'kaggle-dataset')
data = JSON.parse(res.body)

示例输入 URL

url 参数支持任意 Kaggle 数据集页面 - 即 /datasets/<owner>/<dataset> 的页面。例如:

https://www.kaggle.com/datasets/uciml/iris
https://www.kaggle.com/datasets/johnsmith88/heart-disease-dataset
https://www.kaggle.com/datasets/zynicide/wine-reviews

响应结构

JSON 响应体。当源页面省略对应值时,字段类型可能为 null

url
string
被抓取的数据集页面的 URL。
id
string | null
Kaggle 数据集的数字标识符,以字符串形式返回。
title
string | null
数据集显示标题。
subtitle
string | null
标题下方显示的单行摘要。
description
string | null
所有者撰写的完整数据集描述,以 Markdown 形式返回 - 链接、图片和列表均予以保留,而不会被压平。
version
integer | null
当前数据集版本号。
keywords
array
应用于该数据集的主题标签,以字符串数组形式返回。
owner
object
发布该数据集的账号。
owner.name
string | null
所有者显示名称。
owner.url
string | null
所有者资料页或组织页面的绝对 URL。
owner.image
string | null
所有者头像的 URL。
license
object
该数据集发布所采用的许可证。
license.name
string | null
许可证显示名称(例如 CC0: Public Domain)。
license.url
string | null
许可证文本的规范 URL。
files
array
附加在该数据集上的可下载压缩包。
files[].format
string | null
压缩包格式(例如 zip)。
files[].sizeBytes
integer | null
压缩包大小,单位为字节。
files[].downloadUrl
string | null
绝对下载 URL,固定指向当前数据集版本。
files[].requiresSubscription
boolean
Kaggle 是否要求登录账号才能开始下载。
downloads
integer | null
该数据集的总下载次数。
views
integer | null
页面总浏览次数。
votes
integer | null
点赞数。
commentCount
integer | null
数据集讨论区中的评论数量。
lastUpdated
string | null
最近一次数据集更新的 ISO 8601 时间戳。
discussionUrl
string | null
数据集讨论标签页的绝对 URL。
thumbnail
string | null
数据集卡片图片的 URL。
isAccessibleForFree
boolean
Kaggle 是否将该数据集标记为可免费访问。

示例响应

{
  "url": "https://www.kaggle.com/datasets/uciml/iris",
  "id": "19",
  "title": "Iris Species",
  "subtitle": "Classify iris plants into three species in this classic dataset",
  "description": "The Iris dataset was used in R.A. Fisher's classic 1936 paper, [The Use of Multiple Measurements in Taxonomic Problems](http://rcs.chemometrics.ru/Tutorials/classification/Fisher.pdf), and can also be found on the [UCI Machine Learning Repository][1].\n\nIt includes three iris species with 50 samples each as well as some properties about each flower.",
  "version": 2,
  "keywords": [
    "subject",
    "earth and nature",
    "biology"
  ],
  "owner": {
    "name": "UCI Machine Learning",
    "url": "https://www.kaggle.com/organizations/uciml",
    "image": "https://storage.googleapis.com/kaggle-organizations/7/thumbnail.png"
  },
  "license": {
    "name": "CC0: Public Domain",
    "url": "https://creativecommons.org/publicdomain/zero/1.0/"
  },
  "files": [
    {
      "format": "zip",
      "sizeBytes": 3687,
      "downloadUrl": "https://www.kaggle.com/datasets/uciml/iris/download?datasetVersionNumber=2",
      "requiresSubscription": true
    }
  ],
  "downloads": 907784,
  "views": 3131083,
  "votes": 4861,
  "commentCount": 33,
  "lastUpdated": "2016-09-27T07:38:05.44Z",
  "discussionUrl": "https://www.kaggle.com/uciml/iris/discussion",
  "thumbnail": "https://storage.googleapis.com/kaggle-datasets-images/19/19/default-backgrounds/dataset-card.jpg",
  "isAccessibleForFree": true
}