Kaggle Dataset
将单个 Kaggle 数据集页面解析为结构化 JSON,包含其描述、所有者、许可证、文件列表、关键词以及互动数据。
API 用法
在 Crawling API 请求中添加 &scraper=kaggle-dataset。在 url 参数中对目标 URL 进行 URL 编码。
curl 'https://api.crawlbase.com/?token=YOUR_TOKEN' \
--data-urlencode 'url=https://www.kaggle.com/datasets/uciml/iris' \
--data-urlencode 'scraper=kaggle-dataset' -Gfrom crawlbase import CrawlingAPI
api = CrawlingAPI({'token': 'YOUR_TOKEN'})
res = api.get(
'https://www.kaggle.com/datasets/uciml/iris',
{'scraper': 'kaggle-dataset'}
)
import json
data = json.loads(res['body'])const { CrawlingAPI } = require('crawlbase');
const api = new CrawlingAPI({ token: 'YOUR_TOKEN' });
const res = await api.get(
'https://www.kaggle.com/datasets/uciml/iris',
{ scraper: 'kaggle-dataset' }
);
const data = JSON.parse(res.body);require 'crawlbase'
api = Crawlbase::API.new(token: 'YOUR_TOKEN')
res = api.get('https://www.kaggle.com/datasets/uciml/iris', scraper: 'kaggle-dataset')
data = JSON.parse(res.body)示例输入 URL
url 参数支持任意 Kaggle 数据集页面 - 即 /datasets/<owner>/<dataset> 的页面。例如:
https://www.kaggle.com/datasets/uciml/iris
https://www.kaggle.com/datasets/johnsmith88/heart-disease-dataset
https://www.kaggle.com/datasets/zynicide/wine-reviews响应结构
JSON 响应体。当源页面省略对应值时,字段类型可能为 null。
被抓取的数据集页面的 URL。
Kaggle 数据集的数字标识符,以字符串形式返回。
数据集显示标题。
标题下方显示的单行摘要。
所有者撰写的完整数据集描述,以 Markdown 形式返回 - 链接、图片和列表均予以保留,而不会被压平。
当前数据集版本号。
应用于该数据集的主题标签,以字符串数组形式返回。
发布该数据集的账号。
所有者显示名称。
所有者资料页或组织页面的绝对 URL。
所有者头像的 URL。
该数据集发布所采用的许可证。
许可证显示名称(例如
CC0: Public Domain)。许可证文本的规范 URL。
附加在该数据集上的可下载压缩包。
压缩包格式(例如
zip)。压缩包大小,单位为字节。
绝对下载 URL,固定指向当前数据集版本。
Kaggle 是否要求登录账号才能开始下载。
该数据集的总下载次数。
页面总浏览次数。
点赞数。
数据集讨论区中的评论数量。
最近一次数据集更新的 ISO 8601 时间戳。
数据集讨论标签页的绝对 URL。
数据集卡片图片的 URL。
Kaggle 是否将该数据集标记为可免费访问。
示例响应
{
"url": "https://www.kaggle.com/datasets/uciml/iris",
"id": "19",
"title": "Iris Species",
"subtitle": "Classify iris plants into three species in this classic dataset",
"description": "The Iris dataset was used in R.A. Fisher's classic 1936 paper, [The Use of Multiple Measurements in Taxonomic Problems](http://rcs.chemometrics.ru/Tutorials/classification/Fisher.pdf), and can also be found on the [UCI Machine Learning Repository][1].\n\nIt includes three iris species with 50 samples each as well as some properties about each flower.",
"version": 2,
"keywords": [
"subject",
"earth and nature",
"biology"
],
"owner": {
"name": "UCI Machine Learning",
"url": "https://www.kaggle.com/organizations/uciml",
"image": "https://storage.googleapis.com/kaggle-organizations/7/thumbnail.png"
},
"license": {
"name": "CC0: Public Domain",
"url": "https://creativecommons.org/publicdomain/zero/1.0/"
},
"files": [
{
"format": "zip",
"sizeBytes": 3687,
"downloadUrl": "https://www.kaggle.com/datasets/uciml/iris/download?datasetVersionNumber=2",
"requiresSubscription": true
}
],
"downloads": 907784,
"views": 3131083,
"votes": 4861,
"commentCount": 33,
"lastUpdated": "2016-09-27T07:38:05.44Z",
"discussionUrl": "https://www.kaggle.com/uciml/iris/discussion",
"thumbnail": "https://storage.googleapis.com/kaggle-datasets-images/19/19/default-backgrounds/dataset-card.jpg",
"isAccessibleForFree": true
}