
文章摘要
独立研究者 Kuben(Hugging Face: kuben-developer)公开发布了tiktok-videos-4b:45 亿条 TikTok 视频的元数据集,完全免费。289 GB、27 个 Parquet 文件,连播放数、点赞数、收藏数都一应俱全,是有史以来最大的公开 TikTok 数据集。发布几天内就拿下 6,000+ 下载量和 185 个赞,AI Weekly 等海外媒体也以「三周爬取 45 亿条记录」为题进行了报道。
TikTok 45 亿条视频数据集开放下载(2026):tiktok-videos-4b 里有什么、能做什么
「想亲手分析 TikTok 的爆款公式」——每个数据分析师都做过的梦,2026 年 9 月 2 日成真了。
独立研究者 Kuben(Hugging Face: kuben-developer)公开发布了tiktok-videos-4b:45 亿条 TikTok 视频的元数据集,完全免费。289 GB、27 个 Parquet 文件,连播放数、点赞数、收藏数都一应俱全,是有史以来最大的公开 TikTok 数据集。发布几天内就拿下 6,000+ 下载量和 185 个赞,AI Weekly 等海外媒体也以「三周爬取 45 亿条记录」为题进行了报道。
本文整理数据集内容、能做什么、实际用法,以及使用前必须知道的注意事项(包括「采集行为违反了 TikTok 服务条款」这一点)。
图片来源:Hugging Face 数据集页面(kuben-developer/tiktok-videos-4b)的官方 OG 缩略图
tiktok-videos-4b 是什么:45 亿条 · 289 GB 的视频元数据
先说规模:45 亿条 TikTok 视频记录,一行一条。27 个 zstd 压缩的 Parquet 文件共约 289 GB,单个文件约 10 GB,装着约 1.67 亿条。
采集方式是TikTok Android 应用使用的内部 HTTP API——不是 Web 端点,也不是无头浏览器。请求签名方式与应用一致,来自匿名设备注册,全程没有登录、没有账号、没有会话 Cookie。重复数据已按 content_id 完全去重(源表约有 10% 重复行)。
| 项目 | 内容 |
|---|---|
| 记录数 | 45 亿条(一行一视频,content_id 无重复) |
| 文件格式 | 27 个 Parquet(zstd 压缩)· 共约 289 GB |
| 采集周期 | 约 3 周(2026 年 9 月 2 日发布) |
| 语言 | en / es / pt / id / ar |
| 许可证 | research-use(仅限研究与教学用途) |
| 托管位置 | Hugging Face(免费 · 无访问门槛) |
16 个字段全览:5 种互动指标齐全
| 字段 | 类型 | 说明 |
|---|---|---|
| content_id | uint64 | TikTok 视频 ID(全数据集唯一) |
| create_time | datetime | 发布时间 |
| desc | string | 文案(创作者撰写的正文) |
| mentions | list | 视频中 @ 的账号 ID |
| duration | uint16 | 视频时长(秒) |
| is_video | uint8 | 1=视频 / 0=图文帖 |
| music_id / music_title | uint64 / string | 使用的音源(跨视频关联键) |
| views | uint64 | 播放数 |
| likes | uint64 | 点赞数 |
| comments | uint64 | 评论数 |
| shares | uint64 | 分享数 |
| saves | uint64 | 收藏数 |
| country / language | string | TikTok 推断的国家与语言标签 |
| is_ad | uint8 | 赞助广告标记 |
作者特别指出,saves(收藏数)往往是「内容开始起势」的最早信号——收藏是「以后还要回来看」的主动价值认可,可以作为爆款的领先指标。
能做什么:4 个用例
1. 爆款公式分析
45 亿行 × 5 种互动指标,可以做任何研究团队都无法独立爬取规模的统计分析:高收藏视频的文案特征、不同时长的分享率差异等。数值是快照而非时间序列(下文详述),但做相关性分析体量绰绰有余。
2. 音乐趋势分析
music_id 是跨视频的关联键,一条 SQL 就能汇总每首曲子的使用视频数与总播放数——README 里的现成例子:
import duckdb
duckdb.sql("""
SELECT music_id, music_title, count(*) AS videos, sum(views) AS plays
FROM 'videos-*.parquet'
WHERE create_time >= '2025-01-01'
GROUP BY 1, 2 ORDER BY plays DESC LIMIT 20
""").show()
3. 互动预测与推荐系统研究
数据集标签明确面向推荐系统研究(recommender-systems)。45 亿行的规模,作为播放量预测模型、协同过滤的语料已经足够实用。
4. LLM 训练文本
45 亿条文案构成多语言(5 语种)的社交媒体文体语料。任务类别涵盖文本分类、特征抽取、文本生成,可转用于短文本生成模型的训练。
怎么用:不必下载全量
方式一:DuckDB 直接查询(推荐)
Parquet 的列式优势:不下载全部文件也能跑 SQL。文件放到本地后用通配符直接查,只需要 views 和 desc 就只读这两列。
方式二:pandas,先来一个文件
一个文件 ≈ 10 GB ≈ 1.67 亿条。先拿一个文件试手是铁则。
import pandas as pd
df = pd.read_parquet("videos-00.parquet", columns=["content_id", "views", "desc"])
方式三:Hugging Face 流式读取
不落盘、逐行流式读取。
from datasets import load_dataset
ds = load_dataset("kuben-developer/tiktok-videos-4b", streaming=True)
使用前必须知道的事
公开 ≠ 随便用。
- 采集行为违反了 TikTok 服务条款——作者在 README 里亲口承认。Hugging Face 上也有人提交过版权侵权报告(现已关闭)。下载与二次使用请自担风险,商用尤其要慎重
- GDPR / CCPA 意义上的个人数据——文案由真人撰写,即使公开发布也属于个人数据。下载那一刻起,EU/UK/加州的合规义务就落到你头上。禁止用于识别、画像、定向或联系个人。被收录者可通过仓库 Discussions 申请删除自己的数据
- 数值是快照,不是时间序列——每个互动数都是 3 周采集窗口内某一刻的值。发布时间不同的视频,原始播放数不能直接比较(需要按视频年龄归一化)
- 行按创作者聚簇,未打乱——用于训练前必须 shuffle,顺序读会得到高相关批次
- 没有作者 ID,没有视频 URL——有意排除。无法知道谁发了什么,也没有视频文件(CDN 链接几天内就失效)
- 覆盖率是 32 个分区中的 27 个——是「所采集内容」的无偏随机子集,而所采集的也不是 TikTok 全站
- country/language 是 TikTok 的推断值——错误率高,不能当真值用
适合谁 · 不适合谁
适合:研究短视频爆款规律的运营和研究者;做互动预测、推荐系统的 ML 工程师;需要大规模多语言社媒语料的 LLM 开发者。
不适合:需要视频/音频文件本身的人(只有元数据);想做创作者级分析的人(无作者 ID);想商用的团队(许可证仅限研究用途)。
总结
- 45 亿条 TikTok 视频、289 GB,免费且无门槛地挂在 Hugging Face 上,规模史无前例
- 5 种互动指标 + 文案 + 音源 ID,爆款分析、音乐趋势、推荐研究、LLM 训练四大方向都能用
- 用 DuckDB 可以不下载全量直接跑 SQL——从 1 个文件(10 GB · 1.67 亿条)开始
- 但要记住:采集违反条款、含个人数据、仅限研究用途,而且数值是快照。请负责任地使用
数据集:kuben-developer/tiktok-videos-4b(Hugging Face)
本文基于 Hugging Face 数据集卡片(kuben-developer/tiktok-videos-4b,2026 年 9 月)整理。图片著作权归 Hugging Face/作者所有。
相关文章
相关文章

2026年9月3日
2026 年 MiniMax H3 Insta/TikTok Aesthetics LoRA 指南:制作「吸睛」竖屏短视频

2026年9月9日
Greg Diamos 的实验:CPU 单核 9 小时训出会推理的迷你 LLM【与 Claude Opus 5 共同署名】【2026年版】

2026年6月19日
【2026】Ollama 完全安装指南!在迷你 PC 上运行本地 AI 的方法

2026年6月26日
【2026】FreeLLM.net 完全指南!用 0 元使用 220 个以上免费 LLM API 的方法

2026年8月16日
【2026年8月16日時点】Cheaper Inference 让 AI 模型最高便宜 60%!最新价格对比与机制完全解析

2026年8月24日
【2026】普通 DRAM 就能快速运行 LLM?Processing-in-Memory(PIM)技术详解