抖音トレンドを毎時自動収集&アーカイブ!中国SNS「热榜」5カテゴリを2021年から記録し続けるデータ収集ツール
抖音トレンドを毎時自動収集&アーカイブ!中国SNS「热榜」5カテゴリを2021年から記録し続けるデータ収集ツール
ひとことでいうと
douyin-hot-hub は、中国最大の短動画プラットフォーム「抖音(Douyin)」のトレンドランキングを毎時間ごとに自動で取得し、日付ごとのファイルとして記録し続ける Python 製のデータ収集ツールです。ランキングは「热榜(ホットサーチ)」「明星榜(芸能人)」「直播榜(ライブ配信)」「音乐榜(音楽)」「品牌榜(ブランド)」の5カテゴリをカバーしており、2021年1月から現在に至るまで継続的にデータを積み重ねています。収集したデータは GitHub 上で誰でも自由に閲覧・ダウンロードできる形で公開されており、中国のトレンドを長期的に追いたい方に特に役立ちます。
こんな人におすすめ
中国市場・トレンドを調べたいマーケターやリサーチャーの方に最適です。抖音は中国で月間アクティブユーザー数が7億人を超えるプラットフォームです。このツールを使えば、2021年から今日までどんな話題が盛り上がったかを時系列で振り返ることができます。日本語圏では入手しにくい中国語の一次データが、整理されたファイル形式でそのまま参照できる点は大きな強みです。
自然言語処理や機械学習の研究・学習をしている方にも向いています。アーカイブは規則正しいフォーマット(Markdown 形式)で保存されているため、正規表現やプログラムで中身を読み込んで分析するのが簡単です。中国語のトレンドキーワードを時系列で並べたデータは、感情分析や流行語の検出モデルを作るときの素材として活用できます。
複数のSNSを横断してトレンドを監視したい方にもおすすめです。同じ作者が知乎・微博・頭条・GitHub・v2ex というほかのプラットフォームのホット榜(人気ランキング)リポジトリも公開しています。これらを組み合わせることで、複数の中国SNSを一括監視する仕組みを構築できます。
インストール・使い方
前提条件
- Python 3.x(動作確認済みバージョン: 3.12.13)
- pip(ライブラリ管理ツール。Python と一緒にインストールされることがほとんどです)
- インターネット接続(抖音のサーバーにアクセスするために必要です)
Step 1: リポジトリをダウンロードする
git clone https://github.com/lonnyzhang423/douyin-hot-hub.git
cd douyin-hot-hub
「リポジトリ(ソースコードの置き場)」をパソコンにコピーするコマンドです。ターミナル(文字で命令を送る画面)を開いて、上のコマンドをコピー&ペーストして実行してください。2行目の cd コマンドで、ダウンロードしたフォルダの中に移動します。
Step 2: 必要なライブラリをインストールする
pip install -r requirements.txt
このツールが動くために必要な部品(ライブラリ)をまとめてインストールします。requirements.txt というファイルに必要なものが一覧になっており、pip がそれを読んで自動で用意してくれます。root 環境で動かす場合は、仮想環境(venv)を使うとシステムへの影響を最小限に抑えられます。
Step 3: データ収集スクリプトを実行する
python douyin.py
抖音の各ランキングにアクセスし、データを取得してローカル(自分のパソコン)に保存します。実行すると JSON ファイル(データを整理して入れておく箱のようなもの)が生成され、README.md が最新の内容に自動で更新されます。GitHub Actions(後述)などの自動実行サービスと組み合わせることで、毎時間ごとに自動で収集を続けるアーカイブが完成します。
Step 4: 過去のデータを確認する
収集されたデータは archives/ フォルダ内に日付ごとのファイルとして保存されます。
cat archives/2026-03-07.md
ファイルを開くと、その日に記録されたランキングを一覧で確認できます。2021年1月以降の記録が継続的に積み上がっているため、特定の日付のトレンドを振り返ることも可能です。
ブラウザで試す
GitHub 上でリポジトリのページを開くと、README に最新のランキングが自動で表示されます。热榜(ホットサーチ)・音乐榜・品牌榜など各カテゴリの最新データが、インストールなしでブラウザからそのまま確認できます。実際のシステムが毎時間どのようなデータを収集・蓄積しているかのイメージをつかむのに最適です。
動かしてみた
Docker 環境で douyin.py を実行したところ、主要な5カテゴリすべてのデータ取得が確認できました。
INFO - save response:hot-search.json
INFO - save response:hot-star.json
INFO - save response:hot-live.json
INFO - save response:hot-music.json
INFO - save response:brand-category.json
INFO - save response:汽车.json
INFO - save response:手机.json
INFO - save response:美妆.json
INFO - save response:奢侈品.json
INFO - save response:食品饮料.json
INFO - save response:家用电器.json
ログを見ると、热榜・明星榜・ライブ配信・音楽・ブランド(13カテゴリ)のすべてについて JSON ファイルが正常に保存されています。README に記録された更新タイムスタンプ(更新時間:2026-06-05 04:59:01 +0800)からも、データ取得から Markdown への書き出しまで一連の処理が正しく動いていることが確認できます。
実行時点の热榜1位は「中国男篮二番战惜败塞尔维亚FMP」(中国男子バスケットボール代表の国際試合に関するニュース)、音乐榜1位は「如果我一颗心被你俘虏」でした。なお、データが取得できなかったカテゴリがあった場合も、スクリプトはエラーで止まらず「暫無數据(データなし)」として記録を継続する設計になっており、長期アーカイブの安定性がしっかり保たれています。
はじめの一歩:アーカイブデータを読み込んでみる
アーカイブは Markdown 形式で保存されているため、追加ライブラリなしに Python の標準機能だけで読み込めます。以下は热榜のキーワードを抽出するサンプルコードです。
import re
with open("archives/2026-03-07.md", "r", encoding="utf-8") as f:
content = f.read()
# 热榜のタイトルを抽出
items = re.findall(r'\d+\. \[(.+?)\]', content)
for i, item in enumerate(items[:10], 1):
print(f"{i}. {item}")
このコードは archives/ フォルダ内の Markdown ファイルを読み込み、正規表現(パターンに一致するテキストを探す仕組み)でランキング項目のタイトルだけを取り出します。アーカイブは2021年1月から現在まで積み上がっており、このコードを少し変えるだけでさまざまな分析に応用できます。
すぐ試せる行動をまとめます。
archives/フォルダのファイル一覧を確認し、最古のファイルと最新のファイルを比べてみる- 気になる日付のファイルを開いて、その日どんなトピックが1位だったかを確認する
- 上のサンプルコードを実行して、キーワードの抽出が動くことを確かめる
- GitHub Actions の設定ファイルを参考に、毎時間の自動実行スケジュールを組んでみる
- 同作者の微博・知乎ホット榜リポジトリもあわせてクローンし、プラットフォーム間で話題を比較してみる
活用アイデア
- トレンド変化の可視化: 特定キーワードが热榜に登場した頻度を月別に集計し、社会的な関心の変遷を時系列グラフで表示します。「高考(大学入試)」「世界杯(ワールドカップ)」などの季節性キーワードの検出にも有効です。
- ブランド露出モニタリング: 品牌榜データを継続収集し、自社・競合ブランドの露出順位の推移を自動レポートにまとめます。比亚迪・小米・蜜雪冰城など中国ブランドの動向をリアルタイムで追えます。
- 多プラットフォーム横断分析: 同作者の知乎・微博・頭条の各ホット榜リポジトリと組み合わせ、同一トピックがどのプラットフォームで先行してトレンド入りするかを分析します。メディア間の情報伝播速度の研究に応用できます。
- 音楽・エンタメトレンドの把握: 音乐榜のデータを積み上げることで、どの楽曲や BGM が中国で流行したかを時系列で追えます。カバー曲やリミックスの流行サイクルを分析するのにも使えます。
- 芸能人・インフルエンサーの注目度分析: 明星榜の推移を追うことで、特定の芸能人がいつ・どんなきっかけで注目を集めたかをデータとして記録できます。PR やブランドアンバサダーの効果測定にも役立てられます。
- ライブコマース市場の動向調査: 直播榜のデータから、EC ライブ・ゲーム実況・教育コンテンツのどのジャンルが上位を占めているかを分析します。中国のライブコマース市場の成長を長期データで検証するのに適しています。
用語とポイント解説
抖音(Douyin) ByteDance(バイトダンス)が運営する中国版の短動画プラットフォームです。かんたんに言うと、日本やグローバルで広まっている「TikTok」の中国国内版にあたります。月間アクティブユーザー数は7億人を超えており、中国のデジタル文化を語る上で欠かせないサービスです。
热榜(rè bǎng) 「ホットサーチ」とも呼ばれる、いま最も話題になっているキーワードのランキングです。かんたんに言うと、X(旧 Twitter)のトレンド欄に相当します。スポーツ・エンタメ・政治ニュース・グルメ動画など幅広い話題が混在し、中国社会の「今」をそのまま映し出します。
品牌榜(pǐnpái bǎng) 汽車・手机・美妆・奢侈品・食品饮料・家用电器など13カテゴリにわたるブランドの露出ランキングです。かんたんに言うと、「どのブランドがいま抖音でよく話題になっているか」を数値化したものです。比亚迪・华为・珀莱雅など中国有力ブランドの台頭をデータで確認できます。
明星榜 抖音上で注目を集めている芸能人・インフルエンサーの順位表です。かんたんに言うと、「いまいちばん注目されているタレントは誰か」を示すランキングです。ドラマの放映タイミングやニュースによって順位が大きく動くため、芸能情報の波及スピードが体感できます。
直播榜 リアルタイムの視聴数に基づくライブ配信ランキングです。かんたんに言うと、「いま最も多くの人が見ているライブ配信は何か」を示します。EC ライブ(商品を紹介しながら販売する生放送)・ゲーム実況・教育コンテンツが上位を競っています。
アーカイブ
過去に収集したランキングデータを保存したファイルの集まりを指します。かんたんに言うと、「日付ごとに整理されたデータの倉庫」です。このツールでは archives/YYYY-MM-DD.md という形式で毎時の記録が積み上がっており、特定の日付を指定して過去のランキングを振り返れます。
GitHub Actions GitHub(ソースコードの管理・共有サービス)が提供する自動実行の仕組みです。かんたんに言うと、「設定した時間になったら自動でプログラムを動かしてくれるスケジューラー」です。このツールと組み合わせると、人が操作しなくても毎時間データを収集・保存するシステムが完成します。
Markdown(マークダウン) テキストに見出しや箇条書きなどの書式を付けるための軽量な記法です。かんたんに言うと、「普通のテキストに記号を足すだけで、きれいな文書やウェブページに変換できる書き方のルール」です。このツールのアーカイブは Markdown 形式で保存されるため、ブラウザやエディタで見やすく表示できるほか、プログラムで読み込んでデータ処理するのも容易です。
JSON(ジェイソン) プログラム同士がデータをやり取りするときによく使われるデータ形式です。かんたんに言うと、「データを整理して入れておく標準的な箱の形」です。このツールは抖音の API から受け取ったデータを JSON ファイルとして保存し、それを元に Markdown のアーカイブを生成します。
ぜひ中国市場のトレンドリサーチや、SNS データを使った自然言語処理・機械学習の学習・研究などに活用してみてはいかがでしょうか。