私域数据:CSDN / Reddit / Twitter / 微信公众号 / GitHub 私库¶
更新日期:2026-04-26
合规警钟
本页讨论技术可行性,不构成合规建议。许多目标站点的 ToS 明确禁止 scrape;用于商业模型训练的法律风险随各国法规演变(EU AI Act / 中国生成式 AI 管理办法 / Andersen v. Stability AI / NYT v. OpenAI 等案件)。生产上线前法律 review 。
公开 web(Common Crawl 覆盖范围)远不是高质量预训练数据的全部。中文圈 CSDN / 知乎 / 简书 / 微信公众号、英文 Reddit / Twitter(X.com) / Discord / Quora,这些有 robots Disallow / 反爬严 / 登录后 的内容,对 frontier 模型质量有显著贡献。本页拆几大私域。
一、按"难度 / 合规度"光谱¶
flowchart LR
A["官方 dump<br/>(零灰度)"] --> B["公共 API<br/>+ rate limit"]
B --> C["有合规 license<br/>(付费 / 合作)"]
C --> D["反爬中等<br/>+ ToS 灰区"]
D --> E["反爬严<br/>+ ToS 明禁"]
classDef green fill:#fff,stroke:#7a9e8c;
classDef yellow fill:#fff,stroke:#cc785c;
classDef red fill:#fff,stroke:#a14c3a;
class A green
class B,C yellow
class D,E red
实操原则:能用绿色就别用黄色,能用黄色就别碰红色。
二、英文私域¶
2.1 Reddit¶
| 时期 | 状态 |
|---|---|
| 2022 之前 | Pushshift 公开 dump,全量历史 + 实时增量,事实标准预训练源 |
| 2023 | Reddit 关闭 Pushshift API + 第三方(导致 Apollo / RIF 等死) |
| 2024 | Reddit 与 Google 签独家 license,承包 Gemini 训练用 |
| 2025-2026 | OpenAI / Anthropic 走"灰渠道"或自己内部 license 谈判 |
当前可用:
- Pushshift 历史(2005-2022)— 各种 mirror 还在 HF datasets / academictorrents。注意 ToS 风险
- Reddit 官方 Data API:$0.24 per 1K API calls(2023 改后)。免费额度 100 calls/min,商用需联系销售
- 不推荐:直接 scrape reddit.com —— Cloudflare 严守 + 法律明禁
2.2 Twitter / X.com¶
| 时期 | 状态 |
|---|---|
| Twitter 时代(pre-2022) | Decahose / Firehose API 可买,学术 v1.1 API 免费 |
| 2023 X 接管 | 关停免费 v1,付费 tier \(100-\)42K/月 |
| 2024-2026 | scrape 几乎不可能(大量反爬 + JS-only),完全切断对 frontier lab 的常规渠道 |
当前可用:
- 历史 dataset:Internet Archive Twitter Stream Grab(学术 collected stream,2011-2022,每 day GB 级)
- 第三方:brandwatch / brand24 等 social listening 公司有历史 + 实时,但价格 $$$
- 学术研究:还能申请 X.com 的 academic access(少量)
2.3 Discord / Slack¶
- Discord:聊天平台,反爬不算严,但纯私域(每服务器需邀请)。有些公开 server 可加入抓,少数 dump 在 HF(Discord chat dataset 搜)。ToS 明禁 scrape
- Slack:完全企业私域,无公开渠道
2.4 Quora / Stack Overflow¶
- Stack Overflow / Stack Exchange:绝对正路 — data.stackexchange.com 公开 XML/Parquet dump,季度更新,All major LLM corpora 都直接用 dump。详见 parser.md §七
- Quora:反爬中等(CF + 登录墙),ToS 明禁。无合法 dump。frontier lab 通常通过 Common Crawl 间接拿一部分
2.5 GitHub¶
- 公开仓库:GHArchive(事件流,2011 至今)+ BigQuery GitHub + 直接 git clone
- The Stack v2(BigCode)= GitHub 公开仓库的 frontier 标准切片,详见 archives.md §3.6
- 私库 / 内部代码:完全私域,无渠道。Frontier 公司可能内部用自己的 enterprise GitHub repos 但不算外部数据
三、中文私域¶
3.1 CSDN¶
中文最大技术博客 + 答疑社区。质量参差但量大。
- 反爬:中等。开了 anti-spider middleware,登录后才能看完整文章(部分),登录后限 daily 浏览数
- 可行:
- CC 间接覆盖:CC 抓 ~50-70% 公开文章(无登录限制部分)
- trafilatura + magic-html 提取:因为 CSDN 的 layout 多样,magic-html 提取效果显著好
- 自爬补 CC 漏的:用 crawler.md 描述的 stealth 栈
- ToS:禁止 scrape,但实际执法宽松(有版权诉讼例如 CSDN 起诉 Stack Overflow Chinese 转载,但不针对 LLM 训练)
3.2 知乎¶
中文最大问答社区,质量较 CSDN 更高(精华答案、长文)。
- 反爬:严。CF 风控 + 自家 anti-bot + 登录墙(2023 起对未登录展示截断)
- 法律:知乎 2024 多次发函给国内 LLM 公司禁止 scrape,部分案件诉讼中
- 可行渠道:
- Common Crawl 历史(2018-2022 部分)—— 当时反爬较松,有相当 unique 内容
- 付费 API:知乎不开放
- 走第三方 dataset:HF 上偶有"知乎问答"小批量,合规存疑
风险:知乎是法律前线,frontier 中文模型这部分都要内部 review。
3.3 微信公众号¶
中文优质长文重灾区(科技 / 商业 / 财经 / 文化),但强 access control。
- 没有公开 API
- 只能通过:
- 搜狗微信搜索(限量、被搜狗 ban)
- 手动收藏 + Web 转 PDF / markdown
- 第三方爬虫 SaaS(违规,存活时间短)
- CC 间接:公众号文章在 mp.weixin.qq.com 域,CC 抓不到(动态 + 登录态)
实际:中文 LLM 训练里公众号内容普遍极少,是关键短板。少量通过手动收集 / 转载到第三方站点的才进 corpus。
3.4 简书 / 掘金 / 思否¶
- 简书:反爬轻,CC 部分覆盖。质量参差
- 掘金:技术社区,反爬中等,部分需登录
- 思否(SegmentFault):技术问答,反爬轻,有 robots.txt 比较规范
这三个的中文技术内容跟 CSDN 高度重叠(很多文章交叉转载),dedup 后增量有限。
3.5 小红书 / 抖音¶
- 完全私域(移动 App 优先),反爬极严
- 有少量第三方 dataset(短文本),合规高度存疑
- 中文 LLM 训练绝大多数不碰
四、技术:如何抓登录后内容¶
reminder:抓登录后内容会触及 ToS / 法律高压区,本节仅做技术陈述。
4.1 Cookie 注入¶
# Selenium / Playwright 半手动 + cookie session 复用
from playwright.sync_api import sync_playwright
with sync_playwright() as p:
browser = p.chromium.launch()
ctx = browser.new_context()
# 加载预存的 cookies(自己登录一次后导出)
ctx.add_cookies(stored_cookies)
page = ctx.new_page()
page.goto("https://csdn.net/...")
# 现在是"登录态"
风险:账号容易被风控盯上(IP / UA / 行为异常),单账号挂 1-N 天。多账号轮换是常规做法,但创建账号本身可能违反 ToS。
4.2 OAuth / API Token¶
合规渠道。如果站点有 OAuth API(GitHub / Reddit),通过应用注册拿 token,按 rate limit 抓。
4.3 浏览器扩展自动化¶
browsertrix-crawler 等可以用真实浏览器配置 + 真实用户登录态做合规边界内的归档(学术档案场景)。frontier lab 训练数据采集通常不走这条。
五、实操栈¶
| 目标 | 工具栈 |
|---|---|
| Reddit Pushshift 历史 | HF datasets 直接下,datasets.load_dataset("...") |
| Stack Exchange | data.stackexchange.com 周期 dump,requests 下载 + 解 |
| CSDN | trafilatura/magic-html 提取 + 自爬(crawler.md IP 池) |
| 知乎历史 | CC index 查询过去几年的快照 |
| GitHub 公开 | GHArchive API + git clone |
| arXiv | bulk LaTeX source(S3 requester-pays) |
六、追问延伸¶
| 问题 | 方向 |
|---|---|
| 抓登录后内容算违法吗? | 看辖区。中国网信办对 LLM 训练数据来源越来越严;EU AI Act 对训练数据有 transparency obligation;美国 Andersen / NYT 案件还在演变 |
| 有没有"中文私域 dataset"市场? | 几乎没有 mature 公开商业渠道。frontier 中文模型主要靠 CC 中文部分 + 自爬 + 内部数据交易(不公开) |
| Reddit 现在 frontier 怎么用? | OpenAI / Anthropic 通过付费 API 或历史 Pushshift 用;Google 独家 license |
| 微信公众号怎么补? | 没有合规渠道。frontier 中文模型这部分确实弱,只能等微信侧政策变化 |
参考链接¶
- Pushshift archives @ academictorrents
- Internet Archive Twitter Stream
- Stack Exchange Data Dump
- GHArchive
- browsertrix-crawler
- Reddit Data API pricing