「把网站内容也放一份到 GitHub,是不是更容易被 AI 读到?」这个问题最近被问了几次。直觉上说得通,GitHub 是全世界被抓取得最彻底的网站之一,Markdown 又是 AI 最好解析的格式。
我实测了 GitHub 的爬虫与索引规则,结论分成两半:把「数据和工具」放上去有用,把「文章正文」搬过去会害了自己。
GitHub 确实不拦 AI
先确认前提。查 github.com/robots.txt(101 行),里面点名的 User-agent 只有四个:
User-agent: bingbot
User-agent: adidxbot
User-agent: BingPreview
User-agent: baidu
User-agent: *
GPTBot、ClaudeBot、PerplexityBot、CCBot、Google-Extended,一个都没提到。 而兜底的 User-agent: * 区块里,禁止的只是带查询参数的 URL、登录页与 Copilot 相关路径,没有 Disallow: /。
也就是说:仓库页面、README、Markdown 文件,AI 爬虫都可以抓。 文件头上还写着一句「If you would like to crawl GitHub contact us」,态度是开放的。
所以「GitHub 内容能被 AI 读到」这个前提成立。问题出在下一层。
真正的问题:仓库页面没有 canonical
我抓了一个仓库页面来看它的头部标记,结果是:
| 标记 | GitHub 仓库页面 |
|---|---|
<link rel="canonical"> | 没有 |
<meta name="robots"> | 没有 |
og:title 等社交标记 | 有 |
canonical 的作用,是告诉搜索引擎与 AI「这份内容的原始出处在哪」。GitHub 不提供这个标记,意味着你放上去的那份副本,在机器眼里是一个独立的、没有归属声明的来源。
再叠加一个现实:github.com 的域名权威度,远高于任何个人或中小企业的网站。
两件事合起来,结果就很清楚了。
搬文章过去会发生什么
同一篇文章同时存在于你的网站和 GitHub,而 GitHub 那份没有任何标记指回你。当 AI 需要引用这段内容时,它面对的是两个来源:一个是权威度极高的 github.com,一个是你的站。
你把自己变成了自己的竞争者,而且是拿弱的那一边去打。可能出现的结果:
- 引用归到 GitHub:AI 提到了你的内容,但给出的链接是 github.com/你的用户名,不是你的品牌域名。
- 品牌信号被稀释:你辛苦建立的域名与作者实体,拿不到这次曝光。
- 重复内容判断:搜索引擎需要在两份几乎相同的内容里选一份展示,你未必是被选中的那个。
还有一点更根本:把内容传到自己的仓库,仍然是「你说你自己」。 它不产生第三方印证,而第三方印证才是 AI 判断可信度的核心依据。多一个自己的副本,不等于多一个来源。
那什么该放上去
换个思路:GitHub 放别人会「用」的东西,网站放别人会「读」的东西。
| 适合放 GitHub | 应该留在自己网站 |
|---|---|
| 原始数据集(CSV、JSON) | 文章正文与解读 |
| 测量脚本、工具 | 观点、分析、结论 |
| 可复用的模板、清单 | 案例与经验 |
| 方法论的技术实现 | 面向读者的说明 |
差别在哪?数据和工具会被别人「使用」,而使用会产生引用。 有人拿你的数据集写分析,他会注明来源;有人用你的脚本,他会在文章里提到出处。这才是真正的第三方提及,不是你搬运自己,而是别人主动引用你。
而文章正文放上去,没有人会「使用」它,只会被机器当成一份重复的副本。
具体怎么做
- 仓库放数据与脚本,不放文章。 README 里用两三段说明这份数据是什么、怎么产生的,然后链回你网站上的完整分析。
- README 顶部就给出出处链接。 这是你唯一能替代 canonical 的手段,用一个显眼的链接把归属写死。
- 标明授权方式。 数据集加上明确的使用条款(例如允许自由使用但需注明来源),别人才敢用,也才会注明。
- 如果一定要放文章摘要,只放两三句概述加链接,不要放全文。
顺带一提:raw.githubusercontent.com 没有 robots.txt(返回 404),意味着没有声明任何抓取限制;GitHub Pages 则明确提供 sitemap。这两条都说明,只要你放上去,被抓取不是问题,问题从来只是归属。
结论
「开源内容有助于 GEO」这个说法,对了一半。
- ✅ 开源数据与工具:有益。它制造别人引用你的理由,而引用正是 GEO 的硬通货。
- ❌ 把文章搬到 GitHub:有害。你会在一个没有归属标记、且域名权威度碾压你的地方,制造一个自己的竞争对手。
判断标准其实很简单:这件事是让别人多一个理由提到我,还是让我的内容多一个没署名的副本? 前者做,后者不做。
方法与边界
- 检测时间:2026 年 8 月。GitHub 的 robots.txt 与页面标记随时可能调整,结论只代表该时点。
- 关于 canonical:我检查的是公开仓库的网页版页面。GitHub 未来若加入 canonical 或来源标记,这篇的判断需要相应修正。
- 没有实测「引用归属」的最终结果:本文推断的是机制层面,「无 canonical + 高权威域名」会带来什么风险。我没有做 A/B 对照实验去验证 AI 最终会引用哪一边,这一点应当说明清楚,而不是当成已验证的结论。
延伸阅读:44 家大马知名企业网站实测:九成对 AI 爬虫没有任何设置|日志里的 GPTBot 六成是假的|什么是 llms.txt?怎么写?|什么是 GEO?和 SEO 有什么区别



