2026年9月25日 · 星期五Kuala Lumpur Edition马来西亚中文科技情报 · 每日更新
创立于吉隆坡报道 AI · 数码 · 政策
马来西亚中文科技情报
情報

内容开源到 GitHub 对 GEO 有用吗:开数据有用,搬文章有害

实测:GitHub 仓库页面没有 canonical 标签,搬运文章会稀释归属

「把网站内容也放一份到 GitHub,是不是更容易被 AI 读到?」这个问题最近被问了几次。直觉上说得通,GitHub 是全世界被抓取得最彻底的网站之一,Markdown 又是 AI 最好解析的格式。

我实测了 GitHub 的爬虫与索引规则,结论分成两半:把「数据和工具」放上去有用,把「文章正文」搬过去会害了自己。

GitHub 确实不拦 AI

先确认前提。查 github.com/robots.txt(101 行),里面点名的 User-agent 只有四个:

User-agent: bingbot
User-agent: adidxbot
User-agent: BingPreview
User-agent: baidu
User-agent: *

GPTBot、ClaudeBot、PerplexityBot、CCBot、Google-Extended,一个都没提到。 而兜底的 User-agent: * 区块里,禁止的只是带查询参数的 URL、登录页与 Copilot 相关路径,没有 Disallow: /。

也就是说:仓库页面、README、Markdown 文件,AI 爬虫都可以抓。 文件头上还写着一句「If you would like to crawl GitHub contact us」,态度是开放的。

所以「GitHub 内容能被 AI 读到」这个前提成立。问题出在下一层。

真正的问题:仓库页面没有 canonical

我抓了一个仓库页面来看它的头部标记,结果是:

标记GitHub 仓库页面
<link rel="canonical">没有
<meta name="robots">没有
og:title 等社交标记有

canonical 的作用,是告诉搜索引擎与 AI「这份内容的原始出处在哪」。GitHub 不提供这个标记,意味着你放上去的那份副本,在机器眼里是一个独立的、没有归属声明的来源。

再叠加一个现实:github.com 的域名权威度,远高于任何个人或中小企业的网站。

两件事合起来,结果就很清楚了。

搬文章过去会发生什么

同一篇文章同时存在于你的网站和 GitHub,而 GitHub 那份没有任何标记指回你。当 AI 需要引用这段内容时,它面对的是两个来源:一个是权威度极高的 github.com,一个是你的站。

你把自己变成了自己的竞争者,而且是拿弱的那一边去打。可能出现的结果:

  • 引用归到 GitHub:AI 提到了你的内容,但给出的链接是 github.com/你的用户名,不是你的品牌域名。
  • 品牌信号被稀释:你辛苦建立的域名与作者实体,拿不到这次曝光。
  • 重复内容判断:搜索引擎需要在两份几乎相同的内容里选一份展示,你未必是被选中的那个。

还有一点更根本:把内容传到自己的仓库,仍然是「你说你自己」。 它不产生第三方印证,而第三方印证才是 AI 判断可信度的核心依据。多一个自己的副本,不等于多一个来源。

那什么该放上去

换个思路:GitHub 放别人会「用」的东西,网站放别人会「读」的东西。

适合放 GitHub应该留在自己网站
原始数据集(CSV、JSON)文章正文与解读
测量脚本、工具观点、分析、结论
可复用的模板、清单案例与经验
方法论的技术实现面向读者的说明

差别在哪?数据和工具会被别人「使用」,而使用会产生引用。 有人拿你的数据集写分析,他会注明来源;有人用你的脚本,他会在文章里提到出处。这才是真正的第三方提及,不是你搬运自己,而是别人主动引用你。

而文章正文放上去,没有人会「使用」它,只会被机器当成一份重复的副本。

具体怎么做

  1. 仓库放数据与脚本,不放文章。 README 里用两三段说明这份数据是什么、怎么产生的,然后链回你网站上的完整分析。
  2. README 顶部就给出出处链接。 这是你唯一能替代 canonical 的手段,用一个显眼的链接把归属写死。
  3. 标明授权方式。 数据集加上明确的使用条款(例如允许自由使用但需注明来源),别人才敢用,也才会注明。
  4. 如果一定要放文章摘要,只放两三句概述加链接,不要放全文。

顺带一提:raw.githubusercontent.com 没有 robots.txt(返回 404),意味着没有声明任何抓取限制;GitHub Pages 则明确提供 sitemap。这两条都说明,只要你放上去,被抓取不是问题,问题从来只是归属。

结论

「开源内容有助于 GEO」这个说法,对了一半。

  • ✅ 开源数据与工具:有益。它制造别人引用你的理由,而引用正是 GEO 的硬通货。
  • ❌ 把文章搬到 GitHub:有害。你会在一个没有归属标记、且域名权威度碾压你的地方,制造一个自己的竞争对手。

判断标准其实很简单:这件事是让别人多一个理由提到我,还是让我的内容多一个没署名的副本? 前者做,后者不做。

方法与边界

  • 检测时间:2026 年 8 月。GitHub 的 robots.txt 与页面标记随时可能调整,结论只代表该时点。
  • 关于 canonical:我检查的是公开仓库的网页版页面。GitHub 未来若加入 canonical 或来源标记,这篇的判断需要相应修正。
  • 没有实测「引用归属」的最终结果:本文推断的是机制层面,「无 canonical + 高权威域名」会带来什么风险。我没有做 A/B 对照实验去验证 AI 最终会引用哪一边,这一点应当说明清楚,而不是当成已验证的结论。

延伸阅读:44 家大马知名企业网站实测:九成对 AI 爬虫没有任何设置|日志里的 GPTBot 六成是假的|什么是 llms.txt?怎么写?|什么是 GEO?和 SEO 有什么区别

更多报道More