2026年8月18日 · 星期二Kuala Lumpur Edition马来西亚中文科技情报 · 每日更新
创立于吉隆坡报道 AI · 数码 · 政策
马来西亚中文科技情报
情報

44 家大马知名企业网站实测:九成对 AI 爬虫没有任何设置

44 家马来西亚知名企业网站 AI 爬虫设置实测结果:九成没有任何设置

当马来西亚消费者开始用 ChatGPT 问「吉隆坡哪家医院比较好」「大马哪家银行的房贷利率低」,被 AI 提到的公司会拿到生意,没被提到的公司甚至不知道自己缺席了。

这件事的第一道门槛,是 AI 的爬虫能不能读到你的网站、读懂你是谁(这套做法叫 GEO,背景见《什么是 GEO?和 SEO 有什么区别》)。我们在 2026 年 8 月 11 日实测了 44 家马来西亚知名企业与机构的网站,覆盖银行、电信、电商、航空、零售、餐饮、医疗、房产、汽车、教育、媒体与政府机构,逐一检查它们对 AI 爬虫的设置、结构化数据与可抓取性。

结论比「大家都在屏蔽 AI」复杂得多,也更值得本地企业警惕。

九成企业没表过态

robots.txt 是网站告诉爬虫「哪些能抓、哪些不能」的文件,放在网站根目录。我们检查了每个站的 robots.txt 里有没有提到五个主要的 AI 爬虫:GPTBot(OpenAI)、ClaudeBot(Anthropic)、PerplexityBot、CCBot(Common Crawl,多个 AI 模型的训练语料来源)、Google-Extended(Google 用于 AI 产品的抓取标识)。

在 30 个能成功读取 robots.txt 的网站中:

处置方式数量占比
完全没有提到任何 AI 爬虫2790%
明确放行27%
明确屏蔽13%

换句话说,绝大多数马来西亚知名企业的网站,既没有欢迎 AI,也没有拒绝 AI——它们根本没想过这件事

这里有个常见误解需要澄清:「没写」不等于「已放行」。robots.txt 层面确实是默认允许,但网站前面往往还有一层 WAF(网站防火墙),它按自己的规则拦人,不看 robots.txt。后面第四节会看到这一层带来的问题。

唯一全面屏蔽的是 AirAsia

44 家里只有一家做了明确的全面屏蔽:AirAsia。其 robots.txt 原文:

User-agent: CCBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: GPTBot
Disallow: /

四个 AI 爬虫全部禁止抓取全站。这显然是有意识的决定,而不是疏忽——一家公司不会「不小心」写出这四段。

这个选择本身没有对错。内容型企业担心自家内容被拿去训练模型却拿不到流量,是合理的顾虑,全球不少媒体也这么做。但对航空公司而言值得权衡的是:屏蔽之后,当用户问 AI「吉隆坡飞槟城哪家航空公司便宜」,AI 就更难引用你的官方信息,而更可能引用第三方比价站、旅游博客或旧新闻——那些内容你控制不了,也未必对你有利。

只有两家明确欢迎

反方向的例子更少:只有 Hong Leong BankPeroduarobots.txt 里明确放行 AI 爬虫。Hong Leong Bank 甚至专门加了注释分段:

# AI CRAWLERS
User-agent: GPTBot
Allow: /
Disallow: /content/site-configuration/

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

写法很讲究:整站放行,但把后台配置目录单独排除。这是有人认真想过之后的配置,不是模板默认值。

在 44 家样本里,认真处理过这件事的企业只有 3 家(AirAsia、Hong Leong Bank、Perodua)——不到 7%。无论方向是拒绝还是欢迎,至少它们做了决定。

有 13 家连门都没进去

这是本次实测最意外的部分。44 家里有 13 家,我们无法完成基本抓取:

情况数量具体表现
WAF 拦截(HTTP 403)6Cloudflare 挑战、Akamai、Imperva 拦下非浏览器客户端
连接失败/技术故障5连接超时、SSL 证书主体不匹配
没有 robots.txt(404)3网站正常,但根目录没有这个文件

其中几个案例值得单独说:

  • McDonald’s Malaysia 返回 Cf-Mitigated: challenge,即 Cloudflare 的机器人挑战。浏览器能过,脚本类客户端过不去。
  • Watsons Malaysia 由 Akamai 拦截,TM 由 Imperva 拦截。
  • Public Bank 的主域名出现 SSL 证书主体不匹配(SEC_E_WRONG_PRINCIPAL)——证书上的域名与访问的域名对不上,任何严格校验证书的客户端都会直接断开。

必须说清楚的是:WAF 拦住我们,不等于它也拦住 GPTBot。 OpenAI、Anthropic 等公司公布了各自爬虫的 IP 段,Cloudflare 等服务商有「已验证机器人」名单,可以放行。我们用的是自定义 UA,被当成不明爬虫拦下是正常的。

但这件事仍然值得企业自查,原因是:Cloudflare 自 2024 年起提供一键屏蔽 AI 爬虫的开关,并对部分新站点默认开启。 很多企业的网站是外包做的,这类开关是谁开的、开了什么,公司内部往往没人知道。你以为自己「没有屏蔽 AI」,实际可能在 CDN 后台被默认屏蔽了。

AI 读不到你是谁

让爬虫进门只是第一步。进门之后,AI 要判断「这是一家什么公司、在哪里、做什么」,靠的是页面里的结构化数据(Schema.org JSON-LD)。其中最基础的是 Organization 类型——它相当于网站的身份证。

在 30 个首页能正常读取的网站中:

项目数量占比
首页含任何 JSON-LD 结构化数据1653%
Organization 身份信息1137%

按行业拆开看,缺口的分布很集中:

行业有 Organization schema
航空2 / 2
媒体3 / 4
零售2 / 3
汽车1 / 1
餐饮1 / 2
电信1 / 3
电商平台1 / 4
银行金融0 / 4
医疗0 / 2
教育0 / 3
房产0 / 1

银行、医疗、教育、房产——这四个恰恰是消费者最会去问 AI 的领域(「哪家银行房贷划算」「这个症状该看哪家医院」「哪所大学的这个专业好」「这个区的房价怎样」),却在样本中全数缺失基础身份信息。

结果就是:AI 不是不想引用你,而是读到你的网站之后,仍然不确定你是谁。这时它更可能去引用一个把信息整理清楚的第三方——目录站、比价站、论坛旧帖。

两家中文报走在前面

llms.txt 是 2024 年出现的新提案,用一个纯文本文件向大语言模型说明「这个网站是什么、重点内容在哪里」(写法见我们的《什么是 llms.txt?怎么写?》)。它还不是正式标准,采用率在全球都很低。

我们原本预期在马来西亚基本为零。实际结果是 44 家里有 7 家已经部署(注:初次检测有 12 家返回 200,但其中 5 家是「软 404」——网站对任何路径都回传首页 HTML,实际并不存在该文件。剔除后为 7 家):

网站行业llms.txt 长度
CelcomDigi电信186 行
星洲网 Sin Chew中文媒体65 行
中国报 China Press中文媒体58 行
Perodua汽车44 行
Pantai Hospitals医疗33 行
Lazada Malaysia电商30 行
Columbia Asia医疗29 行

马来西亚两家主要中文报都在名单上。星洲网的 llms.txt 开头是这样写的:

# 星洲网 Sin Chew Daily
> Malaysia’s most widely circulated Chinese-language newspaper and digital news portal, serving the Chinese-speaking community since 1929…

创刊年份、发行量、出版公司、总部所在地——都是给 AI 看的身份信息。这说明本地已经有机构在认真做这件事了,只是还没成为普遍认知。

方法与边界

为了让这份数据可被检验,也为了不夸大结论,以下是完整的方法说明与局限:

  • 检测时间:2026 年 8 月 11 日。网站配置随时会变,本文数据只代表该时点。
  • 样本:44 家马来西亚知名企业与机构,覆盖 12 个行业。这是便利样本,不是随机抽样,不能代表全马企业的整体比例——大企业的技术投入通常高于中小企业,实际情况可能更差。
  • 检测方式:从两个不同网络分别测试(一个海外数据中心 IP、一个吉隆坡本地宽带 IP),以排除单一网络的地域屏蔽因素。两边结果一致。
  • 使用的 UA:自定义标识 TechSogaAudit/1.0 与常规浏览器 UA 各测一轮。我们没有、也不应该伪装成 GPTBot——冒充其他公司的爬虫是不当行为。因此本文无法回答「GPTBot 实际访问时会被如何对待」,只能回答「网站的公开声明与基础配置是什么」。
  • robots.txt 是声明,不是保证:它表达网站的意愿,实际是否被抓取还取决于爬虫是否遵守、以及 WAF/CDN 层的独立规则。
  • 「软 404」已剔除:部分网站对不存在的路径回传 200 与首页 HTML,会造成「文件存在」的假象。本文所有 llms.txtsitemap.xml 的统计都已逐一检查内容,剔除此类误判。

企业自己做的三步自查

不需要任何工具,浏览器就能完成前两步。(做之前建议先看《做 GEO 最常踩的 7 个坑》,避免白做工。)

第一步:看自己有没有把 AI 关在门外

在浏览器打开 你的域名/robots.txt,搜索 GPTBot。三种结果:

  • 找不到 → 你和 90% 的本地企业一样,从没设置过。robots.txt 层面是放行的,但要接着做第二步。
  • 找到,后面跟着 Disallow: / → 你正在屏蔽 ChatGPT。请确认这是公司的决定,而不是外包商或某个模板带来的默认值。
  • 整个文件打不开(404)→ 建议补一个,否则爬虫拿不到任何指引。

第二步:问一下 CDN 后台

如果网站用了 Cloudflare、Akamai 或类似服务,去后台确认有没有开启「屏蔽 AI 爬虫 / AI Scrapers and Crawlers」这类开关。这一层的优先级高于 robots.txt——开了它,你在 robots.txt 里写再多欢迎也没用。这也是本次实测中最容易被忽视的一层。

第三步:确认 AI 读得懂你是谁

在首页按 Ctrl+U 查看源代码,搜索 application/ld+json。如果完全找不到,说明你的网站没有任何结构化数据——AI 只能靠猜。补上 Organization 是成本最低、见效最直接的一项:公司全名、地址、电话、营业时间、官方社交账号链接。

想更系统地跟踪结果,可以参考我们写过的《GEO 效果怎么测?AI 声量份额监测入门》。做完这三步,再打开 ChatGPT 问一句「马来西亚有哪些 XX 公司」,看看自己在不在里面。这是最直接的验收方式,也是大多数企业从没做过的一次检查。

后续

我们也把同一套方法用在自己身上——过程与数据公开记录在《GEO 公开实验(一)》,包括「AI 一次都没提到我们」这种不好看的结果。完整的审计做法见《我们怎么帮马来西亚品牌做 GEO 审计》。我们会持续追踪这 44 个网站的变化。如果其中任何一家调整了 AI 爬虫设置或补上了结构化数据,会在后续更新中记录——包括我们自己判断错误的地方。

更多报道More