看到 AI 爬虫访问记录时,先不要把所有 bot 一起挡掉。对 Shopify 店铺来说,更稳的做法是先分清“谁在访问、访问的目的是什么、你想不想让它发现公开页面”。搜索引用、模型训练、用户触发访问、未知高频抓取,处理方式不应该一样。
先分清 4 类访问
很多错误操作都来自一个误区:把所有 AI user-agent 当成一类。实际检查时,可以先按下面这张表判断。
| 访问类型 | 常见 user-agent 或场景 | 主要用途 | Shopify 店铺怎么判断 |
|---|---|---|---|
| 搜索引用 |
OAI-SearchBot、部分 AI 搜索爬虫 |
发现公开网页,让页面有机会出现在 AI 搜索答案、摘要或来源链接里。 | 如果你希望公开商品页、博客页被 ChatGPT Search 等 AI 搜索发现,就不要顺手屏蔽这一类。 |
| 模型训练 |
GPTBot、其他训练用途 crawler |
抓取可能用于模型训练的公开内容。 | 如果你不希望公开内容被用于训练,可以单独限制训练类 crawler,但不要把它和搜索引用类混在一起。 |
| 用户触发访问 |
ChatGPT-User、用户在 AI 工具里打开或询问某个网页 |
由用户动作触发,不是自动全网爬取。 | 不要用它判断“网站是否能出现在 AI 搜索”。搜索可见性主要看搜索类 crawler 和页面本身。 |
| 未知高频抓取 | 伪装 user-agent、异常高频 IP、没有明确说明的 bot | 可能是采集、扫描、价格监控或普通爬虫。 | 看频率、路径、状态码和资源消耗。可以限速或拦截异常行为,但不要只因为名字里有 AI 就整组封禁。 |
如果你正在投放或准备投放 ChatGPT 相关广告,落地页还要额外考虑 OAI-AdsBot 的访问。它和自然搜索引用不是同一件事,检查时也要分开。
Shopify 店铺要查的 5 个位置
1. /robots.txt:先排除误伤
打开 https://你的域名/robots.txt,先看有没有过宽的规则。重点不是“有没有写 AI”,而是有没有把公开页面一起挡掉。
- 有没有
User-agent: *后面直接接Disallow: /。 - 有没有把
OAI-SearchBot、Googlebot、Bingbot放到错误的阻挡组里。 - 有没有把
/products/、/collections/、/blogs/这类公开内容路径误放进 Disallow。 - 有没有第三方 SEO App 或以前的代码,把默认规则整段替换掉。
Shopify 默认 robots.txt 对大多数店铺已经够用。只有在你明确知道要允许或限制哪个 user-agent 时,再改 robots.txt.liquid。如果只是听说“AI 爬虫会抢内容”,不建议直接改线上主题。
2. Shopify Catalog:不要把它和 robots.txt 混为一谈
Shopify 的商品数据如果同步到某些已启用的购物渠道,控制位置不只在 /robots.txt。robots.txt 主要影响开放网页被爬取;商品是否进入某些 agentic storefront 或购物场景,还要看 Shopify 后台里相关销售渠道、目录和商品发布范围。
所以不要以为“挡了 AI 爬虫,就等于所有 AI 购物场景都不显示商品”。这两层要分开检查:公开网页抓取看 robots 和页面访问,商品数据分发看 Shopify 后台渠道设置。
3. CDN、WAF、防采集规则:别把正常访问挡成 403
很多 Shopify 店铺本身不需要在 Shopify 前面再套一层代理。如果你额外接了 Cloudflare、Akamai、防采集服务或自定义安全规则,要查访问日志里有没有这些现象:
- 搜索类 crawler 访问商品页时返回 403、429、验证码、地区限制页或 JavaScript challenge。
- 规则按关键词批量拦截所有带 AI、bot、crawler 的 user-agent。
- 图片、CSS、JS 被限制,导致页面虽然能打开,但关键内容无法完整渲染。
- 某些国家或 IP 段被误挡,而你的主要买家和搜索 crawler 正好会从这些区域访问。
真正应该优先处理的是异常频率和异常路径,而不是把所有 AI 相关访问一刀切。对公开商品页来说,能被正常抓取通常是被搜索理解的前提。
4. 商品页 HTML:AI 看不到的卖点等于没写
爬虫放行只是第一步。很多 Shopify 商品页的问题不是“爬虫进不来”,而是“进来后读不到重点”。抽查 3 个核心商品页,用“查看网页源代码”或渲染后的 HTML 搜索这些内容:
- 标题是否说清品类、用途、核心材质、型号或适配对象。
- 首屏说明是否回答“适合谁、解决什么问题、主要差异是什么”。
- 价格、库存、尺寸、材质、兼容性、配送、退换货是否以文本出现。
- FAQ 是否回答真实购买问题,而不是只写物流和下单流程。
- 评价、评分、面包屑、品牌名和政策信息是否稳定输出。
如果核心卖点只在长图、轮播图、Tab App 或异步脚本里,AI 搜索更容易引用测评文章、论坛讨论或竞品页面,因为那些页面的文本更直接。
5. 结构化数据和数据回查:看一致性,不看 App 数量
先检查 Product、Offer、Review、AggregateRating、BreadcrumbList、Organization 这些基础结构化数据。重点不是装了多少 schema App,而是字段是否和页面可见内容一致:品牌、价格、币种、库存、评价、退货政策、配送信息不能互相打架。
再用 Google Search Console、Bing Webmaster Tools 和 GA4 回查趋势。Search Console 看页面是否可索引和是否有普通搜索表现;Bing AI Performance 看是否出现 AI 引用线索;GA4 看 chatgpt.com、perplexity.ai、copilot.microsoft.com 等 referral 是否带来有效访问。
如果确实要改 robots.txt,先这样写判断
下面不是所有店铺都要照抄的规则,而是一个判断方式:把搜索引用和训练抓取分开,不要用一个总规则处理所有 AI crawler。
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
这表示:公开页面希望有机会出现在 ChatGPT Search 的搜索结果和来源链接里,但不希望 GPTBot 抓取内容用于训练。是否这样设置,要看你的内容策略、品牌策略和站点现状。改之前先保存当前 robots 内容,改完再用测试工具确认公开商品页没有被误挡。
今天可以做什么
- 打开主域名的
/robots.txt,保存当前规则。 - 标出搜索引用类、训练类、用户触发类和未知高频类访问,不要混在一起判断。
- 检查 3 个核心商品页是否能被抓取、能被读取、结构化数据是否和页面内容一致。
- 如果使用额外 CDN 或防 bot 服务,查最近 7-30 天的 403、429 和验证码命中记录。
- 改动 robots 前,先用一个测试 URL 验证,不要直接整站替换默认规则。
FAQ
Shopify 店铺应该屏蔽 GPTBot 吗?
这取决于你的内容策略。如果你不希望公开内容被用于模型训练,可以考虑限制 GPTBot。关键是不要因为限制 GPTBot,就顺手把 OAI-SearchBot、Googlebot、Bingbot 这类搜索发现入口一起挡掉。
允许 OAI-SearchBot 后,就一定会被 ChatGPT Search 引用吗?
不会保证。允许访问只是前提。页面是否被引用,还取决于页面内容是否清楚、是否可索引、是否和用户问题相关、品牌是否有可信提及,以及是否有更合适的来源。
robots.txt 能阻止页面被搜索结果展示吗?
不能把它当作隐藏页面的工具。robots.txt 主要用于管理 crawler 访问。页面如果被其他地方链接到,仍可能以 URL 或标题形式出现在搜索结果里。要让页面不进入索引,通常要用 noindex、密码保护或删除页面。
Shopify 默认 robots.txt 要不要改?
大多数店铺不用改。Shopify 默认规则主要是减少重复、低价值和后台相关页面被抓取。只有当你明确知道某个 crawler 应该放行或限制时,再用 robots.txt.liquid 做小范围调整。
AI 爬虫访问很多,会不会拖慢 Shopify 店铺?
正常抓取通常不是主要问题。真正要看的是异常高频、异常路径和大量 403/429。如果访问量明显异常,先在网络层或安全规则里按频率和路径处理,不要把正常搜索 crawler 一起封掉。
商品页已经允许抓取,为什么 AI 还是不理解?
常见原因是关键信息不在 HTML 文本里,或者结构化数据、FAQ、商品标题、品牌信息互相不一致。先检查商品页首屏、规格、配送、退换货、评价和 FAQ,再谈更复杂的 GEO 工具。