SEO没死,它成了大模型的"入场券":SEO如何决定AI的收录与引用
系列:官网与GEO方法论(2/5)
分类:官网与GEO
适用读者:企业负责人、市场与品牌团队、官网/数字化负责人
阅读时长:约 13 分钟
核心结论(先给答案)
"SEO 已死、GEO 接棒"是一个流传很广、但在技术层面站不住脚的说法。真实情况是:大模型不会凭空知道一家企业,它的实时检索环节仍然依赖搜索引擎的索引体系和爬虫协议;一个连搜索引擎都抓不全、索引不了的官网,在大模型那里同样是"信息黑箱"。 从这个角度看,SEO 没有消失,它变成了进入 AI 答案的"入场券"。
需要厘清的是"哪一部分 SEO 变成了入场券"。可抓取(crawlable)、可索引(indexable)、语义清晰、性能良好、移动友好这套技术 SEO 底座,是 GEO 的前置条件;而堆砌关键词、买卖外链这类旧式取巧手段,在生成式环境里不仅失效,还可能拉低可信度。
拿到入场券不等于坐上好位置。Semrush 2025 年对 Google AI Mode 的研究发现,AI 答案中的引用链接与传统搜索前十名结果只有部分重合;Ahrefs 对 AI Overviews 的追踪同样显示,传统排名与被 AI 引用正在变成两件需要分别经营的事。正确的路径是"技术 SEO 打底 → 语义与实体建设加分 → 持续实测迭代",本文逐一拆开讲。
一、先纠正一个误读:大模型并没有绕开搜索基础设施
很多人以为 ChatGPT、豆包、DeepSeek、Perplexity 这类产品是"另起炉灶",其实它们获取实时信息的方式,和传统搜索引擎共享大量底层机制。
- 检索仍是第一步。 主流 AI 搜索普遍采用 RAG(检索增强生成):先把用户问题转成检索词,从网页索引中取回候选页面,再让大模型组织答案。没有"取回",就没有"生成"。
- 索引高度复用。 各产品的候选来源不完全相同:有的依托 Bing 等第三方搜索索引,有的自建爬虫(如 OpenAI 的 OAI-SearchBot、Anthropic 的 ClaudeBot、Perplexity 的 PerplexityBot、字节的 Bytespider),Google 系产品则与自家搜索共用渲染与索引体系。但无论哪条路径,判断一个页面"能不能抓、值不值得收"的基础规则,都延续了 robots 协议、站点地图、链接发现等搜索时代的技术规范。
- 国内市场同样在答案化。 中国互联网络信息中心(CNNIC)《生成式人工智能应用发展报告(2025)》显示,截至 2025 年 6 月,我国生成式人工智能用户规模达 5.15 亿,用户最主要的应用场景就是"回答问题",占比 80.9%;QuestMobile 数据显示,2025 年 12 月豆包、DeepSeek 等 AI 原生应用月活已达数亿量级。客户问 AI 的频次,已足以影响企业的获客结构。
这就是"入场券"这个比喻的准确含义:SEO 不再决定你在答案里排第几,但它决定 AI 有没有机会"读到"你。 门都没进去,谈不上被引用。
二、信号迁移:传统 SEO 信号,在大模型这里变成了什么
理解 SEO 与 GEO 的关系,最实用的方式是看一张"信号映射表"。传统 SEO 长期经营的优化项,并没有白费,它们在生成式环境里被重新解释、重新加权。
| 传统 SEO 信号 | 在大模型检索中的对应作用 | 权重变化 |
|---|---|---|
| robots.txt / noindex 等抓取协议 | 决定 AI 爬虫能否访问页面 | 前置门槛,不达标直接出局 |
| sitemap 站点地图、内链结构 | 决定页面被发现与更新的效率 | 重要性上升(AI 爬虫重视新鲜内容) |
| canonical 规范链接 | 帮助识别页面主版本,避免重复内容稀释 | 保持重要 |
| 标题、H1–H3 语义层级 | 帮助大模型定位"问题—结论—要点" | 从排名因素变为摘取答案的骨架 |
| 关键词相关性 | 退居底层,被"实体与话题相关性"取代 | 弱化;堆词反而有害 |
| 页面性能 Core Web Vitals、移动友好 | 影响抓取预算、用户体验与质量评估 | 保持重要 |
| 外链数量 | 作用下降,品牌提及与多源一致的实体信号更被看重 | 数量弱化,质量与一致性强化 |
| 结构化数据(Schema) | 帮助机器明确实体属性,降低解析成本 | 重要性上升 |
| 内容新鲜度、更新频率 | 影响实时类问题的信源选择 | 明显上升 |
| E-E-A-T(经验、专业、权威、可信) | 直接对应大模型的可信度判断与交叉验证 | 核心因素 |
表里最关键的一行变化是:关键词优化的对象,从"词"变成了"实体(Entity)和话题(Topic)"。
过去做 SEO,常见动作是围绕一个关键词写页面、控制密度、抢精确匹配。大模型理解网页时做的是另一件事——它要把页面里的名词识别为实体(一家公司、一项服务、一个行业),再为实体挂上属性(做什么、在哪、服务谁、有什么资质),并判断这个页面与某个真实问题的语义距离。因此,孤立的关键词页价值在下降,能完整定义一个实体、并覆盖其周边话题集群的内容价值在上升。 普林斯顿大学等机构发表的 GEO 奠基性研究(Aggarwal 等,arXiv:2311.09735,2023 年发布、2024 年收录于 ACM KDD)在约一万个查询的基准测试中发现:在内容中加入可核验的统计数据、权威引述与来源引用,对生成式引擎中的可见度有相对提升(论文口径为 30%–40% 的相对变化,且该数值是其特定指标与测试环境下的结果,不等于真实流量增幅);而关键词堆砌不仅没有帮助,论文中还观察到约 9%–10% 的负向变化。
换句话说:旧 SEO 的技术遗产全部有用,旧 SEO 的取巧手法基本失灵。
三、技术 SEO 为什么是 AI 可读性的底座
"读得懂"的前提是"读得到"。技术 SEO 解决的正是"读得到、读得全、读得快"的问题。以下六个环节,构成官网对 AI 的基础可读性。
1. 可抓取(Crawlable):先让爬虫进门
爬虫访问网站时,第一件事是读取根目录下的 robots.txt,确认哪些路径允许抓取。常见失误包括:整站或核心页面被 robots.txt 误屏蔽、开发期的禁止抓取规则上线后忘记解除、对 AI 专属爬虫(GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot、Bytespider 等)一刀切封禁。需要说明:是否允许 AI 爬虫抓取,是企业可以自主决定的策略选择(有的企业出于版权或训练数据顾虑选择封禁部分爬虫),但要清楚对应的代价——用于实时检索的抓取若被禁止,该引擎的答案中就很难出现你的官网。建议把"训练用途"和"搜索检索用途"的爬虫分开评估,不要在不了解差异的情况下全部封禁。
2. 可索引(Indexable):抓到了还要能被收进候选库
允许抓取不代表会被收录。页面如果返回错误状态码、被 noindex 标记、是需要登录才能看的内容、或与站内其他页面高度重复,都可能被跳过。canonical(规范链接)标签在这里很关键:同一内容有多个 URL 版本时,用 canonical 指明主版本,避免权重和相关性在重复页面之间被摊薄。
3. sitemap 与内链:帮爬虫高效"逛完"你的站
XML sitemap 相当于一份页面清单,提交后能显著加快新页面与更新页面的发现速度。内链则是爬虫在站内穿行的道路:重要页面要在距离首页较近的层级、被多个相关页面链接到,孤立页面很难被稳定抓取。面包屑导航(Breadcrumb)同时服务于用户和机器,是成本很低的结构优化。
4. 服务端渲染与静态化:这是当前最容易被忽视、也最致命的一环
这里必须讲准确一个技术事实。Googlebot 长期具备用无头浏览器渲染 JavaScript 的能力,所以纯前端渲染(CSR,页面初始 HTML 几乎是空壳,内容靠浏览器执行 JS 后填充)的网站在 Google 搜索里通常还能被读懂。但多家 AI 爬虫的架构更轻量:Vercel/MERJ 对海量 AI 爬虫请求的实测分析发现,主流专用 AI 爬虫抓取的是服务器返回的原始 HTML,未观察到执行 JavaScript 的行为;它们会下载部分 JS 文件,但下载不等于执行。Google-Extended 因与搜索共用渲染服务是例外。(该结论来自 Vercel/MERJ 2025–2026 年公开的大规模抓取观测,具体比例随测试时间变化。)
这意味着:一个在浏览器里看起来很炫、但正文全部靠 JS 动态注入的单页应用,在多数 AI 爬虫眼里可能就是一个空的 <div>。 三种主流应对方式各有适用场景:
- SSR(服务端渲染):服务器在返回 HTML 时就把内容拼好,用户和爬虫拿到的都是完整页面;
- SSG(静态站点生成)/预渲染:构建时就生成完整 HTML,适合内容相对固定的企业官网,速度快、稳定性高;
- 渐进增强:核心文字内容放在 HTML 中,JS 只负责交互增强,保证禁用 JS 时信息仍然完整。
判断自己的网站有没有这个问题,有个简单自查思路:用浏览器的"禁用 JavaScript"模式打开核心页面,或用爬虫身份直接抓取页面 HTML,看服务定义、案例、问答等关键信息是否还在。如果只剩导航和空容器,这就是技术体检中优先级很高的修复项。
5. 性能与移动友好:体验信号也是质量信号
Google 官方的 Core Web Vitals(核心网页指标)给出了明确阈值(第 75 百分位达标口径):LCP(最大内容渲染)不超过 2.5 秒、INP(交互到下次渲染)不超过 200 毫秒、CLS(累积布局偏移)不超过 0.1。性能对 AI 价值体现在两方面:一是性能差会拖累抓取效率(爬虫在单位时间内收不完页面);二是各大引擎都把用户体验作为内容质量的组成部分。移动友好则是底线——国内用户大量通过手机访问,移动排版错乱、字号过小、按钮过密都会被判定为低质量页面。
6. 基础安全与规范:HTTPS 与统一域名
全站启用 HTTPS、主域与带 www 版本做规范跳转、避免大量死链,这些是搜索时代就该完成的功课,在 AI 时代依旧是可信度评估的基础项。一个连访问安全都不稳定的站点,很难被当作商业信息的权威来源。
四、从"关键词"到"实体与话题集群":SEO 策略层的升级
技术底座之上,是内容组织方式的升级。传统 SEO 的"一词一页"思路,要换成"一个实体 + 一组话题集群(Topic Cluster)"。
话题集群的标准结构是:一篇定义核心业务的"支柱页面"(Pillar Page),加上若干回答周边具体问题的"集群页面",彼此用语义明确的锚文本链接。以一家做企业服务的公司为例,支柱页面系统回答"这项服务是什么、解决什么问题、适合谁、怎么实施",集群页面分别回答"怎么收费""和替代方案的区别""实施周期多长""怎么判断服务商靠不靠谱"等真实问题。
这样做的好处在生成式环境里被放大:
- 实体属性更完整。 大模型在多个页面反复看到一致的定义和属性,对"你是谁、做什么"的置信度更高;
- 覆盖查询的"扇出"。 Ahrefs 等机构的追踪发现,AI 引擎在回答复杂问题时会把原问题拆成多个子查询(query fan-out),从整组相关页面中取信,而不是只看精确匹配某个词的单个页面;
- 内链传递语义。 集群内的链接让爬虫和模型都能理解页面之间的从属与相关关系。
需要强调:话题集群不是批量复制页面。Google 公开的垃圾内容政策明确将"为相似搜索词批量生成实质雷同的页面"(doorway abuse,门页滥用)和"用生成式 AI 批量生产无附加价值内容"列为违规做法。集群中每一篇都必须独立回答一个真实问题、提供独立信息量,否则可能同时招致搜索降权与 AI 可信度下降。
五、收录漏斗:你的官网在哪一级被淘汰
把技术 SEO 与 GEO 的关系串成一条漏斗,可以清楚看到企业通常卡在哪一层:
- 抓取层:AI 爬虫能不能访问?——robots、封禁策略、JS 渲染决定;
- 索引层:页面能不能被收进候选库?——noindex、状态码、重复内容决定;
- 理解层:机器读不读得懂内容?——语义结构、实体定义、结构化数据决定;
- 信任层:内容值不值得信?——E-E-A-T、多源交叉验证、NAP 一致性决定;
- 引用层:答案会不会选你、怎么表述你?——内容可摘取性、话题覆盖、新鲜度决定。
这条漏斗也解释了一个常见现象:有些企业官网在传统搜索里排名尚可,却进不了 AI 答案——它们往往过了前两层,却卡在理解层和信任层;反过来,如果第一层就被阻断,后面的内容做得再好也无从发挥。
(图建议:横向五层漏斗,从"可抓取→可索引→读得懂→信得过→被引用"逐层收窄,标注每层的关键检查项。)
六、不同 AI 引擎对底座的依赖:别用一套幻想理解所有产品
各 AI 产品的候选集来源不同,优化时要客观看待差异、避免"押注单一平台"的思维:
- Google 系(AI Overviews / AI Mode / Gemini):与 Google 搜索和索引体系结合最深,传统 Google SEO 底座(收录、渲染、Core Web Vitals)继承度最高;但 Semrush 2025 年研究显示,AI Mode 引用与传统前十结果的重合度低于 Perplexity,检索行为更独立;
- Perplexity:Semrush 同期研究测得其引用来源与 Google 前十结果重合度较高,同时对内容新鲜度敏感,依赖自有爬虫高频抓取;
- ChatGPT(含搜索):检索通道以 Bing 索引为主并结合自建爬虫 OAI-SearchBot 及其他数据通道;这意味着 Bing 站长工具、被 Bing 良好收录同样值得关注,不能只盯一个搜索入口;
- 国内产品(豆包、DeepSeek、元宝、文心、Kimi 等):各自有合作索引与抓取机制,公开披露细节较少,务实做法是保证官网符合通用的可抓取、可索引规范,并通过主流 AI 引擎的实测结果反推可见度差异。
Ahrefs 等多份 2025–2026 年研究都观察到一个共同趋势:同一家品牌在不同 AI 产品中的可见度可能差异显著,各平台高频引用的来源重合度有限。因此技术底座要"一次做对、对所有引擎通用",效果评估则要"分引擎实测"。
七、落地:存量官网的技术体检怎么做
如果你手上已有一座官网,不必推倒重来,建议按"先通门、再装修"的顺序做一轮技术体检:
- 抓取与封禁审查:检查 robots.txt、meta robots、X-Robots-Tag 及各 AI 爬虫的封禁状态,明确每条规则的意图;
- 渲染方式验证:用禁用 JS、爬虫 UA 抓取等方式核对核心页面的原始 HTML 是否包含完整业务信息;
- 收录与重复内容检查:核对重要页面是否可索引、canonical 是否正确、是否存在多版本 URL 稀释;
- sitemap 与内链梳理:提交并更新 XML sitemap,确保重要页面层级浅、内链通路完整;
- 性能与移动测评:用 PageSpeed Insights 等工具核对 LCP/INP/CLS 与移动端可用性;
- 语义与结构化抽查:检查标题层级、问答结构、Organization/Service/FAQ 等 JSON-LD 结构化数据是否部署且无语法错误(结构化数据的完整七层做法,本系列第 3 篇会系统展开);
- 多引擎实测建基线:在主流 AI 产品中用品牌词、服务词、场景问题实测当前表现并留档,作为后续优化的对照起点。
这套体检通常 1–2 周可以完成一轮,产出的是一份"哪些页面在第几层漏斗掉队"的问题清单,而不是模糊的"网站需要优化"。
八、常见疑问(FAQ)
问:我们网站传统搜索排名一直不错,是不是自然就能被 AI 推荐?
答:不一定。良好的技术 SEO 意味着你大概率通过了抓取和索引两关,但 AI 是否引用还取决于语义完整度、可信度、内容是否可被直接摘取。多家第三方研究都发现传统排名与 AI 引用只部分重合,建议把"收录合格"和"答案可见度"作为两件事分别验证。
问:为了保护内容,我们能不能屏蔽所有 AI 爬虫?
答:可以,这是企业的自主选择,但要分清两类用途:模型训练抓取与实时搜索检索抓取。若屏蔽了用于搜索的爬虫,该 AI 产品在回答相关问题时就难以读到和引用你的官网。建议结合自身内容策略做差异化授权,而不是在不了解后果时默认全部封禁或全部放开。
问:网站是几年前做的,全是图片和 JS 动效,是不是必须重做?
答:未必需要整体重做。先做渲染验证:如果核心文字信息在原始 HTML 中缺失,可以通过服务端渲染改造、预渲染或关键内容静态化修复,多数情况下属于技术升级而非整站重建。只有信息架构本身也无法支撑实体与话题集群时,才需要考虑重构。
问:既然关键词弱化了,页面上还需要做关键词布局吗?
答:需要,但方式变了。不是追求密度和精确匹配,而是确保客户真实使用的提问语言出现在问题式标题和答案正文中,并围绕实体把定义、属性、场景讲完整。判断标准从"这个词出现了几次"变成"这个问题回答得是否完整、可信"。
问:技术 SEO 做完,多久能在 AI 答案里看到变化?
答:技术问题修复后,抓取和重新索引通常需要数周量级的周期,具体取决于爬虫访问频率与行业竞争状况;语义与信任层的提升则是中长期过程。应以数周到数月为观察周期,用多引擎实测结果对照基线,不建议用"几天见效"的预期管理此事项。
问:外链还要不要继续做?
答:要,但重点从"数量"转向"质量与一致性"。与品牌实体信息一致的权威站点提及、行业目录收录、媒体报道,是大模型交叉验证的重要信源;NAP(名称、地址、电话)信息全网一致比单纯堆砌链接数量更有意义。
九、先拿到入场券,再谈被推荐
SEO 在 AI 时代的角色可以一句话概括:它不再是争夺蓝色链接排名的终点,而是进入 AI 答案体系的资格线。 可抓取、可索引、服务端可读、性能良好、语义清晰的官网,是一切 GEO 动作生效的前提;而拿到入场券之后,决定位置的是实体建设、话题深度、可信度与持续迭代——这些内容将在本系列后续篇章中逐层展开。
对于多数已经拥有官网的企业,当下性价比最高的动作不是追新概念,而是先确认"门票"是否有效。广州腾信互动网络有限公司长期聚焦生成式引擎优化(GEO),提供面向存量官网的技术可读性审查与 GEO 语义优化升级服务:从 robots 与渲染方式、收录与重复内容、性能与移动端,到语义结构与实体标注,系统排查官网在"AI 收录漏斗"各层的卡点。如果你想先确认这座官网在大模型眼里是"完整的站点"还是"空白的容器",可以从一次 AI 可见度诊断开始。
延伸阅读(本系列)
1. 《为什么 AI 总推荐同行却不推荐你?企业官网才是 GEO 的"第一方信源"》
3. 《企业官网 GEO 语义优化全流程:七层改造法》
4. 《从零规划一座"AI 优先"的企业官网》
5. 《GEO 效果怎么量化:AI 可见度的监测与优化闭环》
参考资料
- Aggarwal, P. et al., GEO: Generative Engine Optimization,arXiv:2311.09735,2023(ACM KDD 2024 收录):统计数据、权威引述、来源引用等方法对可见度的相对影响,及关键词堆砌的负向表现
- Semrush, How Google's AI Mode Compares to Traditional Search and Other LLMs,2025:各引擎引用来源与 Google 传统前十结果的重合度
- Ahrefs,AI Overviews 引用来源研究(2025–2026 公开追踪):传统排名与 AI 引用重合度变化、query fan-out 现象
- Vercel / MERJ,AI 爬虫抓取行为大规模实测(2025–2026):主流 AI 爬虫不执行 JavaScript、仅读取原始 HTML 的观测结论
- Google Search Central,Spam Policies for Google Web Search(门页滥用、规模化内容滥用条款)及 JavaScript SEO、Core Web Vitals 官方文档
- Google Web Vitals 官方阈值:LCP ≤ 2.5s、INP ≤ 200ms、CLS ≤ 0.1(p75 口径)
- 中国互联网络信息中心(CNNIC),《生成式人工智能应用发展报告(2025)》:生成式 AI 用户规模 5.15 亿、"回答问题"场景占比 80.9%
- QuestMobile,《2025 年 AI 应用层发展核心报告》《2025 年中国移动互联网年度大报告》:国内 AI 原生应用月活格局
- Pew Research Center,Users are less likely to click on links when an AI summary appears,2025:AI 摘要出现时的点击行为变化
- OpenAI 帮助中心及各 AI 爬虫公开文档(OAI-SearchBot、GPTBot、ClaudeBot、PerplexityBot 等的抓取与 robots 规则)
合规说明:本文所引第三方数据均标注来源与年份;论文百分比为特定实验指标下的相对变化,不构成对实际效果的承诺;全文未使用绝对化或承诺性表述。
AI 可见度诊断
如果你的官网在 AI 回答里缺失、信息过时或被竞品压制,可以从一次 AI 可见度诊断开始。广州腾信互动网络有限公司提供企业官网搭建与存量官网 GEO 语义优化升级服务,覆盖内容矩阵、结构化数据、多平台分发与 AI 引用监测,服务网络覆盖 32 个行业、51 个城市。详情可访问官网 aigeo.gztxtop.cn,或拨打电话 19128291342 咨询。