选一个代表性 URL,使用 URL Inspection 分别记录“Google 索引中的版本”和“实时测试”:上次抓取时间、抓取允许、索引允许、HTTP 状态、用户声明 canonical、Google 选择 canonical、引用页面和 Sitemap。若是 Discovered,检查服务器容量、重复/无限 URL、内部链接、Sitemap lastmod 真实性与抓取需求;若是 Crawled,检查 noindex、软 404、重复内容、canonical、渲染后正文、页面独特价值和站点模板质量。修复后只对少量代表 URL 请求验证,观察抓取日志和覆盖状态,不要把“实时测试可用”误报为已收录。
直接答案
选一个代表性 URL,使用 URL Inspection 分别记录“Google 索引中的版本”和“实时测试”:上次抓取时间、抓取允许、索引允许、HTTP 状态、用户声明 canonical、Google 选择 canonical、引用页面和 Sitemap。若是 Discovered,检查服务器容量、重复/无限 URL、内部链接、Sitemap lastmod 真实性与抓取需求;若是 Crawled,检查 noindex、软 404、重复内容、canonical、渲染后正文、页面独特价值和站点模板质量。修复后只对少量代表 URL 请求验证,观察抓取日志和覆盖状态,不要把“实时测试可用”误报为已收录。
一、先区分两个状态
Discovered currently not indexed 表示 URL 已被发现,但 Google 可能为避免站点过载等原因推迟抓取。Crawled currently not indexed 表示 Google 已抓取该 URL,但目前未编入索引;不一定需要立即重新提交。
状态是 Google 当前视图,可能延迟更新。保存检查时间、属性和 URL,不要把一张旧截图作为长期事实。
二、固定一个代表性URL
从同一模板和目录中选择一个稳定、重要且不依赖登录的 URL。记录完整大小写、协议、host、路径、查询参数和末尾斜线。http、https、www 与非 www 是不同 URL。
同时选一个已正常索引的对照页。比较响应、模板、链接和内容,比只看失败页更容易找到差异。
三、正确阅读URL Inspection
Inspection 的索引版本展示 Google 已知信息,实时测试检查当前可访问性,两者时间点不同。实时测试通过不保证 URL 会被索引,也不代表 Google 已重新抓取并更新状态。
分别保存 coverage/indexing verdict、last crawl、crawl as、page fetch、indexing allowed 和 canonical 字段。不要只抄顶部一句结论。
四、确认返回真正稳定的200
从 Googlebot 可达的公网路径请求 URL,检查最终状态、重定向链、Content-Type、正文和响应时间。登录页、验证码、地区拦截、5xx、429、循环跳转和长超时都会降低抓取成功率。
不要对不存在或空内容页面返回 200。Google 可能把它识别为软 404;应返回准确的 404/410 或提供真正有用内容。
五、检查robots.txt是否允许抓取
robots.txt 控制抓取,不是可靠的索引移除工具。若 URL 被禁止抓取,Google 可能无法看到页面上的 noindex 或 canonical。核对实际 user-agent、规则顺序、路径大小写和最终 host 的 robots 文件。
robots 修复后确认文件返回 200 且未被 CDN 缓存旧版本。不要为提高抓取量直接开放私有、搜索结果或无限参数空间。
七、不要同时robots阻止又期待noindex生效
Google 需要抓取页面才能看到 noindex。若 robots.txt 阻止访问,移除 URL 的正确流程与单纯封禁抓取不同。对于希望索引的页面,则两者都必须允许。
先明确目标是收录还是移除,避免互相矛盾的设置。
八、核对Canonical链
保存用户声明 canonical 与 Google 选择 canonical。自指 canonical 并不能强制索引;如果内容、重定向、Sitemap 和内部链接都指向另一个 URL,Google 可能选择其他代表页。
检查 canonical 目标是否 200、可索引、同语言/内容等价,避免链、循环、指向 404 或被 robots 阻止。
九、统一所有URL信号
内部链接、Sitemap、hreflang、重定向与 canonical 应尽量指向同一首选 URL。一个页面自指 canonical,但全站链接使用带参数版本,会产生冲突。
先规范协议、host、路径、大小写与尾斜线,再处理内容问题。不要为每个变体都提交 Sitemap。
十、检查渲染后的正文
服务器响应可能只有空壳,正文依赖 JavaScript API。实时测试或渲染结果中检查主标题、正文、链接和结构化数据是否实际出现。API 403、CORS、超时或客户端错误会让 Google 看到空页面。
对关键内容优先使用服务端渲染或静态输出,并确保渲染不依赖 Cookie、地理位置或用户交互。
十一、评估页面独特价值
同一模板批量替换城市、产品名或关键词,但正文几乎相同,会产生大量低差异 URL。即使技术上可抓取,Google 也不保证全部索引。
比较主内容而不是导航和页脚。每页应解决独立需求,包含真实、可验证且与标题一致的信息;没有独立价值的变体应合并或不创建。
十二、排查薄内容与占位页
只有几句话、自动生成列表、无结果搜索页、待补充页面或重复标签页常被抓取但不索引。字数不是唯一标准,核心是是否完整满足用户意图。
不要机械扩写空泛段落。补充必要步骤、示例、来源、作者/更新时间和清晰结论,或将页面合并到更强的主题页。
十三、检查软404
内容为空、商品下架却只显示“无内容”、重定向到无关首页或错误页面返回 200,可能被判断为 soft 404。查看 Inspection 的 fetch/coverage 信息和页面实际正文。
不存在且无替代内容时返回 404/410;有等价替代时做相关重定向。不要把所有下架 URL 重定向到首页。
十四、改善内部链接发现
重要 URL 应从可索引页面通过普通可抓取链接访问,并使用描述性锚文本。只存在于站内搜索、表单、JS 点击事件或孤立 Sitemap 的页面,发现和重要性信号较弱。
建立清晰分类、专题和相关文章结构,但不要生成成千上万低价值标签页来增加链接数量。
十五、Sitemap是提示不是保证
Sitemap 帮助 Google 发现规范 URL,但不保证抓取或索引。只包含希望出现在搜索中的 canonical 200 页面,并控制每个文件的 URL 数量与大小。
提交后检查读取状态和发现 URL 数。不要把 404、重定向、noindex、参数变体和非 canonical 页面混入。
十六、正确使用lastmod
lastmod 应反映页面主要内容的最后重大修改时间,而不是每次构建或请求都改成今天。虚假频繁变化会降低其可信度并制造无效抓取。
导航小改、广告轮换或页脚年份不应更新所有 URL 的 lastmod。由内容发布数据生成稳定时间。
十七、理解抓取需求与容量
Google 抓取受站点健康、容量和抓取需求影响。服务器变慢、5xx/429 增加、连接超时或 robots 响应异常时,抓取可能下降。
查看真实访问日志中的 Googlebot 请求、状态和响应时间,并验证来源。不要仅按 User-Agent 统计,因为可被伪造。
十八、减少无限URL空间
筛选、排序、分页、日历、站内搜索和会话参数可以生成近乎无限组合,消耗抓取资源。规范化参数、阻止无价值路径、避免可抓取链接不断生成新组合。
不能只依赖 canonical 清理无限空间,因为 Google 仍需抓取才能看到 canonical。URL 生成层应从源头约束。
十九、检查重复参数与跟踪URL
utm、ref、session ID 和排序参数可能让同一内容有大量 URL。内部链接应使用干净 canonical URL,并在应用层避免把会话状态写入可抓取链接。
重定向或 canonical 策略要基于参数语义,不能删除真正改变内容的筛选参数后误合并页面。
二十、服务器日志建立时间线
记录 URL 首次发现、Sitemap 提交、Googlebot 抓取时间、状态、字节、响应时长和后续状态变化。日志能区分“从未抓取”“抓取失败”和“成功抓取但未索引”。
按目录与模板聚合,不要把完整 IP、Cookie 或敏感查询参数写入长期报告。
二十一、不要频繁请求编入索引
URL Inspection 的请求索引适合少量重要页面,不是批量提交工具,也不能越过质量、canonical 或技术限制。对未修复页面反复请求只会浪费时间。
先修模板级问题,再抽样请求代表 URL。大量页面依靠 Sitemap 和自然重新抓取。
二十二、检查站点级模板问题
若同目录大量 URL 同时 Crawled not indexed,比较模板的 title、主内容、canonical、noindex、状态和内部链接。单页编辑可能无法解决结构性问题。
建立模板级回归:每次发布自动检查 200、canonical、robots、渲染正文、Sitemap 和链接可达。
二十三、处理分页和列表页
分页页若只有重复卡片和很少新增价值,可能不全部索引,但仍可帮助发现详情页。确保每页有独立 URL、可抓取链接和稳定分页,不要把所有分页 canonical 到第一页而隐藏内容路径。
根据用户价值决定哪些列表页需要搜索曝光,不以“全部索引”为唯一目标。
二十四、国际化页面检查
hreflang 连接语言/地区替代版本,但不会替代 canonical。每个语言页面通常应自指 canonical,并使用有效的互返 hreflang;翻译为空或几乎相同可能降低独立价值。
检查语言、内容与 URL 是否匹配,避免自动跳转让 Googlebot 无法访问其他版本。
二十五、站点迁移后的特殊情况
新域名或路径迁移期间,新旧 URL、重定向、canonical、Sitemap 和内部链接必须一致。迁移规模大时,状态波动可能持续一段时间,但仍应通过日志确认 Google 正在抓取新 URL。
不要在迁移同时大改内容、信息架构和渲染技术,否则难以区分索引波动根因。
二十六、建立优先级而非追求100%索引
并非所有可抓取 URL 都需要索引。先列出业务关键、独特、canonical 的页面,修复其共同模板;低价值参数页、重复标签页和空列表应主动减少。
索引率必须结合有效 URL 集合计算,不能把所有系统生成 URL 当分母后追求虚假指标。
二十七、安全恢复步骤
冻结大规模 URL 生成;选一个模板样本;修复状态、robots/noindex、canonical 和渲染;改善正文与内部链接;更新只含 canonical 的 Sitemap;发布后验证实时结果;对少量样本请求索引;观察日志和覆盖趋势;再分批修复目录。
每次只改一个模板组并保留回滚。不要一次性改全站 canonical 或 robots 而无抽样验证。
二十八、常见错误
常见误区包括:把两个状态当同一问题;实时测试通过就声称已索引;反复请求索引;每天重提 Sitemap;把 lastmod 全部更新为今天;只增加字数;robots 阻止同时期待 noindex;canonical 与内链冲突;所有下架页跳首页;生成无限参数;忽略渲染后空内容;用固定“48小时”承诺恢复。
另一个错误是以站点全部 URL 100%索引为目标。正确目标是让有独立搜索价值的规范页面稳定可抓取和可索引。
二十九、修复后的验收清单
确认代表 URL 返回稳定 200;robots 允许;无意外 noindex/X-Robots-Tag;渲染后主内容完整;user canonical 与站点信号一致;Google canonical 可解释;页面有独特价值;从可索引页面可点击到达;Sitemap 只含 canonical;lastmod 真实;服务器无持续 429/5xx;日志显示重新抓取;同模板索引趋势改善。
最后用已索引对照页和未索引样本做同一套检查,保存差异与时间线,避免只凭 Search Console 汇总数字结案。
总结
“已发现”与“已抓取但未索引”分别对应抓取前和抓取后的不同阶段。可靠排查要用 URL Inspection 与服务器日志证明当前状态,再检查 HTTP、robots/noindex、canonical、渲染、内容独特性、内部链接、Sitemap 和站点容量。减少无价值 URL、修复模板级问题并分批观察重新抓取,比反复请求索引或更新 Sitemap 更能带来稳定结果。
参考资料
Google Search Central:URL Inspection Tool(https://developers.google.com/search/docs/crawling-indexing/url-inspection-tool)
Google Search Central:Managing crawl budget(https://developers.google.com/search/docs/crawling-indexing/large-site-managing-crawl-budget)
Google Search Central:Build and submit a sitemap(https://developers.google.com/search/docs/crawling-indexing/sitemaps/build-sitemap)
Google Search Central:Robots meta tag and X-Robots-Tag(https://developers.google.com/search/docs/crawling-indexing/robots-meta-tag)
常见问题
1. Crawled currently not indexed是处罚吗?
不一定。它表示当前抓取过但未被选入索引,可能与重复、canonical、软 404、内容价值或后续重新评估有关,需查看具体证据。
2. 请求编入索引后多久一定收录?
没有保证时限,也不保证最终索引。该功能只是请求重新检查,不能越过技术、质量和 canonical 判断。
3. Sitemap提交成功为什么页面还没索引?
Sitemap 只帮助发现 URL。页面仍需可抓取、允许索引、规范信号一致并具有足够价值,Google 才可能选择收录。
4. 增加文章字数能解决Crawled not indexed吗?
不一定。空泛扩写不会创造价值。应解决重复意图、完整性、原创信息、渲染、canonical 和软 404 等真实问题。
5. Discovered not indexed是否说明抓取预算不足?
可能与抓取容量或需求相关,但小站也可能因低价值、无限 URL、服务器不稳定或发现信号弱出现。应结合日志和模板范围判断。