检查重要页面是否被发现,核心是看搜索引擎有没有拿到并处理这个网址:先用站点地图和站内链接确认入口存在,再用搜索引擎的抓取工具或日志确认它确实来过。只有入口和抓取都成立,页面才有机会进入索引。发现不等于收录,更不等于排名,检查时要分开判断。
搜索引擎发现网址主要靠三条路径:站内链接、站点地图、外部链接。重要页面如果只靠导航深处点击进入,或者压根没有其他页面指向它,被发现的速度就会慢,甚至长期不被抓取。
<a href,确认站内至少有一个可点击链接指向它,而不是只用 JavaScript 跳转或图片按钮。nofollow 或 rel="nofollow",被标记的链接对发现的帮助会减弱。robots.txt 的 Disallow 规则里,也没有被 noindex 挡住。判断结果:如果以上任一项不成立,先修入口,不要急着判断收录。入口是发现的前提,缺了它,后面所有检查都失去意义。
入口存在后,下一步是确认抓取。不同搜索引擎提供的工具名称不同,但思路一致:提交单个网址,然后看返回状态。
判断结果:状态码正常且内容抓取成功,说明发现和抓取基本成立;状态码异常,问题出在可访问性,先修服务器或权限,而不是反复提交。
站长工具的抓取测试是你主动触发的,日志才是搜索引擎自己来过的证据。在服务器访问日志里按搜索引擎的 User-Agent 过滤,再搜目标网址的路径。
适用条件:日志检查适合有服务器权限的站点。没有日志权限时,只能依赖站长工具的抓取数据和索引状态,结论会弱一些。一项现象可能有多个解释,比如没有日志既可能是没抓,也可能是日志只保留最近几天,不要直接下唯一结论。
这三件事经常被混在一起,导致误判。发现是搜索引擎知道这个网址存在;收录是它把页面存入索引;排名是它在结果里出现在某个位置。检查时按顺序看,不要跳步。
比较改动前后时要注意,搜索需求和季节变化本身会让数据波动,不能把任何变化都归因于某一次修改。假设某页面在周一补了站内链接,周三看到抓取记录增加,这只是时间上的先后,不能直接证明因果,需要更长时间和更多页面一起观察。
按下面顺序做一遍,多数发现类问题能定位到具体环节:
<meta name="robots" content="noindex">。下一步:挑一个你确定重要的页面,按上面六步走一遍,把每一步的结果记下来。哪一步断了,就先修那一步,再重新观察抓取和索引状态。