要取得可复查的状态证据,核心是让每一次查询都能被另一个人按相同条件重做,并得到可对照的结果。做法是先固定查询对象、查询入口、查询时间与查询语句,再把返回结果原样保存。对“收录网站”这个主题来说,证据不是“我查过了”,而是能说明某个网址在某个时间点、通过某种方式、得到了什么返回。
不要用首页或栏目页代替全部页面。先列出待验证的完整网址,每个网址单独一行,并注明它属于哪种类型:首页、文章页、产品页、分页或参数页。同一路径带不带结尾斜杠、带不带参数,都算不同网址,必须分别记录。
同时确定你要验证的是哪一类状态:
这四类问题对应不同的证据,不能互相替代。robots.txt 的抓取限制不等于可靠的索引移除,页面被允许抓取也不等于已经被收录。
最关键的一步是固定查询口径。以“是否出现在搜索结果中”为例,建议使用完全匹配的查询方式:把完整网址或其中一段独特文字放入搜索框,观察返回结果中是否出现该网址。查询时记录以下内容:
如果使用命令行工具检查HTTP状态,可以执行类似 curl -I https://example.com/page 的命令,记录返回的状态码和响应头。这里的状态码只说明服务器如何回应请求,不直接说明搜索引擎是否收录。HTTPS 也不保证页面安全无漏洞或一定获得排名,它只是传输层的一个条件。
每次查询后,保存三类材料:截图、查询语句原文、以及查询时间。截图要包含查询框和结果区域,不要只截结果标题。如果结果为空,也要截下空结果页面,并记录当时使用的查询语句。
把同一网址在不同时间的记录放在一起,就能看出状态是否变化。例如:
这些记录可以互相印证,也能在后续排查时判断是抓取问题、索引问题还是展示问题。站点地图不保证收录,提交站点地图后仍要用上述方式单独验证每个网址。
复查频率取决于页面重要程度和更新频率。重要页面可以每周或每两周查一次,普通页面可以每月查一次。复查时沿用同一查询语句和同一搜索引擎,避免因口径变化造成误判。
还要把不同来源分开记录:网页搜索、平台推荐、付费广告是不同系统,网页搜索中的收录状态不能直接推断广告或推荐的状态。不同搜索引擎的支持情况须分别核查,不要用一家搜索引擎的结果代替另一家。
下一步,选一个待验证网址,按上面的准备清单写下完整网址和查询语句,完成一次查询并保存截图与时间。之后每次复查都沿用同一份记录格式,证据就能被复查。