批量索引问题不要逐条打开页面查看,而应先用可复核的分组字段把全量URL拆成若干层,再从每层抽取固定数量样本做索引查询,最后只对异常率明显偏高的层做全量复核。抽样定位的目标不是算出精确的收录率,而是用尽量少的查询次数找到问题集中在哪一类URL上,让后续修复有明确范围。
随机抽样适合估计整体收录比例,但不适合定位原因。要定位批量问题,抽样必须按可能影响索引的字段分层。常用的分层字段包括:
如果团队对问题已有猜测,比如怀疑是分页或筛选参数导致,就把该维度作为第一分层字段;如果没有猜测,先用目录层级分层,再叠加是否提交站点地图。分层字段应当是能从URL或页面模板直接判断的,不依赖主观判断,否则多人协作时每个人分出的层会不一致。
每个分层抽5到10条URL通常就足以看出方向。样本量太小,比如每层只抽1条,一条偶然未收录就会让整层被误判;样本量太大,又失去抽样的意义。具体可按下面的步骤执行:
这里要区分“未收录”和“抓取被限制”。robots.txt 的抓取限制不等于可靠的索引移除:被限制抓取的URL可能仍以其他方式出现在索引中,也可能因为无法抓取而长期不收录。所以样本记录里应把“robots限制”“已抓取未索引”“未抓取”“已收录”分开,不要合并成一个失败数。
假设某站有四个分层,每层抽10条,结果如下(此为假设示例,仅用于说明判断方式):
此时优先复核分页和标签页,而不是先处理详情页。复核时把该层全部URL做一次批量查询,确认异常是否稳定存在。如果全量复核后异常比例仍然很高,就可以把问题范围缩小到该模板的抓取或索引环节;如果全量复核后异常比例大幅下降,说明样本偏差较大,需要重新抽样。
判断结果时还要注意一个前提:抽样只能说明样本所在层的表现,不能直接推断全站收录率。站点地图不保证收录,提交了站点地图的层也可能大量未收录;HTTPS 也不保证页面一定被索引。因此分层结论要写成“某层样本中未收录比例偏高,建议全量复核”,而不是“某层全部未收录”。
抽样定位要减少返工,关键是让接手的人能复现同样的分层和抽样结果。交付物至少应包含:全量URL清单及分层字段、每层抽样规则、样本查询记录、按层汇总的异常比例、下一步复核范围。查询记录里写清查询时间,因为索引状态会变化,不同时间查同一批URL结果可能不同。
验收信号可以设为三条:
如果抽样后各层异常比例接近,没有明显集中的层,说明问题可能不在URL分层字段上,这时应换一个维度重新分层,例如按页面模板版本或内链入口数量,而不是继续加大样本量。
下一步:从当前全量URL清单中选一个分层字段,按每层5到10条抽一轮样本,把查询结果填进同一张表,再决定哪一层进入全量复核。