要判断一篇新闻稿是否被百度新闻收录,不能只看搜索结果里有没有出现标题。可复查的状态证据应当满足三个条件:有明确的查询时间、有可重复的查询方式、有能保存下来的结果截图或原始数据。对时间和人手有限的团队,最先要做的不是反复提交,而是建立一份最小记录表,把每次观察固定下来,再决定是否处理。
百度新闻收录涉及的状态至少有三层,混在一起会导致判断错误。
三者不是递进保证关系。被抓取不等于被索引,被索引不等于进入新闻展示。记录时必须写清楚观察到的是哪一层,否则复查时无法对照。
建议用一张表记录,每行对应一次检查。字段至少包括:检查日期与具体时间、页面完整URL、查询方式(站内搜索、新闻搜索、普通网页搜索)、查询词、结果状态、截图文件名或日志行号。
查询方式必须写具体。例如“在百度新闻搜索框输入完整标题”和“在普通网页搜索输入完整标题”是两种不同证据,不能合并成“搜了一下”。截图要保留浏览器地址栏和查询时间,或者同时保存页面源码中的相关片段。
如果使用服务器日志,记录日志文件路径和该URL对应的状态码、蜘蛛标识、访问时间。日志证据能说明抓取,但不能单独证明索引状态。
观察:在固定时间点检查目标URL。优先用完整标题加站点名称作为查询词,减少同名内容干扰。把结果页截图保存,命名规则建议为“日期-URL简称-查询方式”。
判断:对照记录表看变化。如果连续多次检查都没有出现,且日志中也没有百度蜘蛛访问记录,问题可能出在抓取入口;如果日志有访问但搜索无结果,问题可能在索引或内容质量层面。这里只能说“可能”,不能凭一次现象断定唯一原因。
处理:按可能性从高到低安排。先检查robots.txt是否误屏蔽了相关路径,再检查页面是否返回正常状态码、是否有可抓取的正文。需要说明的是,robots.txt的抓取限制不等于可靠的索引移除;它主要约束抓取行为,不能当作删除已索引内容的保证手段。站点地图可以帮助发现URL,但不保证收录。
复查:处理后在下一个固定时间点重复同样的查询方式和查询词。复查的价值在于对比,而不是重新搜一次就算完成。如果查询方式变了,前后证据不可比。
假设只有半小时,建议按以下顺序做:
这个顺序的理由是:前两项能快速排除明显的技术阻断,成本低;后三项产生可复查证据,为后续判断提供基线。不要一上来就反复提交或修改内容,没有基线记录时,改动前后无法归因。
HTTPS不保证安全无漏洞,也不保证排名或收录。不同搜索引擎对新闻内容的支持情况须分别核查,百度新闻收录的判断方法不能直接套用到其他引擎。新闻类内容有时效性,过期后展示状态可能变化,因此记录表要保留每次检查的时间戳。
如果页面本身不是新闻体裁,却期望进入新闻展示,证据收集再完整也无法改变内容类型不匹配的问题。此时应先确认内容是否符合新闻收录的基本范围,再决定是否继续投入排查时间。
下一步:打开你的记录表,为当前待检查的URL补上第一次基线记录,包括查询时间、查询方式、结果截图和日志行号,然后设定下一次复查的具体时间。