diff --git a/docs/2026-04-17-spider-nginx-运维摘要.md b/docs/2026-04-17-spider-nginx-运维摘要.md index 75816d2..955d14a 100644 --- a/docs/2026-04-17-spider-nginx-运维摘要.md +++ b/docs/2026-04-17-spider-nginx-运维摘要.md @@ -339,6 +339,30 @@ 4. 且实时响应头里仍是 `X-Managed-Spider: normal` 5. 所以更像“部分可通、尚未进入受管蜘蛛深页恢复阶段” +#### 再补一条更硬的结论 + +继续扫当天所有 run 后,`bytespider` 的非 `robots` 样本只有 `5` 条: + +1. `www.hyjssb.com /news_detail1/newsId=51.html => 444` +2. `vikau.com / => 444` +3. `www.nblssy.com / => 301` +4. `visitsumenep.com / => 444` +5. `www.lgyz.net / => 200` + +同时按路径启发式继续筛查: + +1. 没扫到任何稳定的详情页样本 +2. 没扫到任何稳定的播放页样本 +3. 没扫到任何稳定的分类页样本 + +所以当前可以更明确地说: + +1. `bytespider` 现在还没有进入像 `sogou` 那样的深页恢复阶段 +2. 当前观察重点仍应放在: + - `robots.txt` + - 首页 +3. 如果后续字节系要重点推进,应继续观察它是否开始出现真实详情 / 播放 / 分类 `200` + ## 3. 已验证通过的站点 当前已人工复测通过的代表站点: