diff --git a/docs/2026-04-17-spider-nginx-运维摘要.md b/docs/2026-04-17-spider-nginx-运维摘要.md index 95899ac..6524a04 100644 --- a/docs/2026-04-17-spider-nginx-运维摘要.md +++ b/docs/2026-04-17-spider-nginx-运维摘要.md @@ -170,6 +170,75 @@ 2. 需要结合最近几个 run 一起看 3. 读取 summary 时,优先按新结构字段解析,不要再只认 `by_bot` +### 2.4 `17:30` 窗口国内蜘蛛明细补充 + +对 `2026-04-17T17:30:02+08:00` 这个窗口继续下钻后,国内蜘蛛样本可以直接拆成下面这样: + +#### `sogou` + +1. 总请求数:`10` +2. 状态分布: + - `200: 9` + - `404: 1` +3. 页面类型: + - `home: 4` + - `category: 2` + - `detail: 2` + - `play: 1` + - `other: 1` + +命中的代表样本: + +1. `www.jingxifa.com /video-detail/cheng-shi-jian-ke-190614 => 200` +2. `www.vikau.com /vodplay/xiu-zhen-zhe-zhi-fu-qin-de-cai-fu-110943-maotai-36 => 200` +3. `www.cnzhenbang.com /category/dong-man => 200` +4. `www.hyjssb.com /movie/yi-gua-ding-qing-yuan-ye-ya-tou-jin-cheng-bei-tuan-chong/154180 => 200` +5. `www.hyjssb.com /genres/dian-ying/home => 200` + +唯一的 `404`: + +1. `www.hyjssb.com /shipinfenlei-dian-ying/shao-shi-dian-ying-2012-all-all/all-page1` + +这个 `404` 与前面结论一致: + +1. 它是旧路径残留 +2. 不代表当前真实分类路由仍被前端拦截 + +#### `bytespider` + +1. 总请求数:`6` +2. 状态分布: + - `200: 4` + - `301: 1` + - `403: 1` +3. 主要页面类型: + - `robots: 5` + - `home: 1` + +代表样本: + +1. `www.lgyz.net /robots.txt => 200` +2. `www.jpjdxs.com /robots.txt => 200` +3. `www.oronorent.com /robots.txt => 200` +4. `www.lgyz.net / => 200` + +当前更像: + +1. 字节系开始有可通样本 +2. 但整体仍主要集中在 `robots` +3. 还没到像 `sogou` 那样明显进入深页恢复阶段 + +#### `baiduspider` + +1. 当前窗口样本数:`1` +2. `www.sdxtwnc.com / => 200` + +说明: + +1. 这个窗口里百度样本偏少 +2. 不能单独用这一窗否定百度恢复 +3. 百度恢复判断仍应结合前面更长时间段和线上复测一起看 + ## 3. 已验证通过的站点 当前已人工复测通过的代表站点: