docs(spider): add 1730 domestic bot breakdown

This commit is contained in:
Your Name
2026-04-17 17:56:33 +08:00
parent db249204fb
commit b49d67df52

View File

@@ -170,6 +170,75 @@
2. 需要结合最近几个 run 一起看 2. 需要结合最近几个 run 一起看
3. 读取 summary 时,优先按新结构字段解析,不要再只认 `by_bot` 3. 读取 summary 时,优先按新结构字段解析,不要再只认 `by_bot`
### 2.4 `17:30` 窗口国内蜘蛛明细补充
`2026-04-17T17:30:02+08:00` 这个窗口继续下钻后,国内蜘蛛样本可以直接拆成下面这样:
#### `sogou`
1. 总请求数:`10`
2. 状态分布:
- `200: 9`
- `404: 1`
3. 页面类型:
- `home: 4`
- `category: 2`
- `detail: 2`
- `play: 1`
- `other: 1`
命中的代表样本:
1. `www.jingxifa.com /video-detail/cheng-shi-jian-ke-190614 => 200`
2. `www.vikau.com /vodplay/xiu-zhen-zhe-zhi-fu-qin-de-cai-fu-110943-maotai-36 => 200`
3. `www.cnzhenbang.com /category/dong-man => 200`
4. `www.hyjssb.com /movie/yi-gua-ding-qing-yuan-ye-ya-tou-jin-cheng-bei-tuan-chong/154180 => 200`
5. `www.hyjssb.com /genres/dian-ying/home => 200`
唯一的 `404`
1. `www.hyjssb.com /shipinfenlei-dian-ying/shao-shi-dian-ying-2012-all-all/all-page1`
这个 `404` 与前面结论一致:
1. 它是旧路径残留
2. 不代表当前真实分类路由仍被前端拦截
#### `bytespider`
1. 总请求数:`6`
2. 状态分布:
- `200: 4`
- `301: 1`
- `403: 1`
3. 主要页面类型:
- `robots: 5`
- `home: 1`
代表样本:
1. `www.lgyz.net /robots.txt => 200`
2. `www.jpjdxs.com /robots.txt => 200`
3. `www.oronorent.com /robots.txt => 200`
4. `www.lgyz.net / => 200`
当前更像:
1. 字节系开始有可通样本
2. 但整体仍主要集中在 `robots`
3. 还没到像 `sogou` 那样明显进入深页恢复阶段
#### `baiduspider`
1. 当前窗口样本数:`1`
2. `www.sdxtwnc.com / => 200`
说明:
1. 这个窗口里百度样本偏少
2. 不能单独用这一窗否定百度恢复
3. 百度恢复判断仍应结合前面更长时间段和线上复测一起看
## 3. 已验证通过的站点 ## 3. 已验证通过的站点
当前已人工复测通过的代表站点: 当前已人工复测通过的代表站点: