docs(spider): confirm bytespider lacks deep page samples
This commit is contained in:
@@ -339,6 +339,30 @@
|
||||
4. 且实时响应头里仍是 `X-Managed-Spider: normal`
|
||||
5. 所以更像“部分可通、尚未进入受管蜘蛛深页恢复阶段”
|
||||
|
||||
#### 再补一条更硬的结论
|
||||
|
||||
继续扫当天所有 run 后,`bytespider` 的非 `robots` 样本只有 `5` 条:
|
||||
|
||||
1. `www.hyjssb.com /news_detail1/newsId=51.html => 444`
|
||||
2. `vikau.com / => 444`
|
||||
3. `www.nblssy.com / => 301`
|
||||
4. `visitsumenep.com / => 444`
|
||||
5. `www.lgyz.net / => 200`
|
||||
|
||||
同时按路径启发式继续筛查:
|
||||
|
||||
1. 没扫到任何稳定的详情页样本
|
||||
2. 没扫到任何稳定的播放页样本
|
||||
3. 没扫到任何稳定的分类页样本
|
||||
|
||||
所以当前可以更明确地说:
|
||||
|
||||
1. `bytespider` 现在还没有进入像 `sogou` 那样的深页恢复阶段
|
||||
2. 当前观察重点仍应放在:
|
||||
- `robots.txt`
|
||||
- 首页
|
||||
3. 如果后续字节系要重点推进,应继续观察它是否开始出现真实详情 / 播放 / 分类 `200`
|
||||
|
||||
## 3. 已验证通过的站点
|
||||
|
||||
当前已人工复测通过的代表站点:
|
||||
|
||||
Reference in New Issue
Block a user