docs(spider): note latest summary field format change
This commit is contained in:
@@ -123,6 +123,53 @@
|
|||||||
2. 没补兼容时,`/get/index` 仍会落回普通动态页规则
|
2. 没补兼容时,`/get/index` 仍会落回普通动态页规则
|
||||||
3. 所以正式模板同时兼容 `/get-index` 和 `/get/index` 是必要项,不是冗余项
|
3. 所以正式模板同时兼容 `/get-index` 和 `/get/index` 是必要项,不是冗余项
|
||||||
|
|
||||||
|
### 2.3 最新日志窗口读取口径补充
|
||||||
|
|
||||||
|
`domain-spider-crawl` 这批 summary 文件当前已经出现结构切换:
|
||||||
|
|
||||||
|
1. 旧口径常看 `by_bot`
|
||||||
|
2. 新口径改成:
|
||||||
|
- `bot_buckets`
|
||||||
|
- `summary_status_buckets`
|
||||||
|
- `summary_records`
|
||||||
|
|
||||||
|
因此后续如果直接按旧脚本读取 `by_bot`,很容易误判成:
|
||||||
|
|
||||||
|
1. `latest` 没数据
|
||||||
|
2. `baiduspider / sogou / bytespider` 当天都是 0
|
||||||
|
|
||||||
|
这不一定是真的“没有样本”,而可能只是读取字段错了。
|
||||||
|
|
||||||
|
#### 当前已确认的最近窗口
|
||||||
|
|
||||||
|
1. `2026-04-17T17:30:02+08:00`
|
||||||
|
- `googlebot: 34`
|
||||||
|
- `sogou: 10`
|
||||||
|
- `bytespider: 6`
|
||||||
|
- `bingbot: 4`
|
||||||
|
- `baiduspider: 1`
|
||||||
|
- 状态桶:
|
||||||
|
- `444: 38`
|
||||||
|
- `200: 14`
|
||||||
|
- `301: 1`
|
||||||
|
- `403: 1`
|
||||||
|
- `404: 1`
|
||||||
|
2. `2026-04-17T17:50:02+08:00`
|
||||||
|
- 这波窗口又明显偏向:
|
||||||
|
- `googlebot: 33`
|
||||||
|
- `bingbot: 1`
|
||||||
|
- `bytespider: 1`
|
||||||
|
- `baiduspider: 1`
|
||||||
|
- 状态桶:
|
||||||
|
- `444: 35`
|
||||||
|
- `200: 1`
|
||||||
|
|
||||||
|
#### 当前结论
|
||||||
|
|
||||||
|
1. `latest` 仍然不能机械地当成“国内蜘蛛当前总貌”
|
||||||
|
2. 需要结合最近几个 run 一起看
|
||||||
|
3. 读取 summary 时,优先按新结构字段解析,不要再只认 `by_bot`
|
||||||
|
|
||||||
## 3. 已验证通过的站点
|
## 3. 已验证通过的站点
|
||||||
|
|
||||||
当前已人工复测通过的代表站点:
|
当前已人工复测通过的代表站点:
|
||||||
|
|||||||
Reference in New Issue
Block a user