Files
SEONexus/docs/2026-04-17-当前阶段总结.md
2026-04-17 17:57:30 +08:00

166 lines
4.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 2026-04-17 当前阶段总结
这份文档用于把本轮关于前端 nginx、搜索页缓存、安全排障、国内蜘蛛恢复的关键结论压缩成一页。
适用场景:
1. 你想快速回顾“现在到底定下了什么”
2. 新的 Codex 会话需要 1 分钟接手
3. 需要把这轮结论转发给同事或运维
## 一句话结论
当前这轮工作已经从“问题排查”进入“规则固化 + 证据补强”阶段:
1. 前端 nginx 长期规则已经定型
2. 搜索页双入口兼容已经确认必要
3. `?__nocache=1` 已作为标准排障入口固定下来
4. `sogou` 恢复已拿到真实深页 `200` 样本,不再只是推测
## 1. 前端 nginx 当前正式规则
当前正式上线入口:
- [/www/wwwroot/diff-maccms/前端站群服务器nginx配置/站点伪静态-最终发布版.txt](/www/wwwroot/diff-maccms/前端站群服务器nginx配置/站点伪静态-最终发布版.txt)
长期规则:
1. 搜索页:
- `/get-index`
- `/get/index`
- cache key 带 `$args`
2. 详情页 / 播放页 / 分类页 / 榜单页:
- cache key 不带 `$args`
3. 所有动态页:
- 支持 `?__nocache=1`
4. 排障优先看:
- `X-Cache-Status`
- `X-Cache-Mode`
- `X-Managed-Spider`
## 2. 为什么搜索页必须双入口兼容
已经确认:
1. `www.jpjdxs.com`
- 搜索入口:`/get-index`
2. `www.jingxifa.com`
- 搜索入口:`/get-index`
3. `www.hyjssb.com`
- 搜索入口:`/get/index`
同时还通过规则探测确认:
1. `/get-index?wd=test`
- 会走 `X-Cache-Mode: with-args`
2. `/get/index?wd=test`
- 如果不单独兼容,仍可能落回 `path-only`
因此:
1. 双兼容不是冗余项
2. 是站群真实路由差异决定的必要项
## 3. 当前最实用的排障规则
以后再遇到“代码像没生效”“页面像串页”“蜘蛛像异常”时,统一按这个顺序:
1. 先看 `X-Cache-Status`
2. 再看 `X-Cache-Mode`
3. 再看 `X-Managed-Spider`
4. 若仍怀疑前端缓存顶旧 HTML
- `?__nocache=1`
5. 如果 `?__nocache=1` 正常,而普通访问异常,优先清前端缓存
## 4. 受管蜘蛛映射当前正确读法
当前需要特别注意:
1. `managed_spiders.map.conf.example`
2. `受管蜘蛛映射-最优方案.txt`
更接近“样例”和“推荐结构”,不是线上实时快照。
所以以后判断某蜘蛛当前是否已纳入 managed spider不要只看样例文件。
正确优先级:
1. 先看线上真实响应头 `X-Managed-Spider`
2. 再看线上真实 `managed_spiders.map.conf`
3. 最后才参考样例文件
## 5. 国内蜘蛛当前阶段判断
### `baiduspider`
1. 恢复结论仍成立
2. 但单个时间窗样本有时很少
3. 不要用某一个小窗口直接否定百度恢复
### `sogou`
当前已不宜再简单说成“还是 403 为主”。
`2026-04-17T17:30:02+08:00` 这个窗口里:
1. 总请求数:`10`
2. `200: 9`
3. `404: 1`
命中的 `200` 深页样本包括:
1. `www.jingxifa.com /video-detail/cheng-shi-jian-ke-190614`
2. `www.vikau.com /vodplay/xiu-zhen-zhe-zhi-fu-qin-de-cai-fu-110943-maotai-36`
3. `www.cnzhenbang.com /category/dong-man`
4. `www.hyjssb.com /movie/.../154180`
唯一 `404` 仍是 `hyjssb` 旧路径残留,不代表当前真实路由异常。
因此当前更准确的说法是:
1. `sogou` 已经进入恢复初期
2. 已拿到真实首页、分类、详情、播放 `200` 样本
3. 历史旧 `403` 仍然会拖累整体统计观感
### `bytespider`
1. 已出现 `200` 样本
2. 但当前主要还是 `robots` / 首页层
3. 还没到像 `sogou` 那样有明显多站深页恢复
## 6. 最新日志读取口径
当前 `domain-spider-crawl` 的 summary 结构已经变更。
旧口径常用字段:
1. `by_bot`
新口径应优先看:
1. `bot_buckets`
2. `summary_status_buckets`
3. `summary_records`
所以如果后续看到:
1. `by_bot` 为空
2. `latest` 看起来像没国内蜘蛛
不要立刻下结论。
先确认:
1. 是否是 summary 字段结构变了
2. 是否需要结合最近几个 run 一起看
## 7. 当前阶段最稳的结论
如果只保留 5 句,当前最稳的是:
1. 正式上线模板优先用 `站点伪静态-最终发布版.txt`
2. 搜索页必须兼容 `/get-index``/get/index`
3. 排障先看响应头,不要先怀疑代码
4. `sogou` 恢复已拿到真实深页 `200` 样本
5. 日志摘要读取已经换字段,不能再只看 `by_bot`