Files
SEONexus/docs/2026-04-17-当前阶段总结.md
2026-04-17 17:57:30 +08:00

4.3 KiB
Raw Blame History

2026-04-17 当前阶段总结

这份文档用于把本轮关于前端 nginx、搜索页缓存、安全排障、国内蜘蛛恢复的关键结论压缩成一页。

适用场景:

  1. 你想快速回顾“现在到底定下了什么”
  2. 新的 Codex 会话需要 1 分钟接手
  3. 需要把这轮结论转发给同事或运维

一句话结论

当前这轮工作已经从“问题排查”进入“规则固化 + 证据补强”阶段:

  1. 前端 nginx 长期规则已经定型
  2. 搜索页双入口兼容已经确认必要
  3. ?__nocache=1 已作为标准排障入口固定下来
  4. sogou 恢复已拿到真实深页 200 样本,不再只是推测

1. 前端 nginx 当前正式规则

当前正式上线入口:

长期规则:

  1. 搜索页:
    • /get-index
    • /get/index
    • cache key 带 $args
  2. 详情页 / 播放页 / 分类页 / 榜单页:
    • cache key 不带 $args
  3. 所有动态页:
    • 支持 ?__nocache=1
  4. 排障优先看:
    • X-Cache-Status
    • X-Cache-Mode
    • X-Managed-Spider

2. 为什么搜索页必须双入口兼容

已经确认:

  1. www.jpjdxs.com
    • 搜索入口:/get-index
  2. www.jingxifa.com
    • 搜索入口:/get-index
  3. www.hyjssb.com
    • 搜索入口:/get/index

同时还通过规则探测确认:

  1. /get-index?wd=test
    • 会走 X-Cache-Mode: with-args
  2. /get/index?wd=test
    • 如果不单独兼容,仍可能落回 path-only

因此:

  1. 双兼容不是冗余项
  2. 是站群真实路由差异决定的必要项

3. 当前最实用的排障规则

以后再遇到“代码像没生效”“页面像串页”“蜘蛛像异常”时,统一按这个顺序:

  1. 先看 X-Cache-Status
  2. 再看 X-Cache-Mode
  3. 再看 X-Managed-Spider
  4. 若仍怀疑前端缓存顶旧 HTML
    • ?__nocache=1
  5. 如果 ?__nocache=1 正常,而普通访问异常,优先清前端缓存

4. 受管蜘蛛映射当前正确读法

当前需要特别注意:

  1. managed_spiders.map.conf.example
  2. 受管蜘蛛映射-最优方案.txt

更接近“样例”和“推荐结构”,不是线上实时快照。

所以以后判断某蜘蛛当前是否已纳入 managed spider不要只看样例文件。

正确优先级:

  1. 先看线上真实响应头 X-Managed-Spider
  2. 再看线上真实 managed_spiders.map.conf
  3. 最后才参考样例文件

5. 国内蜘蛛当前阶段判断

baiduspider

  1. 恢复结论仍成立
  2. 但单个时间窗样本有时很少
  3. 不要用某一个小窗口直接否定百度恢复

sogou

当前已不宜再简单说成“还是 403 为主”。

2026-04-17T17:30:02+08:00 这个窗口里:

  1. 总请求数:10
  2. 200: 9
  3. 404: 1

命中的 200 深页样本包括:

  1. www.jingxifa.com /video-detail/cheng-shi-jian-ke-190614
  2. www.vikau.com /vodplay/xiu-zhen-zhe-zhi-fu-qin-de-cai-fu-110943-maotai-36
  3. www.cnzhenbang.com /category/dong-man
  4. www.hyjssb.com /movie/.../154180

唯一 404 仍是 hyjssb 旧路径残留,不代表当前真实路由异常。

因此当前更准确的说法是:

  1. sogou 已经进入恢复初期
  2. 已拿到真实首页、分类、详情、播放 200 样本
  3. 历史旧 403 仍然会拖累整体统计观感

bytespider

  1. 已出现 200 样本
  2. 但当前主要还是 robots / 首页层
  3. 还没到像 sogou 那样有明显多站深页恢复

6. 最新日志读取口径

当前 domain-spider-crawl 的 summary 结构已经变更。

旧口径常用字段:

  1. by_bot

新口径应优先看:

  1. bot_buckets
  2. summary_status_buckets
  3. summary_records

所以如果后续看到:

  1. by_bot 为空
  2. latest 看起来像没国内蜘蛛

不要立刻下结论。

先确认:

  1. 是否是 summary 字段结构变了
  2. 是否需要结合最近几个 run 一起看

7. 当前阶段最稳的结论

如果只保留 5 句,当前最稳的是:

  1. 正式上线模板优先用 站点伪静态-最终发布版.txt
  2. 搜索页必须兼容 /get-index/get/index
  3. 排障先看响应头,不要先怀疑代码
  4. sogou 恢复已拿到真实深页 200 样本
  5. 日志摘要读取已经换字段,不能再只看 by_bot