# 2026-04-17 当前阶段总结 这份文档用于把本轮关于前端 nginx、搜索页缓存、安全排障、国内蜘蛛恢复的关键结论压缩成一页。 适用场景: 1. 你想快速回顾“现在到底定下了什么” 2. 新的 Codex 会话需要 1 分钟接手 3. 需要把这轮结论转发给同事或运维 ## 一句话结论 当前这轮工作已经从“问题排查”进入“规则固化 + 证据补强”阶段: 1. 前端 nginx 长期规则已经定型 2. 搜索页双入口兼容已经确认必要 3. `?__nocache=1` 已作为标准排障入口固定下来 4. `sogou` 恢复已拿到真实深页 `200` 样本,不再只是推测 ## 1. 前端 nginx 当前正式规则 当前正式上线入口: - [/www/wwwroot/diff-maccms/前端站群服务器nginx配置/站点伪静态-最终发布版.txt](/www/wwwroot/diff-maccms/前端站群服务器nginx配置/站点伪静态-最终发布版.txt) 长期规则: 1. 搜索页: - `/get-index` - `/get/index` - cache key 带 `$args` 2. 详情页 / 播放页 / 分类页 / 榜单页: - cache key 不带 `$args` 3. 所有动态页: - 支持 `?__nocache=1` 4. 排障优先看: - `X-Cache-Status` - `X-Cache-Mode` - `X-Managed-Spider` ## 2. 为什么搜索页必须双入口兼容 已经确认: 1. `www.jpjdxs.com` - 搜索入口:`/get-index` 2. `www.jingxifa.com` - 搜索入口:`/get-index` 3. `www.hyjssb.com` - 搜索入口:`/get/index` 同时还通过规则探测确认: 1. `/get-index?wd=test` - 会走 `X-Cache-Mode: with-args` 2. `/get/index?wd=test` - 如果不单独兼容,仍可能落回 `path-only` 因此: 1. 双兼容不是冗余项 2. 是站群真实路由差异决定的必要项 ## 3. 当前最实用的排障规则 以后再遇到“代码像没生效”“页面像串页”“蜘蛛像异常”时,统一按这个顺序: 1. 先看 `X-Cache-Status` 2. 再看 `X-Cache-Mode` 3. 再看 `X-Managed-Spider` 4. 若仍怀疑前端缓存顶旧 HTML,用: - `?__nocache=1` 5. 如果 `?__nocache=1` 正常,而普通访问异常,优先清前端缓存 ## 4. 受管蜘蛛映射当前正确读法 当前需要特别注意: 1. `managed_spiders.map.conf.example` 2. `受管蜘蛛映射-最优方案.txt` 更接近“样例”和“推荐结构”,不是线上实时快照。 所以以后判断某蜘蛛当前是否已纳入 managed spider,不要只看样例文件。 正确优先级: 1. 先看线上真实响应头 `X-Managed-Spider` 2. 再看线上真实 `managed_spiders.map.conf` 3. 最后才参考样例文件 ## 5. 国内蜘蛛当前阶段判断 ### `baiduspider` 1. 恢复结论仍成立 2. 但单个时间窗样本有时很少 3. 不要用某一个小窗口直接否定百度恢复 ### `sogou` 当前已不宜再简单说成“还是 403 为主”。 `2026-04-17T17:30:02+08:00` 这个窗口里: 1. 总请求数:`10` 2. `200: 9` 3. `404: 1` 命中的 `200` 深页样本包括: 1. `www.jingxifa.com /video-detail/cheng-shi-jian-ke-190614` 2. `www.vikau.com /vodplay/xiu-zhen-zhe-zhi-fu-qin-de-cai-fu-110943-maotai-36` 3. `www.cnzhenbang.com /category/dong-man` 4. `www.hyjssb.com /movie/.../154180` 唯一 `404` 仍是 `hyjssb` 旧路径残留,不代表当前真实路由异常。 因此当前更准确的说法是: 1. `sogou` 已经进入恢复初期 2. 已拿到真实首页、分类、详情、播放 `200` 样本 3. 历史旧 `403` 仍然会拖累整体统计观感 ### `bytespider` 1. 已出现 `200` 样本 2. 但当前主要还是 `robots` / 首页层 3. 还没到像 `sogou` 那样有明显多站深页恢复 ## 6. 最新日志读取口径 当前 `domain-spider-crawl` 的 summary 结构已经变更。 旧口径常用字段: 1. `by_bot` 新口径应优先看: 1. `bot_buckets` 2. `summary_status_buckets` 3. `summary_records` 所以如果后续看到: 1. `by_bot` 为空 2. `latest` 看起来像没国内蜘蛛 不要立刻下结论。 先确认: 1. 是否是 summary 字段结构变了 2. 是否需要结合最近几个 run 一起看 ## 7. 当前阶段最稳的结论 如果只保留 5 句,当前最稳的是: 1. 正式上线模板优先用 `站点伪静态-最终发布版.txt` 2. 搜索页必须兼容 `/get-index` 和 `/get/index` 3. 排障先看响应头,不要先怀疑代码 4. `sogou` 恢复已拿到真实深页 `200` 样本 5. 日志摘要读取已经换字段,不能再只看 `by_bot`