Files
SEONexus/docs/2026-04-17-spider-nginx-运维摘要.md
2026-04-17 17:53:57 +08:00

8.3 KiB
Raw Blame History

2026-04-17 Spider / Nginx 运维摘要

接手前必读 5 条

任何新的 Codex / 运维 / 人工接手这一段工作前,先遵守这 5 条:

  1. 先看当前线上复测,再看历史日志
  2. 先确认真实路由,再判断是否还存在问题
  3. 前端排障先看 X-Cache-Status / X-Cache-Mode / X-Managed-Spider
  4. 不要把旧路径残留误判成前端蜘蛛拦截
  5. 如果需要完整证据链,再去看: 1270-SEONexus-Codex多版本协作交接总文档.md

1. 当前结论

截至 2026-04-17 晚间,这轮前端 nginx 优化已经从“问题排查期”进入“效果验证期”。

当前更准确的整体判断:

  1. baiduspider
    • 恢复最好
    • 首页、详情、播放均已有稳定 200 样本
  2. sogou
    • 正在恢复初期
    • 历史累计仍有较多 403
    • 但最新窗口已出现多个真实 200 深页样本
  3. bytespider
    • 目前仍主要停留在 robots
    • 当前实测 robots.txt 已基本可通
    • 但暂未进入 managed spider 标签链

2. 当前长期标准方案

前端 nginx 当前建议统一采用:

核心规则:

  1. 搜索页 /get-index/get/index 或对应搜索入口
    • cache key 带 $args
  2. 详情页 / 播放页 / 分类页 / 榜单页
    • cache key 不带 $args
  3. 所有动态页支持:
    • ?__nocache=1
  4. 排障优先顺序:
    • 先看 X-Cache-Status
    • 再看 X-Cache-Mode
    • 最后再决定是否需要清前端缓存

2.1 2026-04-17 晚间抽测补充

新增线上抽测结果:

  1. www.jpjdxs.com 详情页、播放页
    • 200
    • X-Cache-Status: STALE
    • X-Cache-Mode: path-only
    • X-Managed-Spider: managed
  2. www.lgyz.net 详情页
    • 200
    • X-Cache-Status: STALE
    • X-Cache-Mode: path-only
    • X-Managed-Spider: managed
  3. www.glae.cc 首页Baiduspider
    • 200
    • X-Cache-Status: STALE
    • X-Managed-Spider: managed
  4. www.hyjssb.com 搜索页 /get/index?wd=test
    • 200
    • X-Cache-Status: MISS
    • X-Cache-Mode: path-only
    • X-Managed-Spider: managed
  5. www.hyjssb.com 搜索页 /get/index?wd=cachetest&__nocache=1
    • 200
    • X-Cache-Status: BYPASS
    • X-Cache-Mode: bypass
    • X-Cache-Bypass: 1

这一轮最重要的新结论:

  1. 当前“受管蜘蛛放行 + 动态页缓存安全版”总体仍然生效
  2. 但搜索页规则不能只匹配 /get-index
  3. 至少部分站点真实搜索入口是 /get/index
  4. 如果 nginx 只写 /get-index,这类站点搜索页仍会误走 path-only

2.2 搜索入口批量识别补充

补充做了一轮站点级搜索入口识别,当前得到的结论如下:

已明确识别到真实入口

  1. www.jpjdxs.com
    • 首页直接识别到:/get-index
  2. www.jingxifa.com
    • 首页直接识别到:/get-index
  3. www.hyjssb.com
    • 首页直接识别到:/get/index

首页未直接露出入口,但规则探测结果明确

下列站点对两个候选路径做了头部探测:

  1. www.lgyz.net
  2. www.glae.cc
  3. www.lcdchq.com
  4. www.oronorent.com
  5. www.cnzhenbang.com
  6. www.vikau.com

共同现象:

  1. 访问 /get-index?wd=test
    • 返回 404
    • X-Cache-Mode: with-args
  2. 访问 /get/index?wd=test
    • 返回 404
    • X-Cache-Mode: path-only

这个结果说明:

  1. 当前前端模板已经把 /get-index 识别成“搜索页规则”
  2. 没补兼容时,/get/index 仍会落回普通动态页规则
  3. 所以正式模板同时兼容 /get-index/get/index 是必要项,不是冗余项

3. 已验证通过的站点

当前已人工复测通过的代表站点:

  1. www.jpjdxs.com
  2. www.lgyz.net
  3. www.lcdchq.com
  4. www.oronorent.com
  5. www.glae.cc
  6. www.cnzhenbang.com
  7. www.jingxifa.com
  8. www.vikau.com
  9. www.hyjssb.com

这些站点已验证到以下至少一项或多项:

  1. 首页 200
  2. Sogou 首页 200
  3. 真实详情页 / 播放页 / 分类页 200
  4. ?__nocache=1 绕缓存正常
  5. X-Managed-Spider / X-Cache-Mode / X-Cache-Status 头部符合预期

4. 需要特别记住的误判点

4.1 不要把旧日志直接当成当前状态

历史 run 中的大量:

  1. sogou 403
  2. bytespider 403/444
  3. 某些 301

很多已经被当前线上复测推翻。

因此规则是:

  1. 先看历史日志趋势
  2. 再用真实 URL + 真实 UA 做当前线上复测
  3. 以“当前线上复测”作为最终判断依据

4.2 不要把旧路径残留误判为前端拦截

典型案例:

  1. hyjssb
    • 历史日志里的旧路径:
      • /shipinfenlei-...
    • 当前真实路由已经变成:
      • /genres/...
      • /movie/...
    • 因此旧路径 404 不代表当前蜘蛛拦截

5. 当前最有价值的阶段性判断

5.1 sogou

历史大盘仍难看,但最新窗口已出现真实恢复样本:

  1. www.jpjdxs.com
    • /robots.txt => 200
    • / => 200
    • 真实详情页 200
    • 真实播放页 200
  2. www.lgyz.net
    • 真实详情页 200
  3. www.lcdchq.com
    • 真实详情页 200
  4. www.oronorent.com
    • 真实详情页 200

结论:

  1. sogou 正在从旧的 403 状态切换到新规则生效后的 200
  2. 当前处于恢复初期,旧日志权重仍然偏高

5.2 bytespider

当前判断:

  1. 尚未明显进入 managed spider 映射链
  2. 但当前复测的 robots.txt 已基本可通
  3. 不是当前主矛盾

如果后续要主动加强字节系抓取,再考虑把 bytespider 纳入 managed spider 映射。

6. 后续执行建议

优先级 A

继续观察下一轮蜘蛛日志,重点看:

  1. sogou 200 是否继续增加
  2. sogou 403 是否自然下降
  3. 是否开始出现更多 detail / play / category 的正向样本

优先级 B

如果某个站又在日志里报异常,排障顺序统一为:

  1. 先确认是不是旧路径残留
  2. 再确认当前真实路由
  3. 再用真实 UA 线上复测
  4. 最后才判断是否需要改 nginx 或后端

优先级 C

只有在明确要做字节系 SEO 时,才考虑:

  1. bytespider 纳入 managed spider 映射
  2. 再观察其 robots/home 命中变化

7. 常用复测命令

后续人工或新的 Codex 接手时,优先直接用下面这些命令做快速验证。

7.1 看普通访问是否仍被前端缓存命中

curl -I -s 'https://你的域名/真实详情或播放页'

重点看:

  1. X-Cache-Status
  2. X-Cache-Mode
  3. X-Managed-Spider

7.2 强制绕过前端缓存看最新真实输出

curl -I -s 'https://你的域名/真实详情或播放页?__nocache=1'

期望看到:

  1. X-Cache-Status: BYPASS
  2. X-Cache-Mode: bypass
  3. X-Cache-Bypass: 1

7.3 测 Sogou 是否已进入放行链

curl -I -s \
  -A 'Sogou web spider/4.0(+http://www.sogou.com/docs/help/webmasters.htm#07)' \
  'https://你的域名/真实首页或深页'

重点看:

  1. HTTP 状态是否为 200
  2. X-Managed-Spider 是否为 managed

7.4 测 Baiduspider 是否已正常命中

curl -I -s \
  -A 'Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)' \
  'https://你的域名/真实首页或深页'

7.5 测 Bytespider

curl -I -s \
  -A 'Mozilla/5.0 (compatible; Bytespider; +http://spider.bytedance.com/)' \
  'https://你的域名/robots.txt'

当前预期:

  1. 多数站 robots.txt 已能拿到 200
  2. X-Managed-Spider 可能仍为 normal

7.6 看首页里当前真实路由模式

curl -s 'https://你的域名/' | rg -o 'href=["'\"'\"']/[^"'\"'\"']+' | head -n 80

用途:

  1. 快速确认当前站是真实使用 /movie/.../neirong-.../shipin/... 还是别的路由族
  2. 避免把旧日志路径当成当前真实路径

8. 长文档入口

完整细节、样本、时间线、实测证据统一在:

建议后续接手顺序:

  1. 先读本摘要
  2. 再按需要跳转 1270 查看详细证据