# 1299-SEONexus 老模板最新蜘蛛日志实战分析 - 2026-04-17 ## 目的 这份文档只服务老模板 `1001-1005` 的 SEO 主线。 目标不是泛泛而谈“蜘蛛有波动”,而是把 `2026-04-17` 当前仓库内最新的 spider workbench 聚合数据,直接翻译成主 Codex 可执行的判断。 明确边界: - 只看老模板:`videoDadi / videoDingZhu / videoBoKu / videoLaoNiu / videoNuNu` - 不把 `videoGpt1` 混进本轮结论 - 当前重点是百度主线,同时兼看 `bytespider / sogou` --- ## 一、数据来源 本轮结论不能只看单个 `latest` 文件,而要分两层理解: 1. 最近一次 push 摘要 - `code/storage/domain-spider-crawl/latest/spider-crawl.summary.json` - `code/storage/domain-spider-crawl/latest/spider-crawl.summary.html` 2. 工作台 24h 聚合逻辑 - `code/app/common/helper/DomainSpiderCrawlWorkbenchHelper.php` - 通过 `buildSummary(...)` 聚合最近窗口内多次 run 这里要特别提醒后续主 Codex: - `latest/spider-crawl.summary.json` 会被 `SeoCollector::saveCrawlLogs()` 每次新 push 直接覆盖 - 它代表“最近一次 push 摘要” - 不天然等于“最近 24h 全局聚合” `2026-04-17 20:30` 复核时就已经看到这个现象: - `latest` 文件只剩一小批最近推送数据 - 但 workbench 24h 聚合后,老模板依然有连续深抓记录 所以本页正文以下结论,统一以 `WorkbenchHelper::buildSummary(..., windowHours=24, selectedBots=baiduspider,bytespider,sogou)` 为准。 --- ## 二、当前全局结论 当前这批老模板域名,按 `2026-04-17 20:30` 的 24h 聚合视角,蜘蛛数据呈现出 4 个非常明确的信号: 1. 已经有百度深抓样本 - 不是“完全没抓” - 已经出现 `detail / play` 命中 2. 入口层仍然偏弱 - `robots_requests = 11` - `sitemap_requests = 2` - `category_requests = 1` 3. 当前异常主因不是 5xx - `500 = 0` - 主要是 `301 / 403 / 444` 4. 当前最该处理的是“入口质量”和“旧路由信号” - 不是把老模板误判成 GPT 模板结构问题 工作台聚合概览: - 总请求:`72` - 域名数:`14` - 蜘蛛数:`2` - 首页请求:`33` - 分类请求:`1` - 详情请求:`21` - 播放请求:`4` - robots 请求:`11` - sitemap 请求:`2` - 状态分布: - `200 = 34` - `301 = 24` - `403 = 6` - `444 = 8` - `500 = 0` 这说明当前阶段不是服务整体炸了,而是: - 百度已经开始进部分深页 - 但分类层和 sitemap 层仍然明显偏弱 - 同时入口层的 `403/444` 还在反复拖累蜘蛛体验 --- ## 三、已经确认属于老模板的代表域名 本轮已从正式库 `domain` 表确认以下域名及模板归属: | 域名 | t_id | 模板 | | --- | ---: | --- | | `proenerji.com` | `1001` | `videoDadi` | | `qf123.net` | `1001` | `videoDadi` | | `qingyejianshe.com` | `1002` | `videoDingZhu` | | `tvwallmountreview.com` | `1002` | `videoDingZhu` | | `yagyjt.com` | `1002` | `videoDingZhu` | | `ctshuhua.com` | `1003` | `videoBoKu` | | `ningxiaowei.com` | `1003` | `videoBoKu` | | `yqshu8.com` | `1004` | `videoLaoNiu` | | `syzhzs.com` | `1005` | `videoNuNu` | | `yahuawang88.com` | `1005` | `videoNuNu` | 所以当前 spider workbench 里这批代表站点,确实就是老模板主线,不是 GPT 模板误入。 --- ## 四、最关键的 3 条判断 ### 1. 百度已经给了 `yagyjt.com` 深抓机会 这是本轮最重要的正向样本。 工作台给出的状态: - host:`yagyjt.com` - 模板:`1002 / videoDingZhu` - 总请求:`28` - 深页请求:`16` - 详情请求:`12` - 播放请求:`4` - 首页请求:`6` - robots 请求:`3` - sitemap 请求:`2` - 分类请求:`1` 说明: - 百度并不是只停留在首页 - 这个站已经被拉进 detail/play 维度 - 同时入口层也已经开始探测 `robots / sitemap / category` - 它应该被当成老模板第一优先样板站 但它同时也有明显问题: - `anomaly_count = 18` - 深页异常主要是 `301` - 命中的 URL 形态是: - `/voddetail/...` - `/vodplay/...` 这说明百度仍然在消费旧路由资产,当前站点靠 `301` 把蜘蛛导向现行规范地址。 结论: - 这不是致命故障 - 但会拖慢抓取效率和权重沉淀速度 - 未来 7 天内,这个站最值得持续观察 ### 2. 老模板群的真正短板仍然是“分类层没起量” 最新聚合里: - `category_requests = 1` - `sitemap_requests = 2` 虽然已经不再是绝对 `0`,但这个量级依然远远弱于深页和首页,所以这比单纯的深页 `301` 更值得重视。 因为它意味着: - 百度当前对老模板站群的抓取入口仍然偏窄 - 主要仍靠首页或历史旧链接进入 - 分类页还没有形成稳定抓取面 - sitemap 也只是开始露头,还没形成可见收益 这也正好验证了本轮已落地的第一批模板修正方向是对的: 1. 分类页 canonical 修正 2. 分类页 `og:url` 修正 3. 分类页 JSON-LD `url` 修正 4. 播放页 canonical / `og:url` / JSON-LD 对齐 5. sitemap 主输出去掉 `www + novel` 旧噪音 ### 2.1 这里还要额外防一个“统计口径误判” 虽然最新 `24h` 聚合里显示: - `category_requests = 1` 但这条数据不能被机械理解成: - “蜘蛛完全没有碰过分类页” 原因是: 1. spider workbench 本身不会按 URL 自动识别分类页 2. 它依赖上游推送时已经写好的 `page_type` 3. 当前仓库内 `DomainSpiderCrawlLogSchemaHelper` 只做枚举归一,不做 URL 路径识别 也就是: - 如果前端 spiderlog-agent 把分类 URL 直接标成了 `other` - 工作台这里就会继续把它统计成 `other` - 最终看起来会像“分类始终为 0” 本轮已经在真实 payload 里看到过一条直接证据: - run: `20260417/201003_crawl_log_push_f72827` - host: `sctyjz.com` - url: `/videotype-zong-yi/all-1948-nuo-wei-all/yin-du-yu-page1` - 当前标记: `page_type = other` - bot: `googlebot` - status: `444` 这说明: - 至少在当前采集链里,分类 URL 被误标成 `other` 是真实存在的 - 所以后续主 Codex 看 `category_requests = 0` 时,必须同时保留一个判断分支: - 可能是真没抓 - 也可能是上游 page_type 归类口径不完整 不过要注意: - 在我额外抽查的最近数个 `2026-04-17` run 里 - 暂时还没有找到 `baiduspider / bytespider / sogou` 的分类 URL 被误标成 `other` 的直接样本 所以当前更稳的表达是: > 老模板分类抓取当前仍然偏弱,而且 `category` 指标本身仍存在口径风险,不能单独作为百度触达面的唯一判断依据。 ### 3. `bytespider` 当前不是“没来”,而是“来了但 robots 层体验差” 最新异常里,最高优先级几乎都集中在: - `qf123.net` - `www.proenerji.com` - `www.ctshuhua.com` - `www.qf123.net` - `www.qingyejianshe.com` - `www.syzhzs.com` - `www.yagyjt.com` - `www.tvwallmountreview.com` 共同特征: - URL:`/robots.txt` - bot:`bytespider` - 状态:`403 / 444` 这说明: - 头条蜘蛛不是没探测 - 它已经反复试图读取入口文件 - 但当前入口层对它不友好 同时,现有老模板 `robots.txt` 模板里只明确放行了: - `Baiduspider` - `360Spider` - `Sogou web spider` - `Sogou inst spider` - `YisouSpider` - `Quarkbot` - `Googlebot` 没有显式放行 `Bytespider`。 结论分两层: 1. 从“百度 7 天冲量”主目标看 - `bytespider` 不是第一优先级 - 不应该压过百度分类/深页主线 2. 从“国内蜘蛛入口完整度”看 - 后续可以单独给老模板 robots 增补 `Bytespider` - 但前提是先确认线上 `403/444` 是否来自模板输出,还是前端防护层 --- ## 五、当前不能误判的点 ### 1. 不能把 `301` 一律当致命异常 以 `yagyjt.com` 为例,百度命中的是: - `/voddetail/...` - `/vodplay/...` 这更像是历史收录或历史外链还在发挥作用。 如果当前站点已经把它们稳定 `301` 到规范地址,那么它的问题是: - 抓取成本高 - 信号绕路 而不是: - 页面完全打不开 - 老模板彻底不可抓 ### 2. 当前没有证据说明老模板普遍 5xx 最新 24h 聚合里: - `500 = 0` 所以本轮不能把精力浪费在“怀疑后端整体炸了”上。 更应该盯的是: - 分类抓取为什么还没起来 - sitemap 为什么没有形成可见命中 - 已深抓样板站能不能进一步减少旧路由依赖 ### 3. `1270` 不能代替老模板 SEO 主线 `1270` 当前仍然主要是 GPT 模板交接总文档。 老模板这一支继续推进时,应优先参考: - `1269` - `1286` - `1287` - `1289` - `1290` - `1291` - `1292` - `1293` - `1294` - `1295` - `1296` - 本文 `1299` --- ## 六、对主 Codex 最有价值的执行建议 ### 优先级 A:持续观察并放大 `yagyjt.com` 原因: - 它已经是百度深抓样板 - 模板归属明确:`1002 / videoDingZhu` - 最适合作为“老模板 7 天冲量”的核心跟踪站 建议动作: 1. 复核 `yagyjt.com` 当前详情页和播放页规范地址是否稳定 2. 观察旧 `/voddetail`、`/vodplay` 是否始终 301 到唯一规范 URL 3. 看未来 24-72 小时内,百度是否开始从 `detail/play 301` 转向规范深页 200 ### 优先级 B:盯分类层起量,而不是继续沉迷首页 因为最新数据说明: - 首页已经有命中 - 深页也不是完全没有 - 但分类层和 sitemap 层仍然显著偏弱 这意味着后续最该看的提升信号是: 1. 是否开始出现 `category_requests > 0` 2. 是否开始有分类页 200 被百度命中 3. 是否由分类页继续向详情页扩散 ### 优先级 C:把 `robots` 的国内蜘蛛兼容性单独列为副线 这条线不能抢主线,但也不能完全忽略。 建议: 1. 先确认 `403/444` 是前端防护层行为,还是应用层输出问题 2. 如果模板输出可控,再评估是否给老模板 `robots.txt` 增补: - `User-agent: Bytespider` - `Allow: /` 3. 即便要改,也应单独开小任务,不要和百度主线混着验 --- ## 七、一句话总结 当前老模板 SEO 主线的真实状态是: > 百度已经开始给个别老模板站深抓机会,但站群整体仍然缺少分类层放量;短期最值得做的是围绕 `yagyjt.com` 这种已深抓样板站压旧路由成本、盯分类抓取起量,而不是把精力继续带偏到 GPT 模板或不存在的 5xx 故障上。 --- ## 八、2026-04-17 晚间追加:工作台 page_type 口径补强已落地 在继续复核真实 payload 后,本轮又确认了一个会直接影响判断的问题: - spider workbench 的统计高度依赖上游推送的 `page_type` - 如果上游把老模板历史路由打成 `other` - 工作台就会把真实分类 / 详情 / 播放流量低估掉 ### 已确认的真实误标样本 1. 分类页误标 - `/videotype-zong-yi/all-1948-nuo-wei-all/yin-du-yu-page1` - 原始 `page_type = other` 2. 播放页误标 - `/video-play/ni-tian-zhi-zun-26066-fengchao-137` - 原始 `page_type = other` 3. 详情页漏算线索 - `www.ningxiaowei.com` - `/video-info/...` - 在最近 run 中由 `baiduspider` 命中 `200 / 301` - 但原始 bucket 仍可能落在 `other` ### 已落地的修正 本轮已在抓取摘要 ingest 阶段增加“路径兜底识别”,仅在上游值为空或为 `other` 时生效: - 文件: - [DomainSpiderCrawlLogSchemaHelper.php](/www/wwwroot/VideoSource2/code/app/common/helper/DomainSpiderCrawlLogSchemaHelper.php:1) - [DomainSpiderCrawlLogHelper.php](/www/wwwroot/VideoSource2/code/app/common/helper/DomainSpiderCrawlLogHelper.php:1) - 兜底识别范围: - `videotype / vodtype / fenlei` -> `category` - `video-info / voddetail / neirong-` -> `detail` - `video-play / vodplay / bf-` -> `play` - `robots.txt` -> `robots` - `sitemap*` -> `sitemap` - `search / get-index` -> `search` ### 本地复核结果 用真实 run: - `20260417/201003_crawl_log_push_f72827` 重新过 ingest 后,结果已经变为: 1. `/videotype-zong-yi/...` -> `category` 2. `/video-play/...` -> `play` 这说明: - 当前 workbench 的老模板分类/播放统计,后续会比之前更接近真实情况 - `category=0` 这类结论之后必须结合新 ingest 结果再判断 - 这次修正只影响蜘蛛分析口径,不会直接改动老模板页面输出,也不会直接影响 `videoGpt1` 模板渲染 ### 已追加重建 latest 摘要 为了避免 admin2 / workbench 继续读取旧的 `latest` 静态摘要,本轮还额外重建了: - `code/storage/domain-spider-crawl/latest/spider-crawl.summary.json` - `code/storage/domain-spider-crawl/latest/spider-crawl.summary.html` 重建时间: - `2026-04-17T20:20:54+08:00` 重建后,按最近 `24` 个 run 合并统计得到的页面类型分布为: - `robots = 281` - `home = 77` - `detail = 34` - `play = 11` - `category = 4` - `sitemap = 2` - `other = 17` 这和修正前相比,至少已经明确证明: 1. 分类页不再是绝对 `0` 2. 旧 `video-info / video-play / videotype` family 的流量不再全部沉到底部 `other` 3. 后续再看老模板“百度有没有进分类 / 详情 / 播放”,工作台数据可信度会更高 --- ## 九、2026-04-17 20:30 再复核补充 在继续用 `DomainSpiderCrawlWorkbenchHelper::buildSummary(...)` 复核后,当前还要再补 3 条交接级结论。 ### 1. 当前正式应以 24h 聚合视角为主,不应以 `latest` 覆盖文件为主 `latest/spider-crawl.summary.json` 在 `20:30` 时已经被新的前端 push 覆盖成一份很小的最近样本。 但同一时刻按 workbench 24h 聚合得到的真实视角仍然是: - 总请求:`72` - 详情:`21` - 播放:`4` - 分类:`1` - sitemap:`2` - robots:`11` 因此后续主 Codex 如果看到: - `latest` 很小 - 甚至只剩少量 `robots/home` 不要直接判断成: - 老模板蜘蛛量掉空 - 深页信号消失 更稳的做法是始终回到 24h 聚合视角看趋势。 ### 2. `yagyjt.com` 目前仍是第一样板站,但问题已明确集中到入口层 截至 `20:30` 的 host detail: - 总请求:`28` - 深页请求:`16` - 异常:`18` - 状态: - `200 = 10` - `301 = 10` - `444 = 7` - `403 = 1` 当前最高优先级异常已经非常集中: - `/robots.txt` - `/sitemap_index.xml` - `/videotype/1-dian-ying` - `/` 也就是说,这个站已经不是“有没有深抓”的问题,而是: - 已经深抓 - 但入口质量还不够稳 所以后续如果要拿一个站做百度 7 天冲量观察,优先还是盯它。 ### 3. `www.ningxiaowei.com` 更适合当“深链承接效率”样本 截至 `20:30` 的 host detail: - 总请求:`8` - 深页请求:`8` - 全部都是 `detail` - 状态: - `200 = 4` - `301 = 4` 它的特点不是入口层扩张,而是: - 百度已经明确在消费 `/video-info/...` 这类当前有效 family - 但还没有看到首页 / 分类 / sitemap 同步扩张 因此它更适合当: - 详情页 URL family 正确性观察样本 - 深链 `301 -> 200` 承接效率样本 不适合拿来代替 `yagyjt.com` 做入口层样板。