Files
SEONexus/docs/old-tmp-seo/30-老模板最新蜘蛛日志实战分析-2026-04-17.md
2026-04-17 21:09:06 +08:00

543 lines
15 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 1299-SEONexus 老模板最新蜘蛛日志实战分析 - 2026-04-17
## 目的
这份文档只服务老模板 `1001-1005` 的 SEO 主线。
目标不是泛泛而谈“蜘蛛有波动”,而是把 `2026-04-17` 当前仓库内最新的 spider workbench 聚合数据,直接翻译成主 Codex 可执行的判断。
明确边界:
- 只看老模板:`videoDadi / videoDingZhu / videoBoKu / videoLaoNiu / videoNuNu`
- 不把 `videoGpt1` 混进本轮结论
- 当前重点是百度主线,同时兼看 `bytespider / sogou`
---
## 一、数据来源
本轮结论不能只看单个 `latest` 文件,而要分两层理解:
1. 最近一次 push 摘要
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.json`
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.html`
2. 工作台 24h 聚合逻辑
- `code/app/common/helper/DomainSpiderCrawlWorkbenchHelper.php`
- 通过 `buildSummary(...)` 聚合最近窗口内多次 run
这里要特别提醒后续主 Codex
- `latest/spider-crawl.summary.json` 会被 `SeoCollector::saveCrawlLogs()` 每次新 push 直接覆盖
- 它代表“最近一次 push 摘要”
- 不天然等于“最近 24h 全局聚合”
`2026-04-17 20:30` 复核时就已经看到这个现象:
- `latest` 文件只剩一小批最近推送数据
- 但 workbench 24h 聚合后,老模板依然有连续深抓记录
所以本页正文以下结论,统一以 `WorkbenchHelper::buildSummary(..., windowHours=24, selectedBots=baiduspider,bytespider,sogou)` 为准。
---
## 二、当前全局结论
当前这批老模板域名,按 `2026-04-17 20:30` 的 24h 聚合视角,蜘蛛数据呈现出 4 个非常明确的信号:
1. 已经有百度深抓样本
- 不是“完全没抓”
- 已经出现 `detail / play` 命中
2. 入口层仍然偏弱
- `robots_requests = 11`
- `sitemap_requests = 2`
- `category_requests = 1`
3. 当前异常主因不是 5xx
- `500 = 0`
- 主要是 `301 / 403 / 444`
4. 当前最该处理的是“入口质量”和“旧路由信号”
- 不是把老模板误判成 GPT 模板结构问题
工作台聚合概览:
- 总请求:`72`
- 域名数:`14`
- 蜘蛛数:`2`
- 首页请求:`33`
- 分类请求:`1`
- 详情请求:`21`
- 播放请求:`4`
- robots 请求:`11`
- sitemap 请求:`2`
- 状态分布:
- `200 = 34`
- `301 = 24`
- `403 = 6`
- `444 = 8`
- `500 = 0`
这说明当前阶段不是服务整体炸了,而是:
- 百度已经开始进部分深页
- 但分类层和 sitemap 层仍然明显偏弱
- 同时入口层的 `403/444` 还在反复拖累蜘蛛体验
---
## 三、已经确认属于老模板的代表域名
本轮已从正式库 `domain` 表确认以下域名及模板归属:
| 域名 | t_id | 模板 |
| --- | ---: | --- |
| `proenerji.com` | `1001` | `videoDadi` |
| `qf123.net` | `1001` | `videoDadi` |
| `qingyejianshe.com` | `1002` | `videoDingZhu` |
| `tvwallmountreview.com` | `1002` | `videoDingZhu` |
| `yagyjt.com` | `1002` | `videoDingZhu` |
| `ctshuhua.com` | `1003` | `videoBoKu` |
| `ningxiaowei.com` | `1003` | `videoBoKu` |
| `yqshu8.com` | `1004` | `videoLaoNiu` |
| `syzhzs.com` | `1005` | `videoNuNu` |
| `yahuawang88.com` | `1005` | `videoNuNu` |
所以当前 spider workbench 里这批代表站点,确实就是老模板主线,不是 GPT 模板误入。
---
## 四、最关键的 3 条判断
### 1. 百度已经给了 `yagyjt.com` 深抓机会
这是本轮最重要的正向样本。
工作台给出的状态:
- host`yagyjt.com`
- 模板:`1002 / videoDingZhu`
- 总请求:`28`
- 深页请求:`16`
- 详情请求:`12`
- 播放请求:`4`
- 首页请求:`6`
- robots 请求:`3`
- sitemap 请求:`2`
- 分类请求:`1`
说明:
- 百度并不是只停留在首页
- 这个站已经被拉进 detail/play 维度
- 同时入口层也已经开始探测 `robots / sitemap / category`
- 它应该被当成老模板第一优先样板站
但它同时也有明显问题:
- `anomaly_count = 18`
- 深页异常主要是 `301`
- 命中的 URL 形态是:
- `/voddetail/...`
- `/vodplay/...`
这说明百度仍然在消费旧路由资产,当前站点靠 `301` 把蜘蛛导向现行规范地址。
结论:
- 这不是致命故障
- 但会拖慢抓取效率和权重沉淀速度
- 未来 7 天内,这个站最值得持续观察
### 2. 老模板群的真正短板仍然是“分类层没起量”
最新聚合里:
- `category_requests = 1`
- `sitemap_requests = 2`
虽然已经不再是绝对 `0`,但这个量级依然远远弱于深页和首页,所以这比单纯的深页 `301` 更值得重视。
因为它意味着:
- 百度当前对老模板站群的抓取入口仍然偏窄
- 主要仍靠首页或历史旧链接进入
- 分类页还没有形成稳定抓取面
- sitemap 也只是开始露头,还没形成可见收益
这也正好验证了本轮已落地的第一批模板修正方向是对的:
1. 分类页 canonical 修正
2. 分类页 `og:url` 修正
3. 分类页 JSON-LD `url` 修正
4. 播放页 canonical / `og:url` / JSON-LD 对齐
5. sitemap 主输出去掉 `www + novel` 旧噪音
### 2.1 这里还要额外防一个“统计口径误判”
虽然最新 `24h` 聚合里显示:
- `category_requests = 1`
但这条数据不能被机械理解成:
- “蜘蛛完全没有碰过分类页”
原因是:
1. spider workbench 本身不会按 URL 自动识别分类页
2. 它依赖上游推送时已经写好的 `page_type`
3. 当前仓库内 `DomainSpiderCrawlLogSchemaHelper` 只做枚举归一,不做 URL 路径识别
也就是:
- 如果前端 spiderlog-agent 把分类 URL 直接标成了 `other`
- 工作台这里就会继续把它统计成 `other`
- 最终看起来会像“分类始终为 0”
本轮已经在真实 payload 里看到过一条直接证据:
- run:
`20260417/201003_crawl_log_push_f72827`
- host:
`sctyjz.com`
- url:
`/videotype-zong-yi/all-1948-nuo-wei-all/yin-du-yu-page1`
- 当前标记:
`page_type = other`
- bot:
`googlebot`
- status:
`444`
这说明:
- 至少在当前采集链里,分类 URL 被误标成 `other` 是真实存在的
- 所以后续主 Codex 看 `category_requests = 0` 时,必须同时保留一个判断分支:
- 可能是真没抓
- 也可能是上游 page_type 归类口径不完整
不过要注意:
- 在我额外抽查的最近数个 `2026-04-17` run 里
- 暂时还没有找到 `baiduspider / bytespider / sogou` 的分类 URL 被误标成 `other` 的直接样本
所以当前更稳的表达是:
> 老模板分类抓取当前仍然偏弱,而且 `category` 指标本身仍存在口径风险,不能单独作为百度触达面的唯一判断依据。
### 3. `bytespider` 当前不是“没来”,而是“来了但 robots 层体验差”
最新异常里,最高优先级几乎都集中在:
- `qf123.net`
- `www.proenerji.com`
- `www.ctshuhua.com`
- `www.qf123.net`
- `www.qingyejianshe.com`
- `www.syzhzs.com`
- `www.yagyjt.com`
- `www.tvwallmountreview.com`
共同特征:
- URL`/robots.txt`
- bot`bytespider`
- 状态:`403 / 444`
这说明:
- 头条蜘蛛不是没探测
- 它已经反复试图读取入口文件
- 但当前入口层对它不友好
同时,现有老模板 `robots.txt` 模板里只明确放行了:
- `Baiduspider`
- `360Spider`
- `Sogou web spider`
- `Sogou inst spider`
- `YisouSpider`
- `Quarkbot`
- `Googlebot`
没有显式放行 `Bytespider`
结论分两层:
1. 从“百度 7 天冲量”主目标看
- `bytespider` 不是第一优先级
- 不应该压过百度分类/深页主线
2. 从“国内蜘蛛入口完整度”看
- 后续可以单独给老模板 robots 增补 `Bytespider`
- 但前提是先确认线上 `403/444` 是否来自模板输出,还是前端防护层
---
## 五、当前不能误判的点
### 1. 不能把 `301` 一律当致命异常
`yagyjt.com` 为例,百度命中的是:
- `/voddetail/...`
- `/vodplay/...`
这更像是历史收录或历史外链还在发挥作用。
如果当前站点已经把它们稳定 `301` 到规范地址,那么它的问题是:
- 抓取成本高
- 信号绕路
而不是:
- 页面完全打不开
- 老模板彻底不可抓
### 2. 当前没有证据说明老模板普遍 5xx
最新 24h 聚合里:
- `500 = 0`
所以本轮不能把精力浪费在“怀疑后端整体炸了”上。
更应该盯的是:
- 分类抓取为什么还没起来
- sitemap 为什么没有形成可见命中
- 已深抓样板站能不能进一步减少旧路由依赖
### 3. `1270` 不能代替老模板 SEO 主线
`1270` 当前仍然主要是 GPT 模板交接总文档。
老模板这一支继续推进时,应优先参考:
- `1269`
- `1286`
- `1287`
- `1289`
- `1290`
- `1291`
- `1292`
- `1293`
- `1294`
- `1295`
- `1296`
- 本文 `1299`
---
## 六、对主 Codex 最有价值的执行建议
### 优先级 A持续观察并放大 `yagyjt.com`
原因:
- 它已经是百度深抓样板
- 模板归属明确:`1002 / videoDingZhu`
- 最适合作为“老模板 7 天冲量”的核心跟踪站
建议动作:
1. 复核 `yagyjt.com` 当前详情页和播放页规范地址是否稳定
2. 观察旧 `/voddetail``/vodplay` 是否始终 301 到唯一规范 URL
3. 看未来 24-72 小时内,百度是否开始从 `detail/play 301` 转向规范深页 200
### 优先级 B盯分类层起量而不是继续沉迷首页
因为最新数据说明:
- 首页已经有命中
- 深页也不是完全没有
- 但分类层和 sitemap 层仍然显著偏弱
这意味着后续最该看的提升信号是:
1. 是否开始出现 `category_requests > 0`
2. 是否开始有分类页 200 被百度命中
3. 是否由分类页继续向详情页扩散
### 优先级 C把 `robots` 的国内蜘蛛兼容性单独列为副线
这条线不能抢主线,但也不能完全忽略。
建议:
1. 先确认 `403/444` 是前端防护层行为,还是应用层输出问题
2. 如果模板输出可控,再评估是否给老模板 `robots.txt` 增补:
- `User-agent: Bytespider`
- `Allow: /`
3. 即便要改,也应单独开小任务,不要和百度主线混着验
---
## 七、一句话总结
当前老模板 SEO 主线的真实状态是:
> 百度已经开始给个别老模板站深抓机会,但站群整体仍然缺少分类层放量;短期最值得做的是围绕 `yagyjt.com` 这种已深抓样板站压旧路由成本、盯分类抓取起量,而不是把精力继续带偏到 GPT 模板或不存在的 5xx 故障上。
---
## 八、2026-04-17 晚间追加:工作台 page_type 口径补强已落地
在继续复核真实 payload 后,本轮又确认了一个会直接影响判断的问题:
- spider workbench 的统计高度依赖上游推送的 `page_type`
- 如果上游把老模板历史路由打成 `other`
- 工作台就会把真实分类 / 详情 / 播放流量低估掉
### 已确认的真实误标样本
1. 分类页误标
- `/videotype-zong-yi/all-1948-nuo-wei-all/yin-du-yu-page1`
- 原始 `page_type = other`
2. 播放页误标
- `/video-play/ni-tian-zhi-zun-26066-fengchao-137`
- 原始 `page_type = other`
3. 详情页漏算线索
- `www.ningxiaowei.com`
- `/video-info/...`
- 在最近 run 中由 `baiduspider` 命中 `200 / 301`
- 但原始 bucket 仍可能落在 `other`
### 已落地的修正
本轮已在抓取摘要 ingest 阶段增加“路径兜底识别”,仅在上游值为空或为 `other` 时生效:
- 文件:
- [DomainSpiderCrawlLogSchemaHelper.php](/www/wwwroot/VideoSource2/code/app/common/helper/DomainSpiderCrawlLogSchemaHelper.php:1)
- [DomainSpiderCrawlLogHelper.php](/www/wwwroot/VideoSource2/code/app/common/helper/DomainSpiderCrawlLogHelper.php:1)
- 兜底识别范围:
- `videotype / vodtype / fenlei` -> `category`
- `video-info / voddetail / neirong-` -> `detail`
- `video-play / vodplay / bf-` -> `play`
- `robots.txt` -> `robots`
- `sitemap*` -> `sitemap`
- `search / get-index` -> `search`
### 本地复核结果
用真实 run
- `20260417/201003_crawl_log_push_f72827`
重新过 ingest 后,结果已经变为:
1. `/videotype-zong-yi/...` -> `category`
2. `/video-play/...` -> `play`
这说明:
- 当前 workbench 的老模板分类/播放统计,后续会比之前更接近真实情况
- `category=0` 这类结论之后必须结合新 ingest 结果再判断
- 这次修正只影响蜘蛛分析口径,不会直接改动老模板页面输出,也不会直接影响 `videoGpt1` 模板渲染
### 已追加重建 latest 摘要
为了避免 admin2 / workbench 继续读取旧的 `latest` 静态摘要,本轮还额外重建了:
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.json`
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.html`
重建时间:
- `2026-04-17T20:20:54+08:00`
重建后,按最近 `24` 个 run 合并统计得到的页面类型分布为:
- `robots = 281`
- `home = 77`
- `detail = 34`
- `play = 11`
- `category = 4`
- `sitemap = 2`
- `other = 17`
这和修正前相比,至少已经明确证明:
1. 分类页不再是绝对 `0`
2.`video-info / video-play / videotype` family 的流量不再全部沉到底部 `other`
3. 后续再看老模板“百度有没有进分类 / 详情 / 播放”,工作台数据可信度会更高
---
## 九、2026-04-17 20:30 再复核补充
在继续用 `DomainSpiderCrawlWorkbenchHelper::buildSummary(...)` 复核后,当前还要再补 3 条交接级结论。
### 1. 当前正式应以 24h 聚合视角为主,不应以 `latest` 覆盖文件为主
`latest/spider-crawl.summary.json``20:30` 时已经被新的前端 push 覆盖成一份很小的最近样本。
但同一时刻按 workbench 24h 聚合得到的真实视角仍然是:
- 总请求:`72`
- 详情:`21`
- 播放:`4`
- 分类:`1`
- sitemap`2`
- robots`11`
因此后续主 Codex 如果看到:
- `latest` 很小
- 甚至只剩少量 `robots/home`
不要直接判断成:
- 老模板蜘蛛量掉空
- 深页信号消失
更稳的做法是始终回到 24h 聚合视角看趋势。
### 2. `yagyjt.com` 目前仍是第一样板站,但问题已明确集中到入口层
截至 `20:30` 的 host detail
- 总请求:`28`
- 深页请求:`16`
- 异常:`18`
- 状态:
- `200 = 10`
- `301 = 10`
- `444 = 7`
- `403 = 1`
当前最高优先级异常已经非常集中:
- `/robots.txt`
- `/sitemap_index.xml`
- `/videotype/1-dian-ying`
- `/`
也就是说,这个站已经不是“有没有深抓”的问题,而是:
- 已经深抓
- 但入口质量还不够稳
所以后续如果要拿一个站做百度 7 天冲量观察,优先还是盯它。
### 3. `www.ningxiaowei.com` 更适合当“深链承接效率”样本
截至 `20:30` 的 host detail
- 总请求:`8`
- 深页请求:`8`
- 全部都是 `detail`
- 状态:
- `200 = 4`
- `301 = 4`
它的特点不是入口层扩张,而是:
- 百度已经明确在消费 `/video-info/...` 这类当前有效 family
- 但还没有看到首页 / 分类 / sitemap 同步扩张
因此它更适合当:
- 详情页 URL family 正确性观察样本
- 深链 `301 -> 200` 承接效率样本
不适合拿来代替 `yagyjt.com` 做入口层样板。