老模板优化

This commit is contained in:
Your Name
2026-04-17 21:09:06 +08:00
parent 4dc78e3366
commit c8fb6956ef
60 changed files with 9113 additions and 146 deletions

View File

@@ -0,0 +1,542 @@
# 1299-SEONexus 老模板最新蜘蛛日志实战分析 - 2026-04-17
## 目的
这份文档只服务老模板 `1001-1005` 的 SEO 主线。
目标不是泛泛而谈“蜘蛛有波动”,而是把 `2026-04-17` 当前仓库内最新的 spider workbench 聚合数据,直接翻译成主 Codex 可执行的判断。
明确边界:
- 只看老模板:`videoDadi / videoDingZhu / videoBoKu / videoLaoNiu / videoNuNu`
- 不把 `videoGpt1` 混进本轮结论
- 当前重点是百度主线,同时兼看 `bytespider / sogou`
---
## 一、数据来源
本轮结论不能只看单个 `latest` 文件,而要分两层理解:
1. 最近一次 push 摘要
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.json`
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.html`
2. 工作台 24h 聚合逻辑
- `code/app/common/helper/DomainSpiderCrawlWorkbenchHelper.php`
- 通过 `buildSummary(...)` 聚合最近窗口内多次 run
这里要特别提醒后续主 Codex
- `latest/spider-crawl.summary.json` 会被 `SeoCollector::saveCrawlLogs()` 每次新 push 直接覆盖
- 它代表“最近一次 push 摘要”
- 不天然等于“最近 24h 全局聚合”
`2026-04-17 20:30` 复核时就已经看到这个现象:
- `latest` 文件只剩一小批最近推送数据
- 但 workbench 24h 聚合后,老模板依然有连续深抓记录
所以本页正文以下结论,统一以 `WorkbenchHelper::buildSummary(..., windowHours=24, selectedBots=baiduspider,bytespider,sogou)` 为准。
---
## 二、当前全局结论
当前这批老模板域名,按 `2026-04-17 20:30` 的 24h 聚合视角,蜘蛛数据呈现出 4 个非常明确的信号:
1. 已经有百度深抓样本
- 不是“完全没抓”
- 已经出现 `detail / play` 命中
2. 入口层仍然偏弱
- `robots_requests = 11`
- `sitemap_requests = 2`
- `category_requests = 1`
3. 当前异常主因不是 5xx
- `500 = 0`
- 主要是 `301 / 403 / 444`
4. 当前最该处理的是“入口质量”和“旧路由信号”
- 不是把老模板误判成 GPT 模板结构问题
工作台聚合概览:
- 总请求:`72`
- 域名数:`14`
- 蜘蛛数:`2`
- 首页请求:`33`
- 分类请求:`1`
- 详情请求:`21`
- 播放请求:`4`
- robots 请求:`11`
- sitemap 请求:`2`
- 状态分布:
- `200 = 34`
- `301 = 24`
- `403 = 6`
- `444 = 8`
- `500 = 0`
这说明当前阶段不是服务整体炸了,而是:
- 百度已经开始进部分深页
- 但分类层和 sitemap 层仍然明显偏弱
- 同时入口层的 `403/444` 还在反复拖累蜘蛛体验
---
## 三、已经确认属于老模板的代表域名
本轮已从正式库 `domain` 表确认以下域名及模板归属:
| 域名 | t_id | 模板 |
| --- | ---: | --- |
| `proenerji.com` | `1001` | `videoDadi` |
| `qf123.net` | `1001` | `videoDadi` |
| `qingyejianshe.com` | `1002` | `videoDingZhu` |
| `tvwallmountreview.com` | `1002` | `videoDingZhu` |
| `yagyjt.com` | `1002` | `videoDingZhu` |
| `ctshuhua.com` | `1003` | `videoBoKu` |
| `ningxiaowei.com` | `1003` | `videoBoKu` |
| `yqshu8.com` | `1004` | `videoLaoNiu` |
| `syzhzs.com` | `1005` | `videoNuNu` |
| `yahuawang88.com` | `1005` | `videoNuNu` |
所以当前 spider workbench 里这批代表站点,确实就是老模板主线,不是 GPT 模板误入。
---
## 四、最关键的 3 条判断
### 1. 百度已经给了 `yagyjt.com` 深抓机会
这是本轮最重要的正向样本。
工作台给出的状态:
- host`yagyjt.com`
- 模板:`1002 / videoDingZhu`
- 总请求:`28`
- 深页请求:`16`
- 详情请求:`12`
- 播放请求:`4`
- 首页请求:`6`
- robots 请求:`3`
- sitemap 请求:`2`
- 分类请求:`1`
说明:
- 百度并不是只停留在首页
- 这个站已经被拉进 detail/play 维度
- 同时入口层也已经开始探测 `robots / sitemap / category`
- 它应该被当成老模板第一优先样板站
但它同时也有明显问题:
- `anomaly_count = 18`
- 深页异常主要是 `301`
- 命中的 URL 形态是:
- `/voddetail/...`
- `/vodplay/...`
这说明百度仍然在消费旧路由资产,当前站点靠 `301` 把蜘蛛导向现行规范地址。
结论:
- 这不是致命故障
- 但会拖慢抓取效率和权重沉淀速度
- 未来 7 天内,这个站最值得持续观察
### 2. 老模板群的真正短板仍然是“分类层没起量”
最新聚合里:
- `category_requests = 1`
- `sitemap_requests = 2`
虽然已经不再是绝对 `0`,但这个量级依然远远弱于深页和首页,所以这比单纯的深页 `301` 更值得重视。
因为它意味着:
- 百度当前对老模板站群的抓取入口仍然偏窄
- 主要仍靠首页或历史旧链接进入
- 分类页还没有形成稳定抓取面
- sitemap 也只是开始露头,还没形成可见收益
这也正好验证了本轮已落地的第一批模板修正方向是对的:
1. 分类页 canonical 修正
2. 分类页 `og:url` 修正
3. 分类页 JSON-LD `url` 修正
4. 播放页 canonical / `og:url` / JSON-LD 对齐
5. sitemap 主输出去掉 `www + novel` 旧噪音
### 2.1 这里还要额外防一个“统计口径误判”
虽然最新 `24h` 聚合里显示:
- `category_requests = 1`
但这条数据不能被机械理解成:
- “蜘蛛完全没有碰过分类页”
原因是:
1. spider workbench 本身不会按 URL 自动识别分类页
2. 它依赖上游推送时已经写好的 `page_type`
3. 当前仓库内 `DomainSpiderCrawlLogSchemaHelper` 只做枚举归一,不做 URL 路径识别
也就是:
- 如果前端 spiderlog-agent 把分类 URL 直接标成了 `other`
- 工作台这里就会继续把它统计成 `other`
- 最终看起来会像“分类始终为 0”
本轮已经在真实 payload 里看到过一条直接证据:
- run:
`20260417/201003_crawl_log_push_f72827`
- host:
`sctyjz.com`
- url:
`/videotype-zong-yi/all-1948-nuo-wei-all/yin-du-yu-page1`
- 当前标记:
`page_type = other`
- bot:
`googlebot`
- status:
`444`
这说明:
- 至少在当前采集链里,分类 URL 被误标成 `other` 是真实存在的
- 所以后续主 Codex 看 `category_requests = 0` 时,必须同时保留一个判断分支:
- 可能是真没抓
- 也可能是上游 page_type 归类口径不完整
不过要注意:
- 在我额外抽查的最近数个 `2026-04-17` run 里
- 暂时还没有找到 `baiduspider / bytespider / sogou` 的分类 URL 被误标成 `other` 的直接样本
所以当前更稳的表达是:
> 老模板分类抓取当前仍然偏弱,而且 `category` 指标本身仍存在口径风险,不能单独作为百度触达面的唯一判断依据。
### 3. `bytespider` 当前不是“没来”,而是“来了但 robots 层体验差”
最新异常里,最高优先级几乎都集中在:
- `qf123.net`
- `www.proenerji.com`
- `www.ctshuhua.com`
- `www.qf123.net`
- `www.qingyejianshe.com`
- `www.syzhzs.com`
- `www.yagyjt.com`
- `www.tvwallmountreview.com`
共同特征:
- URL`/robots.txt`
- bot`bytespider`
- 状态:`403 / 444`
这说明:
- 头条蜘蛛不是没探测
- 它已经反复试图读取入口文件
- 但当前入口层对它不友好
同时,现有老模板 `robots.txt` 模板里只明确放行了:
- `Baiduspider`
- `360Spider`
- `Sogou web spider`
- `Sogou inst spider`
- `YisouSpider`
- `Quarkbot`
- `Googlebot`
没有显式放行 `Bytespider`
结论分两层:
1. 从“百度 7 天冲量”主目标看
- `bytespider` 不是第一优先级
- 不应该压过百度分类/深页主线
2. 从“国内蜘蛛入口完整度”看
- 后续可以单独给老模板 robots 增补 `Bytespider`
- 但前提是先确认线上 `403/444` 是否来自模板输出,还是前端防护层
---
## 五、当前不能误判的点
### 1. 不能把 `301` 一律当致命异常
`yagyjt.com` 为例,百度命中的是:
- `/voddetail/...`
- `/vodplay/...`
这更像是历史收录或历史外链还在发挥作用。
如果当前站点已经把它们稳定 `301` 到规范地址,那么它的问题是:
- 抓取成本高
- 信号绕路
而不是:
- 页面完全打不开
- 老模板彻底不可抓
### 2. 当前没有证据说明老模板普遍 5xx
最新 24h 聚合里:
- `500 = 0`
所以本轮不能把精力浪费在“怀疑后端整体炸了”上。
更应该盯的是:
- 分类抓取为什么还没起来
- sitemap 为什么没有形成可见命中
- 已深抓样板站能不能进一步减少旧路由依赖
### 3. `1270` 不能代替老模板 SEO 主线
`1270` 当前仍然主要是 GPT 模板交接总文档。
老模板这一支继续推进时,应优先参考:
- `1269`
- `1286`
- `1287`
- `1289`
- `1290`
- `1291`
- `1292`
- `1293`
- `1294`
- `1295`
- `1296`
- 本文 `1299`
---
## 六、对主 Codex 最有价值的执行建议
### 优先级 A持续观察并放大 `yagyjt.com`
原因:
- 它已经是百度深抓样板
- 模板归属明确:`1002 / videoDingZhu`
- 最适合作为“老模板 7 天冲量”的核心跟踪站
建议动作:
1. 复核 `yagyjt.com` 当前详情页和播放页规范地址是否稳定
2. 观察旧 `/voddetail``/vodplay` 是否始终 301 到唯一规范 URL
3. 看未来 24-72 小时内,百度是否开始从 `detail/play 301` 转向规范深页 200
### 优先级 B盯分类层起量而不是继续沉迷首页
因为最新数据说明:
- 首页已经有命中
- 深页也不是完全没有
- 但分类层和 sitemap 层仍然显著偏弱
这意味着后续最该看的提升信号是:
1. 是否开始出现 `category_requests > 0`
2. 是否开始有分类页 200 被百度命中
3. 是否由分类页继续向详情页扩散
### 优先级 C把 `robots` 的国内蜘蛛兼容性单独列为副线
这条线不能抢主线,但也不能完全忽略。
建议:
1. 先确认 `403/444` 是前端防护层行为,还是应用层输出问题
2. 如果模板输出可控,再评估是否给老模板 `robots.txt` 增补:
- `User-agent: Bytespider`
- `Allow: /`
3. 即便要改,也应单独开小任务,不要和百度主线混着验
---
## 七、一句话总结
当前老模板 SEO 主线的真实状态是:
> 百度已经开始给个别老模板站深抓机会,但站群整体仍然缺少分类层放量;短期最值得做的是围绕 `yagyjt.com` 这种已深抓样板站压旧路由成本、盯分类抓取起量,而不是把精力继续带偏到 GPT 模板或不存在的 5xx 故障上。
---
## 八、2026-04-17 晚间追加:工作台 page_type 口径补强已落地
在继续复核真实 payload 后,本轮又确认了一个会直接影响判断的问题:
- spider workbench 的统计高度依赖上游推送的 `page_type`
- 如果上游把老模板历史路由打成 `other`
- 工作台就会把真实分类 / 详情 / 播放流量低估掉
### 已确认的真实误标样本
1. 分类页误标
- `/videotype-zong-yi/all-1948-nuo-wei-all/yin-du-yu-page1`
- 原始 `page_type = other`
2. 播放页误标
- `/video-play/ni-tian-zhi-zun-26066-fengchao-137`
- 原始 `page_type = other`
3. 详情页漏算线索
- `www.ningxiaowei.com`
- `/video-info/...`
- 在最近 run 中由 `baiduspider` 命中 `200 / 301`
- 但原始 bucket 仍可能落在 `other`
### 已落地的修正
本轮已在抓取摘要 ingest 阶段增加“路径兜底识别”,仅在上游值为空或为 `other` 时生效:
- 文件:
- [DomainSpiderCrawlLogSchemaHelper.php](/www/wwwroot/VideoSource2/code/app/common/helper/DomainSpiderCrawlLogSchemaHelper.php:1)
- [DomainSpiderCrawlLogHelper.php](/www/wwwroot/VideoSource2/code/app/common/helper/DomainSpiderCrawlLogHelper.php:1)
- 兜底识别范围:
- `videotype / vodtype / fenlei` -> `category`
- `video-info / voddetail / neirong-` -> `detail`
- `video-play / vodplay / bf-` -> `play`
- `robots.txt` -> `robots`
- `sitemap*` -> `sitemap`
- `search / get-index` -> `search`
### 本地复核结果
用真实 run
- `20260417/201003_crawl_log_push_f72827`
重新过 ingest 后,结果已经变为:
1. `/videotype-zong-yi/...` -> `category`
2. `/video-play/...` -> `play`
这说明:
- 当前 workbench 的老模板分类/播放统计,后续会比之前更接近真实情况
- `category=0` 这类结论之后必须结合新 ingest 结果再判断
- 这次修正只影响蜘蛛分析口径,不会直接改动老模板页面输出,也不会直接影响 `videoGpt1` 模板渲染
### 已追加重建 latest 摘要
为了避免 admin2 / workbench 继续读取旧的 `latest` 静态摘要,本轮还额外重建了:
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.json`
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.html`
重建时间:
- `2026-04-17T20:20:54+08:00`
重建后,按最近 `24` 个 run 合并统计得到的页面类型分布为:
- `robots = 281`
- `home = 77`
- `detail = 34`
- `play = 11`
- `category = 4`
- `sitemap = 2`
- `other = 17`
这和修正前相比,至少已经明确证明:
1. 分类页不再是绝对 `0`
2.`video-info / video-play / videotype` family 的流量不再全部沉到底部 `other`
3. 后续再看老模板“百度有没有进分类 / 详情 / 播放”,工作台数据可信度会更高
---
## 九、2026-04-17 20:30 再复核补充
在继续用 `DomainSpiderCrawlWorkbenchHelper::buildSummary(...)` 复核后,当前还要再补 3 条交接级结论。
### 1. 当前正式应以 24h 聚合视角为主,不应以 `latest` 覆盖文件为主
`latest/spider-crawl.summary.json``20:30` 时已经被新的前端 push 覆盖成一份很小的最近样本。
但同一时刻按 workbench 24h 聚合得到的真实视角仍然是:
- 总请求:`72`
- 详情:`21`
- 播放:`4`
- 分类:`1`
- sitemap`2`
- robots`11`
因此后续主 Codex 如果看到:
- `latest` 很小
- 甚至只剩少量 `robots/home`
不要直接判断成:
- 老模板蜘蛛量掉空
- 深页信号消失
更稳的做法是始终回到 24h 聚合视角看趋势。
### 2. `yagyjt.com` 目前仍是第一样板站,但问题已明确集中到入口层
截至 `20:30` 的 host detail
- 总请求:`28`
- 深页请求:`16`
- 异常:`18`
- 状态:
- `200 = 10`
- `301 = 10`
- `444 = 7`
- `403 = 1`
当前最高优先级异常已经非常集中:
- `/robots.txt`
- `/sitemap_index.xml`
- `/videotype/1-dian-ying`
- `/`
也就是说,这个站已经不是“有没有深抓”的问题,而是:
- 已经深抓
- 但入口质量还不够稳
所以后续如果要拿一个站做百度 7 天冲量观察,优先还是盯它。
### 3. `www.ningxiaowei.com` 更适合当“深链承接效率”样本
截至 `20:30` 的 host detail
- 总请求:`8`
- 深页请求:`8`
- 全部都是 `detail`
- 状态:
- `200 = 4`
- `301 = 4`
它的特点不是入口层扩张,而是:
- 百度已经明确在消费 `/video-info/...` 这类当前有效 family
- 但还没有看到首页 / 分类 / sitemap 同步扩张
因此它更适合当:
- 详情页 URL family 正确性观察样本
- 深链 `301 -> 200` 承接效率样本
不适合拿来代替 `yagyjt.com` 做入口层样板。