老模板优化
This commit is contained in:
542
docs/old-tmp-seo/30-老模板最新蜘蛛日志实战分析-2026-04-17.md
Normal file
542
docs/old-tmp-seo/30-老模板最新蜘蛛日志实战分析-2026-04-17.md
Normal file
@@ -0,0 +1,542 @@
|
||||
# 1299-SEONexus 老模板最新蜘蛛日志实战分析 - 2026-04-17
|
||||
|
||||
## 目的
|
||||
|
||||
这份文档只服务老模板 `1001-1005` 的 SEO 主线。
|
||||
|
||||
目标不是泛泛而谈“蜘蛛有波动”,而是把 `2026-04-17` 当前仓库内最新的 spider workbench 聚合数据,直接翻译成主 Codex 可执行的判断。
|
||||
|
||||
明确边界:
|
||||
|
||||
- 只看老模板:`videoDadi / videoDingZhu / videoBoKu / videoLaoNiu / videoNuNu`
|
||||
- 不把 `videoGpt1` 混进本轮结论
|
||||
- 当前重点是百度主线,同时兼看 `bytespider / sogou`
|
||||
|
||||
---
|
||||
|
||||
## 一、数据来源
|
||||
|
||||
本轮结论不能只看单个 `latest` 文件,而要分两层理解:
|
||||
|
||||
1. 最近一次 push 摘要
|
||||
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.json`
|
||||
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.html`
|
||||
2. 工作台 24h 聚合逻辑
|
||||
- `code/app/common/helper/DomainSpiderCrawlWorkbenchHelper.php`
|
||||
- 通过 `buildSummary(...)` 聚合最近窗口内多次 run
|
||||
|
||||
这里要特别提醒后续主 Codex:
|
||||
|
||||
- `latest/spider-crawl.summary.json` 会被 `SeoCollector::saveCrawlLogs()` 每次新 push 直接覆盖
|
||||
- 它代表“最近一次 push 摘要”
|
||||
- 不天然等于“最近 24h 全局聚合”
|
||||
|
||||
`2026-04-17 20:30` 复核时就已经看到这个现象:
|
||||
|
||||
- `latest` 文件只剩一小批最近推送数据
|
||||
- 但 workbench 24h 聚合后,老模板依然有连续深抓记录
|
||||
|
||||
所以本页正文以下结论,统一以 `WorkbenchHelper::buildSummary(..., windowHours=24, selectedBots=baiduspider,bytespider,sogou)` 为准。
|
||||
|
||||
---
|
||||
|
||||
## 二、当前全局结论
|
||||
|
||||
当前这批老模板域名,按 `2026-04-17 20:30` 的 24h 聚合视角,蜘蛛数据呈现出 4 个非常明确的信号:
|
||||
|
||||
1. 已经有百度深抓样本
|
||||
- 不是“完全没抓”
|
||||
- 已经出现 `detail / play` 命中
|
||||
2. 入口层仍然偏弱
|
||||
- `robots_requests = 11`
|
||||
- `sitemap_requests = 2`
|
||||
- `category_requests = 1`
|
||||
3. 当前异常主因不是 5xx
|
||||
- `500 = 0`
|
||||
- 主要是 `301 / 403 / 444`
|
||||
4. 当前最该处理的是“入口质量”和“旧路由信号”
|
||||
- 不是把老模板误判成 GPT 模板结构问题
|
||||
|
||||
工作台聚合概览:
|
||||
|
||||
- 总请求:`72`
|
||||
- 域名数:`14`
|
||||
- 蜘蛛数:`2`
|
||||
- 首页请求:`33`
|
||||
- 分类请求:`1`
|
||||
- 详情请求:`21`
|
||||
- 播放请求:`4`
|
||||
- robots 请求:`11`
|
||||
- sitemap 请求:`2`
|
||||
- 状态分布:
|
||||
- `200 = 34`
|
||||
- `301 = 24`
|
||||
- `403 = 6`
|
||||
- `444 = 8`
|
||||
- `500 = 0`
|
||||
|
||||
这说明当前阶段不是服务整体炸了,而是:
|
||||
|
||||
- 百度已经开始进部分深页
|
||||
- 但分类层和 sitemap 层仍然明显偏弱
|
||||
- 同时入口层的 `403/444` 还在反复拖累蜘蛛体验
|
||||
|
||||
---
|
||||
|
||||
## 三、已经确认属于老模板的代表域名
|
||||
|
||||
本轮已从正式库 `domain` 表确认以下域名及模板归属:
|
||||
|
||||
| 域名 | t_id | 模板 |
|
||||
| --- | ---: | --- |
|
||||
| `proenerji.com` | `1001` | `videoDadi` |
|
||||
| `qf123.net` | `1001` | `videoDadi` |
|
||||
| `qingyejianshe.com` | `1002` | `videoDingZhu` |
|
||||
| `tvwallmountreview.com` | `1002` | `videoDingZhu` |
|
||||
| `yagyjt.com` | `1002` | `videoDingZhu` |
|
||||
| `ctshuhua.com` | `1003` | `videoBoKu` |
|
||||
| `ningxiaowei.com` | `1003` | `videoBoKu` |
|
||||
| `yqshu8.com` | `1004` | `videoLaoNiu` |
|
||||
| `syzhzs.com` | `1005` | `videoNuNu` |
|
||||
| `yahuawang88.com` | `1005` | `videoNuNu` |
|
||||
|
||||
所以当前 spider workbench 里这批代表站点,确实就是老模板主线,不是 GPT 模板误入。
|
||||
|
||||
---
|
||||
|
||||
## 四、最关键的 3 条判断
|
||||
|
||||
### 1. 百度已经给了 `yagyjt.com` 深抓机会
|
||||
|
||||
这是本轮最重要的正向样本。
|
||||
|
||||
工作台给出的状态:
|
||||
|
||||
- host:`yagyjt.com`
|
||||
- 模板:`1002 / videoDingZhu`
|
||||
- 总请求:`28`
|
||||
- 深页请求:`16`
|
||||
- 详情请求:`12`
|
||||
- 播放请求:`4`
|
||||
- 首页请求:`6`
|
||||
- robots 请求:`3`
|
||||
- sitemap 请求:`2`
|
||||
- 分类请求:`1`
|
||||
|
||||
说明:
|
||||
|
||||
- 百度并不是只停留在首页
|
||||
- 这个站已经被拉进 detail/play 维度
|
||||
- 同时入口层也已经开始探测 `robots / sitemap / category`
|
||||
- 它应该被当成老模板第一优先样板站
|
||||
|
||||
但它同时也有明显问题:
|
||||
|
||||
- `anomaly_count = 18`
|
||||
- 深页异常主要是 `301`
|
||||
- 命中的 URL 形态是:
|
||||
- `/voddetail/...`
|
||||
- `/vodplay/...`
|
||||
|
||||
这说明百度仍然在消费旧路由资产,当前站点靠 `301` 把蜘蛛导向现行规范地址。
|
||||
|
||||
结论:
|
||||
|
||||
- 这不是致命故障
|
||||
- 但会拖慢抓取效率和权重沉淀速度
|
||||
- 未来 7 天内,这个站最值得持续观察
|
||||
|
||||
### 2. 老模板群的真正短板仍然是“分类层没起量”
|
||||
|
||||
最新聚合里:
|
||||
|
||||
- `category_requests = 1`
|
||||
- `sitemap_requests = 2`
|
||||
|
||||
虽然已经不再是绝对 `0`,但这个量级依然远远弱于深页和首页,所以这比单纯的深页 `301` 更值得重视。
|
||||
|
||||
因为它意味着:
|
||||
|
||||
- 百度当前对老模板站群的抓取入口仍然偏窄
|
||||
- 主要仍靠首页或历史旧链接进入
|
||||
- 分类页还没有形成稳定抓取面
|
||||
- sitemap 也只是开始露头,还没形成可见收益
|
||||
|
||||
这也正好验证了本轮已落地的第一批模板修正方向是对的:
|
||||
|
||||
1. 分类页 canonical 修正
|
||||
2. 分类页 `og:url` 修正
|
||||
3. 分类页 JSON-LD `url` 修正
|
||||
4. 播放页 canonical / `og:url` / JSON-LD 对齐
|
||||
5. sitemap 主输出去掉 `www + novel` 旧噪音
|
||||
|
||||
### 2.1 这里还要额外防一个“统计口径误判”
|
||||
|
||||
虽然最新 `24h` 聚合里显示:
|
||||
|
||||
- `category_requests = 1`
|
||||
|
||||
但这条数据不能被机械理解成:
|
||||
|
||||
- “蜘蛛完全没有碰过分类页”
|
||||
|
||||
原因是:
|
||||
|
||||
1. spider workbench 本身不会按 URL 自动识别分类页
|
||||
2. 它依赖上游推送时已经写好的 `page_type`
|
||||
3. 当前仓库内 `DomainSpiderCrawlLogSchemaHelper` 只做枚举归一,不做 URL 路径识别
|
||||
|
||||
也就是:
|
||||
|
||||
- 如果前端 spiderlog-agent 把分类 URL 直接标成了 `other`
|
||||
- 工作台这里就会继续把它统计成 `other`
|
||||
- 最终看起来会像“分类始终为 0”
|
||||
|
||||
本轮已经在真实 payload 里看到过一条直接证据:
|
||||
|
||||
- run:
|
||||
`20260417/201003_crawl_log_push_f72827`
|
||||
- host:
|
||||
`sctyjz.com`
|
||||
- url:
|
||||
`/videotype-zong-yi/all-1948-nuo-wei-all/yin-du-yu-page1`
|
||||
- 当前标记:
|
||||
`page_type = other`
|
||||
- bot:
|
||||
`googlebot`
|
||||
- status:
|
||||
`444`
|
||||
|
||||
这说明:
|
||||
|
||||
- 至少在当前采集链里,分类 URL 被误标成 `other` 是真实存在的
|
||||
- 所以后续主 Codex 看 `category_requests = 0` 时,必须同时保留一个判断分支:
|
||||
- 可能是真没抓
|
||||
- 也可能是上游 page_type 归类口径不完整
|
||||
|
||||
不过要注意:
|
||||
|
||||
- 在我额外抽查的最近数个 `2026-04-17` run 里
|
||||
- 暂时还没有找到 `baiduspider / bytespider / sogou` 的分类 URL 被误标成 `other` 的直接样本
|
||||
|
||||
所以当前更稳的表达是:
|
||||
|
||||
> 老模板分类抓取当前仍然偏弱,而且 `category` 指标本身仍存在口径风险,不能单独作为百度触达面的唯一判断依据。
|
||||
|
||||
### 3. `bytespider` 当前不是“没来”,而是“来了但 robots 层体验差”
|
||||
|
||||
最新异常里,最高优先级几乎都集中在:
|
||||
|
||||
- `qf123.net`
|
||||
- `www.proenerji.com`
|
||||
- `www.ctshuhua.com`
|
||||
- `www.qf123.net`
|
||||
- `www.qingyejianshe.com`
|
||||
- `www.syzhzs.com`
|
||||
- `www.yagyjt.com`
|
||||
- `www.tvwallmountreview.com`
|
||||
|
||||
共同特征:
|
||||
|
||||
- URL:`/robots.txt`
|
||||
- bot:`bytespider`
|
||||
- 状态:`403 / 444`
|
||||
|
||||
这说明:
|
||||
|
||||
- 头条蜘蛛不是没探测
|
||||
- 它已经反复试图读取入口文件
|
||||
- 但当前入口层对它不友好
|
||||
|
||||
同时,现有老模板 `robots.txt` 模板里只明确放行了:
|
||||
|
||||
- `Baiduspider`
|
||||
- `360Spider`
|
||||
- `Sogou web spider`
|
||||
- `Sogou inst spider`
|
||||
- `YisouSpider`
|
||||
- `Quarkbot`
|
||||
- `Googlebot`
|
||||
|
||||
没有显式放行 `Bytespider`。
|
||||
|
||||
结论分两层:
|
||||
|
||||
1. 从“百度 7 天冲量”主目标看
|
||||
- `bytespider` 不是第一优先级
|
||||
- 不应该压过百度分类/深页主线
|
||||
2. 从“国内蜘蛛入口完整度”看
|
||||
- 后续可以单独给老模板 robots 增补 `Bytespider`
|
||||
- 但前提是先确认线上 `403/444` 是否来自模板输出,还是前端防护层
|
||||
|
||||
---
|
||||
|
||||
## 五、当前不能误判的点
|
||||
|
||||
### 1. 不能把 `301` 一律当致命异常
|
||||
|
||||
以 `yagyjt.com` 为例,百度命中的是:
|
||||
|
||||
- `/voddetail/...`
|
||||
- `/vodplay/...`
|
||||
|
||||
这更像是历史收录或历史外链还在发挥作用。
|
||||
|
||||
如果当前站点已经把它们稳定 `301` 到规范地址,那么它的问题是:
|
||||
|
||||
- 抓取成本高
|
||||
- 信号绕路
|
||||
|
||||
而不是:
|
||||
|
||||
- 页面完全打不开
|
||||
- 老模板彻底不可抓
|
||||
|
||||
### 2. 当前没有证据说明老模板普遍 5xx
|
||||
|
||||
最新 24h 聚合里:
|
||||
|
||||
- `500 = 0`
|
||||
|
||||
所以本轮不能把精力浪费在“怀疑后端整体炸了”上。
|
||||
|
||||
更应该盯的是:
|
||||
|
||||
- 分类抓取为什么还没起来
|
||||
- sitemap 为什么没有形成可见命中
|
||||
- 已深抓样板站能不能进一步减少旧路由依赖
|
||||
|
||||
### 3. `1270` 不能代替老模板 SEO 主线
|
||||
|
||||
`1270` 当前仍然主要是 GPT 模板交接总文档。
|
||||
|
||||
老模板这一支继续推进时,应优先参考:
|
||||
|
||||
- `1269`
|
||||
- `1286`
|
||||
- `1287`
|
||||
- `1289`
|
||||
- `1290`
|
||||
- `1291`
|
||||
- `1292`
|
||||
- `1293`
|
||||
- `1294`
|
||||
- `1295`
|
||||
- `1296`
|
||||
- 本文 `1299`
|
||||
|
||||
---
|
||||
|
||||
## 六、对主 Codex 最有价值的执行建议
|
||||
|
||||
### 优先级 A:持续观察并放大 `yagyjt.com`
|
||||
|
||||
原因:
|
||||
|
||||
- 它已经是百度深抓样板
|
||||
- 模板归属明确:`1002 / videoDingZhu`
|
||||
- 最适合作为“老模板 7 天冲量”的核心跟踪站
|
||||
|
||||
建议动作:
|
||||
|
||||
1. 复核 `yagyjt.com` 当前详情页和播放页规范地址是否稳定
|
||||
2. 观察旧 `/voddetail`、`/vodplay` 是否始终 301 到唯一规范 URL
|
||||
3. 看未来 24-72 小时内,百度是否开始从 `detail/play 301` 转向规范深页 200
|
||||
|
||||
### 优先级 B:盯分类层起量,而不是继续沉迷首页
|
||||
|
||||
因为最新数据说明:
|
||||
|
||||
- 首页已经有命中
|
||||
- 深页也不是完全没有
|
||||
- 但分类层和 sitemap 层仍然显著偏弱
|
||||
|
||||
这意味着后续最该看的提升信号是:
|
||||
|
||||
1. 是否开始出现 `category_requests > 0`
|
||||
2. 是否开始有分类页 200 被百度命中
|
||||
3. 是否由分类页继续向详情页扩散
|
||||
|
||||
### 优先级 C:把 `robots` 的国内蜘蛛兼容性单独列为副线
|
||||
|
||||
这条线不能抢主线,但也不能完全忽略。
|
||||
|
||||
建议:
|
||||
|
||||
1. 先确认 `403/444` 是前端防护层行为,还是应用层输出问题
|
||||
2. 如果模板输出可控,再评估是否给老模板 `robots.txt` 增补:
|
||||
- `User-agent: Bytespider`
|
||||
- `Allow: /`
|
||||
3. 即便要改,也应单独开小任务,不要和百度主线混着验
|
||||
|
||||
---
|
||||
|
||||
## 七、一句话总结
|
||||
|
||||
当前老模板 SEO 主线的真实状态是:
|
||||
|
||||
> 百度已经开始给个别老模板站深抓机会,但站群整体仍然缺少分类层放量;短期最值得做的是围绕 `yagyjt.com` 这种已深抓样板站压旧路由成本、盯分类抓取起量,而不是把精力继续带偏到 GPT 模板或不存在的 5xx 故障上。
|
||||
|
||||
---
|
||||
|
||||
## 八、2026-04-17 晚间追加:工作台 page_type 口径补强已落地
|
||||
|
||||
在继续复核真实 payload 后,本轮又确认了一个会直接影响判断的问题:
|
||||
|
||||
- spider workbench 的统计高度依赖上游推送的 `page_type`
|
||||
- 如果上游把老模板历史路由打成 `other`
|
||||
- 工作台就会把真实分类 / 详情 / 播放流量低估掉
|
||||
|
||||
### 已确认的真实误标样本
|
||||
|
||||
1. 分类页误标
|
||||
- `/videotype-zong-yi/all-1948-nuo-wei-all/yin-du-yu-page1`
|
||||
- 原始 `page_type = other`
|
||||
2. 播放页误标
|
||||
- `/video-play/ni-tian-zhi-zun-26066-fengchao-137`
|
||||
- 原始 `page_type = other`
|
||||
3. 详情页漏算线索
|
||||
- `www.ningxiaowei.com`
|
||||
- `/video-info/...`
|
||||
- 在最近 run 中由 `baiduspider` 命中 `200 / 301`
|
||||
- 但原始 bucket 仍可能落在 `other`
|
||||
|
||||
### 已落地的修正
|
||||
|
||||
本轮已在抓取摘要 ingest 阶段增加“路径兜底识别”,仅在上游值为空或为 `other` 时生效:
|
||||
|
||||
- 文件:
|
||||
- [DomainSpiderCrawlLogSchemaHelper.php](/www/wwwroot/VideoSource2/code/app/common/helper/DomainSpiderCrawlLogSchemaHelper.php:1)
|
||||
- [DomainSpiderCrawlLogHelper.php](/www/wwwroot/VideoSource2/code/app/common/helper/DomainSpiderCrawlLogHelper.php:1)
|
||||
- 兜底识别范围:
|
||||
- `videotype / vodtype / fenlei` -> `category`
|
||||
- `video-info / voddetail / neirong-` -> `detail`
|
||||
- `video-play / vodplay / bf-` -> `play`
|
||||
- `robots.txt` -> `robots`
|
||||
- `sitemap*` -> `sitemap`
|
||||
- `search / get-index` -> `search`
|
||||
|
||||
### 本地复核结果
|
||||
|
||||
用真实 run:
|
||||
|
||||
- `20260417/201003_crawl_log_push_f72827`
|
||||
|
||||
重新过 ingest 后,结果已经变为:
|
||||
|
||||
1. `/videotype-zong-yi/...` -> `category`
|
||||
2. `/video-play/...` -> `play`
|
||||
|
||||
这说明:
|
||||
|
||||
- 当前 workbench 的老模板分类/播放统计,后续会比之前更接近真实情况
|
||||
- `category=0` 这类结论之后必须结合新 ingest 结果再判断
|
||||
- 这次修正只影响蜘蛛分析口径,不会直接改动老模板页面输出,也不会直接影响 `videoGpt1` 模板渲染
|
||||
|
||||
### 已追加重建 latest 摘要
|
||||
|
||||
为了避免 admin2 / workbench 继续读取旧的 `latest` 静态摘要,本轮还额外重建了:
|
||||
|
||||
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.json`
|
||||
- `code/storage/domain-spider-crawl/latest/spider-crawl.summary.html`
|
||||
|
||||
重建时间:
|
||||
|
||||
- `2026-04-17T20:20:54+08:00`
|
||||
|
||||
重建后,按最近 `24` 个 run 合并统计得到的页面类型分布为:
|
||||
|
||||
- `robots = 281`
|
||||
- `home = 77`
|
||||
- `detail = 34`
|
||||
- `play = 11`
|
||||
- `category = 4`
|
||||
- `sitemap = 2`
|
||||
- `other = 17`
|
||||
|
||||
这和修正前相比,至少已经明确证明:
|
||||
|
||||
1. 分类页不再是绝对 `0`
|
||||
2. 旧 `video-info / video-play / videotype` family 的流量不再全部沉到底部 `other`
|
||||
3. 后续再看老模板“百度有没有进分类 / 详情 / 播放”,工作台数据可信度会更高
|
||||
|
||||
---
|
||||
|
||||
## 九、2026-04-17 20:30 再复核补充
|
||||
|
||||
在继续用 `DomainSpiderCrawlWorkbenchHelper::buildSummary(...)` 复核后,当前还要再补 3 条交接级结论。
|
||||
|
||||
### 1. 当前正式应以 24h 聚合视角为主,不应以 `latest` 覆盖文件为主
|
||||
|
||||
`latest/spider-crawl.summary.json` 在 `20:30` 时已经被新的前端 push 覆盖成一份很小的最近样本。
|
||||
|
||||
但同一时刻按 workbench 24h 聚合得到的真实视角仍然是:
|
||||
|
||||
- 总请求:`72`
|
||||
- 详情:`21`
|
||||
- 播放:`4`
|
||||
- 分类:`1`
|
||||
- sitemap:`2`
|
||||
- robots:`11`
|
||||
|
||||
因此后续主 Codex 如果看到:
|
||||
|
||||
- `latest` 很小
|
||||
- 甚至只剩少量 `robots/home`
|
||||
|
||||
不要直接判断成:
|
||||
|
||||
- 老模板蜘蛛量掉空
|
||||
- 深页信号消失
|
||||
|
||||
更稳的做法是始终回到 24h 聚合视角看趋势。
|
||||
|
||||
### 2. `yagyjt.com` 目前仍是第一样板站,但问题已明确集中到入口层
|
||||
|
||||
截至 `20:30` 的 host detail:
|
||||
|
||||
- 总请求:`28`
|
||||
- 深页请求:`16`
|
||||
- 异常:`18`
|
||||
- 状态:
|
||||
- `200 = 10`
|
||||
- `301 = 10`
|
||||
- `444 = 7`
|
||||
- `403 = 1`
|
||||
|
||||
当前最高优先级异常已经非常集中:
|
||||
|
||||
- `/robots.txt`
|
||||
- `/sitemap_index.xml`
|
||||
- `/videotype/1-dian-ying`
|
||||
- `/`
|
||||
|
||||
也就是说,这个站已经不是“有没有深抓”的问题,而是:
|
||||
|
||||
- 已经深抓
|
||||
- 但入口质量还不够稳
|
||||
|
||||
所以后续如果要拿一个站做百度 7 天冲量观察,优先还是盯它。
|
||||
|
||||
### 3. `www.ningxiaowei.com` 更适合当“深链承接效率”样本
|
||||
|
||||
截至 `20:30` 的 host detail:
|
||||
|
||||
- 总请求:`8`
|
||||
- 深页请求:`8`
|
||||
- 全部都是 `detail`
|
||||
- 状态:
|
||||
- `200 = 4`
|
||||
- `301 = 4`
|
||||
|
||||
它的特点不是入口层扩张,而是:
|
||||
|
||||
- 百度已经明确在消费 `/video-info/...` 这类当前有效 family
|
||||
- 但还没有看到首页 / 分类 / sitemap 同步扩张
|
||||
|
||||
因此它更适合当:
|
||||
|
||||
- 详情页 URL family 正确性观察样本
|
||||
- 深链 `301 -> 200` 承接效率样本
|
||||
|
||||
不适合拿来代替 `yagyjt.com` 做入口层样板。
|
||||
Reference in New Issue
Block a user