15 KiB
1299-SEONexus 老模板最新蜘蛛日志实战分析 - 2026-04-17
目的
这份文档只服务老模板 1001-1005 的 SEO 主线。
目标不是泛泛而谈“蜘蛛有波动”,而是把 2026-04-17 当前仓库内最新的 spider workbench 聚合数据,直接翻译成主 Codex 可执行的判断。
明确边界:
- 只看老模板:
videoDadi / videoDingZhu / videoBoKu / videoLaoNiu / videoNuNu - 不把
videoGpt1混进本轮结论 - 当前重点是百度主线,同时兼看
bytespider / sogou
一、数据来源
本轮结论不能只看单个 latest 文件,而要分两层理解:
- 最近一次 push 摘要
code/storage/domain-spider-crawl/latest/spider-crawl.summary.jsoncode/storage/domain-spider-crawl/latest/spider-crawl.summary.html
- 工作台 24h 聚合逻辑
code/app/common/helper/DomainSpiderCrawlWorkbenchHelper.php- 通过
buildSummary(...)聚合最近窗口内多次 run
这里要特别提醒后续主 Codex:
latest/spider-crawl.summary.json会被SeoCollector::saveCrawlLogs()每次新 push 直接覆盖- 它代表“最近一次 push 摘要”
- 不天然等于“最近 24h 全局聚合”
2026-04-17 20:30 复核时就已经看到这个现象:
latest文件只剩一小批最近推送数据- 但 workbench 24h 聚合后,老模板依然有连续深抓记录
所以本页正文以下结论,统一以 WorkbenchHelper::buildSummary(..., windowHours=24, selectedBots=baiduspider,bytespider,sogou) 为准。
二、当前全局结论
当前这批老模板域名,按 2026-04-17 20:30 的 24h 聚合视角,蜘蛛数据呈现出 4 个非常明确的信号:
- 已经有百度深抓样本
- 不是“完全没抓”
- 已经出现
detail / play命中
- 入口层仍然偏弱
robots_requests = 11sitemap_requests = 2category_requests = 1
- 当前异常主因不是 5xx
500 = 0- 主要是
301 / 403 / 444
- 当前最该处理的是“入口质量”和“旧路由信号”
- 不是把老模板误判成 GPT 模板结构问题
工作台聚合概览:
- 总请求:
72 - 域名数:
14 - 蜘蛛数:
2 - 首页请求:
33 - 分类请求:
1 - 详情请求:
21 - 播放请求:
4 - robots 请求:
11 - sitemap 请求:
2 - 状态分布:
200 = 34301 = 24403 = 6444 = 8500 = 0
这说明当前阶段不是服务整体炸了,而是:
- 百度已经开始进部分深页
- 但分类层和 sitemap 层仍然明显偏弱
- 同时入口层的
403/444还在反复拖累蜘蛛体验
三、已经确认属于老模板的代表域名
本轮已从正式库 domain 表确认以下域名及模板归属:
| 域名 | t_id | 模板 |
|---|---|---|
proenerji.com |
1001 |
videoDadi |
qf123.net |
1001 |
videoDadi |
qingyejianshe.com |
1002 |
videoDingZhu |
tvwallmountreview.com |
1002 |
videoDingZhu |
yagyjt.com |
1002 |
videoDingZhu |
ctshuhua.com |
1003 |
videoBoKu |
ningxiaowei.com |
1003 |
videoBoKu |
yqshu8.com |
1004 |
videoLaoNiu |
syzhzs.com |
1005 |
videoNuNu |
yahuawang88.com |
1005 |
videoNuNu |
所以当前 spider workbench 里这批代表站点,确实就是老模板主线,不是 GPT 模板误入。
四、最关键的 3 条判断
1. 百度已经给了 yagyjt.com 深抓机会
这是本轮最重要的正向样本。
工作台给出的状态:
- host:
yagyjt.com - 模板:
1002 / videoDingZhu - 总请求:
28 - 深页请求:
16 - 详情请求:
12 - 播放请求:
4 - 首页请求:
6 - robots 请求:
3 - sitemap 请求:
2 - 分类请求:
1
说明:
- 百度并不是只停留在首页
- 这个站已经被拉进 detail/play 维度
- 同时入口层也已经开始探测
robots / sitemap / category - 它应该被当成老模板第一优先样板站
但它同时也有明显问题:
anomaly_count = 18- 深页异常主要是
301 - 命中的 URL 形态是:
/voddetail/.../vodplay/...
这说明百度仍然在消费旧路由资产,当前站点靠 301 把蜘蛛导向现行规范地址。
结论:
- 这不是致命故障
- 但会拖慢抓取效率和权重沉淀速度
- 未来 7 天内,这个站最值得持续观察
2. 老模板群的真正短板仍然是“分类层没起量”
最新聚合里:
category_requests = 1sitemap_requests = 2
虽然已经不再是绝对 0,但这个量级依然远远弱于深页和首页,所以这比单纯的深页 301 更值得重视。
因为它意味着:
- 百度当前对老模板站群的抓取入口仍然偏窄
- 主要仍靠首页或历史旧链接进入
- 分类页还没有形成稳定抓取面
- sitemap 也只是开始露头,还没形成可见收益
这也正好验证了本轮已落地的第一批模板修正方向是对的:
- 分类页 canonical 修正
- 分类页
og:url修正 - 分类页 JSON-LD
url修正 - 播放页 canonical /
og:url/ JSON-LD 对齐 - sitemap 主输出去掉
www + novel旧噪音
2.1 这里还要额外防一个“统计口径误判”
虽然最新 24h 聚合里显示:
category_requests = 1
但这条数据不能被机械理解成:
- “蜘蛛完全没有碰过分类页”
原因是:
- spider workbench 本身不会按 URL 自动识别分类页
- 它依赖上游推送时已经写好的
page_type - 当前仓库内
DomainSpiderCrawlLogSchemaHelper只做枚举归一,不做 URL 路径识别
也就是:
- 如果前端 spiderlog-agent 把分类 URL 直接标成了
other - 工作台这里就会继续把它统计成
other - 最终看起来会像“分类始终为 0”
本轮已经在真实 payload 里看到过一条直接证据:
- run:
20260417/201003_crawl_log_push_f72827 - host:
sctyjz.com - url:
/videotype-zong-yi/all-1948-nuo-wei-all/yin-du-yu-page1 - 当前标记:
page_type = other - bot:
googlebot - status:
444
这说明:
- 至少在当前采集链里,分类 URL 被误标成
other是真实存在的 - 所以后续主 Codex 看
category_requests = 0时,必须同时保留一个判断分支:- 可能是真没抓
- 也可能是上游 page_type 归类口径不完整
不过要注意:
- 在我额外抽查的最近数个
2026-04-17run 里 - 暂时还没有找到
baiduspider / bytespider / sogou的分类 URL 被误标成other的直接样本
所以当前更稳的表达是:
老模板分类抓取当前仍然偏弱,而且
category指标本身仍存在口径风险,不能单独作为百度触达面的唯一判断依据。
3. bytespider 当前不是“没来”,而是“来了但 robots 层体验差”
最新异常里,最高优先级几乎都集中在:
qf123.netwww.proenerji.comwww.ctshuhua.comwww.qf123.netwww.qingyejianshe.comwww.syzhzs.comwww.yagyjt.comwww.tvwallmountreview.com
共同特征:
- URL:
/robots.txt - bot:
bytespider - 状态:
403 / 444
这说明:
- 头条蜘蛛不是没探测
- 它已经反复试图读取入口文件
- 但当前入口层对它不友好
同时,现有老模板 robots.txt 模板里只明确放行了:
Baiduspider360SpiderSogou web spiderSogou inst spiderYisouSpiderQuarkbotGooglebot
没有显式放行 Bytespider。
结论分两层:
- 从“百度 7 天冲量”主目标看
bytespider不是第一优先级- 不应该压过百度分类/深页主线
- 从“国内蜘蛛入口完整度”看
- 后续可以单独给老模板 robots 增补
Bytespider - 但前提是先确认线上
403/444是否来自模板输出,还是前端防护层
- 后续可以单独给老模板 robots 增补
五、当前不能误判的点
1. 不能把 301 一律当致命异常
以 yagyjt.com 为例,百度命中的是:
/voddetail/.../vodplay/...
这更像是历史收录或历史外链还在发挥作用。
如果当前站点已经把它们稳定 301 到规范地址,那么它的问题是:
- 抓取成本高
- 信号绕路
而不是:
- 页面完全打不开
- 老模板彻底不可抓
2. 当前没有证据说明老模板普遍 5xx
最新 24h 聚合里:
500 = 0
所以本轮不能把精力浪费在“怀疑后端整体炸了”上。
更应该盯的是:
- 分类抓取为什么还没起来
- sitemap 为什么没有形成可见命中
- 已深抓样板站能不能进一步减少旧路由依赖
3. 1270 不能代替老模板 SEO 主线
1270 当前仍然主要是 GPT 模板交接总文档。
老模板这一支继续推进时,应优先参考:
12691286128712891290129112921293129412951296- 本文
1299
六、对主 Codex 最有价值的执行建议
优先级 A:持续观察并放大 yagyjt.com
原因:
- 它已经是百度深抓样板
- 模板归属明确:
1002 / videoDingZhu - 最适合作为“老模板 7 天冲量”的核心跟踪站
建议动作:
- 复核
yagyjt.com当前详情页和播放页规范地址是否稳定 - 观察旧
/voddetail、/vodplay是否始终 301 到唯一规范 URL - 看未来 24-72 小时内,百度是否开始从
detail/play 301转向规范深页 200
优先级 B:盯分类层起量,而不是继续沉迷首页
因为最新数据说明:
- 首页已经有命中
- 深页也不是完全没有
- 但分类层和 sitemap 层仍然显著偏弱
这意味着后续最该看的提升信号是:
- 是否开始出现
category_requests > 0 - 是否开始有分类页 200 被百度命中
- 是否由分类页继续向详情页扩散
优先级 C:把 robots 的国内蜘蛛兼容性单独列为副线
这条线不能抢主线,但也不能完全忽略。
建议:
- 先确认
403/444是前端防护层行为,还是应用层输出问题 - 如果模板输出可控,再评估是否给老模板
robots.txt增补:User-agent: BytespiderAllow: /
- 即便要改,也应单独开小任务,不要和百度主线混着验
七、一句话总结
当前老模板 SEO 主线的真实状态是:
百度已经开始给个别老模板站深抓机会,但站群整体仍然缺少分类层放量;短期最值得做的是围绕
yagyjt.com这种已深抓样板站压旧路由成本、盯分类抓取起量,而不是把精力继续带偏到 GPT 模板或不存在的 5xx 故障上。
八、2026-04-17 晚间追加:工作台 page_type 口径补强已落地
在继续复核真实 payload 后,本轮又确认了一个会直接影响判断的问题:
- spider workbench 的统计高度依赖上游推送的
page_type - 如果上游把老模板历史路由打成
other - 工作台就会把真实分类 / 详情 / 播放流量低估掉
已确认的真实误标样本
- 分类页误标
/videotype-zong-yi/all-1948-nuo-wei-all/yin-du-yu-page1- 原始
page_type = other
- 播放页误标
/video-play/ni-tian-zhi-zun-26066-fengchao-137- 原始
page_type = other
- 详情页漏算线索
www.ningxiaowei.com/video-info/...- 在最近 run 中由
baiduspider命中200 / 301 - 但原始 bucket 仍可能落在
other
已落地的修正
本轮已在抓取摘要 ingest 阶段增加“路径兜底识别”,仅在上游值为空或为 other 时生效:
- 文件:
- 兜底识别范围:
videotype / vodtype / fenlei->categoryvideo-info / voddetail / neirong-->detailvideo-play / vodplay / bf-->playrobots.txt->robotssitemap*->sitemapsearch / get-index->search
本地复核结果
用真实 run:
20260417/201003_crawl_log_push_f72827
重新过 ingest 后,结果已经变为:
/videotype-zong-yi/...->category/video-play/...->play
这说明:
- 当前 workbench 的老模板分类/播放统计,后续会比之前更接近真实情况
category=0这类结论之后必须结合新 ingest 结果再判断- 这次修正只影响蜘蛛分析口径,不会直接改动老模板页面输出,也不会直接影响
videoGpt1模板渲染
已追加重建 latest 摘要
为了避免 admin2 / workbench 继续读取旧的 latest 静态摘要,本轮还额外重建了:
code/storage/domain-spider-crawl/latest/spider-crawl.summary.jsoncode/storage/domain-spider-crawl/latest/spider-crawl.summary.html
重建时间:
2026-04-17T20:20:54+08:00
重建后,按最近 24 个 run 合并统计得到的页面类型分布为:
robots = 281home = 77detail = 34play = 11category = 4sitemap = 2other = 17
这和修正前相比,至少已经明确证明:
- 分类页不再是绝对
0 - 旧
video-info / video-play / videotypefamily 的流量不再全部沉到底部other - 后续再看老模板“百度有没有进分类 / 详情 / 播放”,工作台数据可信度会更高
九、2026-04-17 20:30 再复核补充
在继续用 DomainSpiderCrawlWorkbenchHelper::buildSummary(...) 复核后,当前还要再补 3 条交接级结论。
1. 当前正式应以 24h 聚合视角为主,不应以 latest 覆盖文件为主
latest/spider-crawl.summary.json 在 20:30 时已经被新的前端 push 覆盖成一份很小的最近样本。
但同一时刻按 workbench 24h 聚合得到的真实视角仍然是:
- 总请求:
72 - 详情:
21 - 播放:
4 - 分类:
1 - sitemap:
2 - robots:
11
因此后续主 Codex 如果看到:
latest很小- 甚至只剩少量
robots/home
不要直接判断成:
- 老模板蜘蛛量掉空
- 深页信号消失
更稳的做法是始终回到 24h 聚合视角看趋势。
2. yagyjt.com 目前仍是第一样板站,但问题已明确集中到入口层
截至 20:30 的 host detail:
- 总请求:
28 - 深页请求:
16 - 异常:
18 - 状态:
200 = 10301 = 10444 = 7403 = 1
当前最高优先级异常已经非常集中:
/robots.txt/sitemap_index.xml/videotype/1-dian-ying/
也就是说,这个站已经不是“有没有深抓”的问题,而是:
- 已经深抓
- 但入口质量还不够稳
所以后续如果要拿一个站做百度 7 天冲量观察,优先还是盯它。
3. www.ningxiaowei.com 更适合当“深链承接效率”样本
截至 20:30 的 host detail:
- 总请求:
8 - 深页请求:
8 - 全部都是
detail - 状态:
200 = 4301 = 4
它的特点不是入口层扩张,而是:
- 百度已经明确在消费
/video-info/...这类当前有效 family - 但还没有看到首页 / 分类 / sitemap 同步扩张
因此它更适合当:
- 详情页 URL family 正确性观察样本
- 深链
301 -> 200承接效率样本
不适合拿来代替 yagyjt.com 做入口层样板。