Files
SEONexus/docs/old-tmp-seo/27-老模板SitemapPatch模板-2026-04-17.md
2026-04-17 21:09:06 +08:00

215 lines
5.0 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 1296-SEONexus 老模板 Sitemap Patch 模板 - 2026-04-17
## 目的
这份文档专门服务第一批 5 个 `sitemap-main.xml` 文件。
适用文件:
- `videoDadi/sitemap/sitemap-main.xml`
- `videoDingZhu/sitemap/sitemap-main.xml`
- `videoBoKu/sitemap/sitemap-main.xml`
- `videoLaoNiu/sitemap/sitemap-main.xml`
- `videoNuNu/sitemap/sitemap-main.xml`
它的目标不是一步做成终极 sitemap而是给主 Codex 一份“先止损、先收口”的 patch 模板。
## 一、这 5 个文件当前共同问题
5 套文件当前完全同构,问题也完全一致:
1. host 使用 `https://www.{$DomainModel->d_domain}`
2. 页面逻辑明显像小说站:
- `novel:category`
- `novel:sort`
- `novel:status`
- `site:nflurl`
这意味着当前 `sitemap-main.xml` 至少存在两层问题:
- host 口径和页面主输出不一致
- 页型逻辑本身很可能就不属于视频站
## 二、为什么第一批不建议“直接重建完整视频 sitemap”
因为第一批当前更重要的是:
- 先停止输出错误信号
- 先停止 sitemap 自己制造 `www` 级跳转
如果现在就直接重建完整视频 sitemap会立刻引入这些风险
- 需要重新确认视频分类页、榜单页、详情页到底要进哪些
- 需要确认对应模板是否都已有稳定最终 URL
- 需要确认分页和去重策略
这会让第一批从“快速止损”变成“大重构”。
## 三、第一批最稳策略
### 策略名:最小正确集
第一批建议把 `sitemap-main.xml` 收缩成只保留:
1. 首页
2. 榜单首页
同时完成两件事:
- 去掉 `www`
- 删除整段明显错误的小说站逻辑
## 四、为什么这个策略是当前最稳的
因为现在 `robots.txt` 已经统一指向:
```txt
Sitemap: https://{$DomainModel->d_domain}/sitemap_index.xml
```
也就是说:
- `robots.txt` 已经在告诉蜘蛛“请走裸域 sitemap”
`sitemap-main.xml` 还在吐:
```xml
https://www.{$DomainModel->d_domain}
```
这本身就在制造冲突。
所以第一批先做:
- `robots.txt` 继续保持不动
- `sitemap-main.xml` 收口到与它一致
这是最容易立刻减少内部冲突的一刀。
## 五、推荐 patch 思路
### 当前错误版本的典型结构
当前文件大致是:
```xml
<url>
<loc>https://www.{$DomainModel->d_domain}/</loc>
...
</url>
<url>
<loc>https://www.{$DomainModel->d_domain}{$strRankUrlTemp}</loc>
...
</url>
{novel:category ...}
{novel:sort ...}
{novel:status ...}
<url>
<loc>https://www.{$DomainModel->d_domain}{site:nflurl ... /}</loc>
...
</url>
{/novel:status}
{/novel:sort}
{/novel:category}
```
### 第一批建议改成
保留首页和榜单页,但去掉 `www`
```xml
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://{$DomainModel->d_domain}/</loc>
<lastmod>{:date('Y-m-d')}</lastmod>
<changefreq>daily</changefreq>
<priority>1.0</priority>
</url>
<url>
<loc>https://{$DomainModel->d_domain}{$strRankUrlTemp}</loc>
<lastmod>{:date('Y-m-d')}</lastmod>
<changefreq>daily</changefreq>
<priority>1.0</priority>
</url>
</urlset>
```
## 六、推荐 patch 结果的优点
这个“最小正确集”版本有 4 个优点:
1. 不再输出明显错误的小说站路径
2. 不再继续输出 `www`
3. 不需要先设计视频分类 sitemap 结构
4. 最容易快速验证是否减少 `/|301` 和 host 级冲突
## 七、当前不建议在第一批做的事
下面这些更适合第二批:
- 把视频分类页全部灌进 `sitemap-main.xml`
- 把详情页或播放页直接灌进 `sitemap-main.xml`
-`sitemap-main.xml` 里处理复杂分页
- 重新设计多 sitemap 分片策略
不是这些没价值,而是它们更适合在第一批止损之后做。
## 八、和 `robots.txt` 的关系
当前 5 套 `robots.txt` 的最后一行已经统一是:
```txt
Sitemap: https://{$DomainModel->d_domain}/sitemap_index.xml
```
因此第一批 patch 的原则是:
-`sitemap-main.xml``robots.txt` 靠齐
- 而不是反过来去改 `robots.txt`
这也是为什么当前建议:
- `robots.txt` 暂不主改
- 主改 `sitemap-main.xml`
## 九、建议验收方式
每改完 1 个 `sitemap-main.xml`,先做最小验收。
### 页面源代码验收
确认:
1. XML 可以正常访问
2. 首页 `<loc>` 是裸域,不是 `www`
3. 榜单页 `<loc>` 是裸域,不是 `www`
4. 文件里不再出现:
- `novel:category`
- `novel:sort`
- `novel:status`
- `site:nflurl`
### 域名级优先验收
优先看:
- `sctyjz.com`
- `www.ap-hulan.com`
- `hymdrz.com`
## 十、验收后的日志观察
改完这 5 个 sitemap 之后,连续看 3 天最值得盯的是:
1. `/|301` 是否下降
2. `home|301` 是否下降
3. host 分裂是否开始减轻
## 十一、一句话交接
> 老模板第一批 sitemap patch 的核心不是“马上做大做全”,而是先让 sitemap 不再输出明显错误的小说站路径,不再自带 `www` 级冲突;只要先把 sitemap-main 收成最小正确集,就已经是在给百度减损。