Files
SEONexus/docs/2026-04-18-AI文案与视频元数据公共规则主线.md

223 lines
8.0 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 2026-04-18 AI文案与视频元数据公共规则主线
这份文档不是 GPT 模板专属文档,而是当前整个项目的公共规则主线。
适用范围:
1. GPT 模板
2. 老模板
3. 后续其它模板
4. 后台人工触发 AI
5. Codex 接手优化
6. 视频采集、视频回填、SEO 文案生成、详情页正文补全
一句话:
> 从 2026-04-18 开始,`AI 文案规则` 和 `视频元数据缺失处理规则` 统一提升为全项目公共规则,所有接手 Codex 都必须先读。
## 为什么要升级成公共规则
前面这些规则虽然最早是在 GPT 模板线里沉淀出来的,但它们约束的不是某一个模板的视觉或 SEO 结构,而是整个项目共同面对的两类基础问题:
1. AI 文案怎么在真实边界内写得更像人工、又不伤 SEO
2. 演员、导演、年份、地区、语言、简介等字段为空时,系统应该怎么处理,才能既不乱猜又能持续沉淀进视频库
这两件事天然就是全项目公共能力,不应该只埋在某条模板支线下面。
## 公共规则 1AI 文案最高指令
所有 AI 文案,不管是后台 OpenAI、批处理提示词还是 Codex 参考输出,都必须遵守:
1. 共同目标是:`SEO 效果 + 可读性 + 真实感 + 可持续收录`
2. 只能基于已提供字段和事实写,不允许虚构剧情、角色关系、上映信息、评价内容、播放权益或不存在的资料
3. 如果现有规则开始明显压制 SEO 增长、压制点击意图、压制更高质量发挥,不能静默硬套,必须明确提出冲突点,再讨论升级
4. 不允许为了“守规则”写出机械化、模板化、低区分度文案
5. 不允许写营销承诺词,例如:
- `免费观看`
- `高清完整版`
- `极速播放`
- `本站提供`
- `全网最全`
6. 不允许堆砌关键词,不允许片名大面积重复,通常不要超过 `2`
7. 语言必须自然、克制、像人工整理,不要满篇泛称、代词和模板痕迹
## 公共规则 2缺失字段绝不能靠 AI 猜
下面这些字段都属于结构化事实字段:
1. 演员
2. 导演
3. 年份
4. 地区
5. 语言
6. 发布日期
统一规则:
1. 这些字段优先靠 `重采 / 补源 / 人工校正`
2. 不允许 AI 猜测补齐
3. `内详 / 未知 / 不详 / 待补充 / 暂无 / 未知演员 / 未知导演` 一律按缺失处理
4. 搜到了详情,不等于补齐成功
5. 只有拿到真实有效字段值,才算补齐
## 公共规则 3文案型空字段可以补但只能在真实性边界内补
下面这些字段属于文案型字段:
1. 简介
2. 备注
3. 详情页摘要
4. 详情页正文补充
统一规则:
1. 可以在真实性边界内由 AI 补全
2. 只能使用已有字段组织文案,不能脑补事实
3. 优先写成自然、克制、资料型、可收录的内容
4. 只补空字段,不覆盖已有非空字段
5. 如果事实基础太弱,允许写短,不能硬凑长文
## 公共规则 4缺失字段必须优先写回视频库
这是当前整个项目都要遵守的公共回写原则:
1. 缺失字段一旦补到,优先写回视频数据库
2. 默认原则:`只补空字段,不覆盖已有非空字段`
3. 不允许把空值、脏值、占位值写成“已补齐”
4. 写库目标不是把库塞满,而是让视频记录后续越来越完整,减少反复空转
## 公共规则 5当前全项目的字段优化主矛盾
到目前这一步,文案型空字段已经不是主矛盾,真正的主矛盾是:
1. `v_actor`
2. `v_director`
所以全项目视频 SEO 元数据优化主线已经统一切成两条:
1. 结构化字段缺失:
- 走重采、补源、人工校正
2. 文案型字段缺失:
- 在真实性边界内走 AI 补全并写回空字段
## 当前全项目统一执行口径
### A. 做 AI 文案时
1. 先看事实字段是否足够
2. 足够才写
3. 不足就克制写成资料型
4. 不够就宁可短,不要乱编
### B. 做字段补齐时
1. 先区分结构化字段和文案型字段
2. 结构化字段缺失优先排到重采队列
3. 文案型字段缺失优先排到 AI 补全队列
4. 所有结果最终都要沉淀回视频库
### B.1 做缺字段扫描和任务派发时
当前全项目建议统一使用下面这条命令做安全触发:
```bash
php SEONexus/code/think video:metadata:task-pool --sample=8 --queue-limit=50 --prompt-limit=10 --batch-size=10 --batch-limit=10
```
这条命令的统一含义是:
1. 扫描视频缺字段情况
2. 刷新工作台产物
3. 生成可派给 Codex 的缺字段任务池
4. 不自动补演员、导演、年份、地区、语言、发布日期
5. 不自动偷偷调用 OpenAI API
所以它适合作为:
1. 其它项目同步代码后的首条启动命令
2. 计划任务挂接入口
3. 技术排查当前缺字段规模的统一入口
如果当前项目使用数据库计划任务表统一调度,也可以使用:
1. `pt_code = REFRESH_VIDEO_METADATA_TASK_POOL`
2. 对应安全入口为 `PlanTask::refreshVideoMetadataTaskPool()`
这条入口仍然遵守同一条公共边界:
1. 生成扫描与派单产物
2. 不自动补事实字段
3. 不自动调用 OpenAI API
4. 不自动写回视频库
当前配套的两个运维入口也建议一起看:
1. 状态总览页:用于看当前缺字段规模、任务池批次状态、计划任务状态
2. 运维总览页:用于看当前推荐动作、常用命令、产物路径
对应产物目录为:
```text
SEONexus/code/app/public/_admin_templates/video-metadata-missing-task-pool/
```
如果你更习惯后台 JSON 入口,也可以直接用:
1. `GET /admin/video/metadata/missing/task-pool/status`
2. `GET /admin/video/metadata/missing/task-pool/ops`
### B.2 页面入口和数据接口要分开理解
从这轮开始,这条线的后台页面已经迁到 Vue 后台 `SEONexusAdmin`
统一口径:
1. `PHP /admin/video/...`
主要提供数据接口
2. `Vue #/video/...`
主要提供后台实际操作页面
当前页面型入口统一使用:
1. `#/video/metadata/missing/workbench`
2. `#/video/metadata/missing/task-pool`
3. `#/video/metadata/missing/task-pool/status`
4. `#/video/metadata/missing/task-pool/ops`
这一步的意义是:
1. 后台页面能力统一收回到 Vue 工程
2. PHP 侧不再继续膨胀出一套“伪后台页面”
3. 同步到其它服务器时,更容易区分哪些是接口代码,哪些是前端页面代码
### C. 做复盘时
1. 不只看“命中没命中”
2. 要看字段缺失审计是否真实下降
3. 要看是否误写了无效值、占位值、脏值
## 公共阅读入口
所有新接手 Codex建议先按这个顺序读
1. [README.md](/www/wwwroot/diff-maccms/SEONexus/docs/README.md)
2. [Codex启动提示词模板.md](/www/wwwroot/diff-maccms/SEONexus/docs/Codex启动提示词模板.md)
3. [2026-04-18-AI文案与视频元数据公共规则主线.md](/www/wwwroot/diff-maccms/SEONexus/docs/2026-04-18-AI文案与视频元数据公共规则主线.md)
4. [2026-04-18-视频元数据缺失处理公共执行规则.md](/www/wwwroot/diff-maccms/SEONexus/docs/2026-04-18-视频元数据缺失处理公共执行规则.md)
如果接手的是 GPT 模板支线,再继续看:
1. [2026-04-18-GPT模板SEO公共主线汇总.md](/www/wwwroot/diff-maccms/SEONexus/docs/2026-04-18-GPT模板SEO公共主线汇总.md)
2. [gpt-template-seo/README.md](/www/wwwroot/diff-maccms/SEONexus/docs/gpt-template-seo/README.md)
## 来源说明
这份公共规则主线并不是凭空新建,而是把原本已经在 GPT 模板线里验证通过的规则,提升成项目公共规则。
规则来源主要包括:
1. [gpt-template-seo/17-GPT模板AI文案最高规则-2026-04-18.md](/www/wwwroot/diff-maccms/SEONexus/docs/gpt-template-seo/17-GPT模板AI文案最高规则-2026-04-18.md)
2. [gpt-template-seo/18-GPT模板演员导演缺失重采Top50执行单-2026-04-18.md](/www/wwwroot/diff-maccms/SEONexus/docs/gpt-template-seo/18-GPT模板演员导演缺失重采Top50执行单-2026-04-18.md)
从现在开始,这两份属于“来源与实验沉淀文档”,而这份文档属于“全项目公共总口径文档”。