docs: move ops runtime tracking under docs

This commit is contained in:
Your Name
2026-04-19 02:27:06 +08:00
parent 74dc009c3d
commit ad513211e6
26 changed files with 1604 additions and 283 deletions

View File

@@ -0,0 +1,156 @@
# HANDOFF 2026-04-19 01:01
## 当前最高优先级
唯一最高优先级:
- 完成 `B2-Journal Permission Closure`
原因:
- 接管链路已经闭合
- acceptance 队列不消费问题已经修复
- 当前两条 acceptance run 只剩同一个失败步骤:
- `node_agent_logs`
## 本轮处理结论
本轮没有继续扩展控制面,也没有新增页面或模块。
本轮只做了两件事:
1. 把剩余阻塞进一步收敛为明确的环境落点:
- `domaincheck-node-agent.service``www:www` 运行
- 现网 unit 没有给 `www``journalctl` 所需的读取权限
2. 在仓库中的 Node Agent systemd 模板加入:
- `SupplementaryGroups=systemd-journal`
文件变更:
- `domain-api/deploy/systemd/domain-node-agent.service`
## 当前状态
当前摘要:
- `pending_bootstrap = 0`
- `agent_ready = 3`
- `remote_access_ready = 3`
- `managed_enabled = 3`
- `log_sync_state = full_capture`
acceptance 摘要:
- `mainland-worker-01`
- `run_code = pbr-137e8b258b`
- `status = attention`
- `4 success + 1 failed`
- 唯一失败步骤:`node_agent_logs`
- `mainland-controller-01`
- `run_code = pbr-bfed43ea46`
- `status = attention`
- `4 success + 1 failed`
- 唯一失败步骤:`node_agent_logs`
## 当前唯一剩余阻塞
唯一剩余阻塞:
- 两台大陆节点尚未刷新新的 Node Agent systemd unit
准确卡点:
- 代码仓库里已经补了 `SupplementaryGroups=systemd-journal`
- 但远端节点上的 `/etc/systemd/system/domaincheck-node-agent.service` 还需要重新安装并重启服务
阻塞分类:
- 环境 / 权限问题
不是以下问题:
- 不是 SSH 问题
- 不是 agent offline
- 不是 acceptance 队列不消费
- 不是控制面接口 404
## 下一轮若继续,第一步先做什么
下一轮第一步只做这一件事:
-`mainland-controller-01``mainland-worker-01` 上重新安装最新 Node Agent unit并重启 `domaincheck-node-agent`
然后依次做:
1. 确认 unit 已带 `SupplementaryGroups=systemd-journal`
2. 重跑两台节点 acceptance
3. 复核:
- `go-live-summary`
- `stack-diagnosis`
- `release-launchpad`
4. 输出上线签收证据摘要
## 推荐模型与推理等级
继续推荐:
- `GPT-5.4`
- `high`
原因:
- 当前阶段是最后一段 acceptance 收口
- 需要稳定处理运行证据与状态对账
- 不需要切到超高推理
## 现在不要做的事情
不要做:
- 新功能
- 新页面
- 新模块
- 控制面增强项
- 新专题文档
- 正式发布动作
## 给用户的下一任务卡片
按下面这张任务卡,在两台大陆节点执行:
```text
任务名B2-Journal Permission Closure / 节点 Unit 刷新
目标:
1. 让 domaincheck-node-agent 具备 journal 读取权限
2. 为 acceptance 清掉 node_agent_logs 的最后失败点
执行节点:
- mainland-controller-01
- mainland-worker-01
执行步骤:
1. 进入最新代码目录
2. 重新安装最新 unit 文件到 /etc/systemd/system/domaincheck-node-agent.service
3. daemon-reload
4. restart domaincheck-node-agent
5. 输出 unit 关键行与服务状态
执行命令:
cd /www/wwwroot/getDomain
install -m 0644 domain-api/deploy/systemd/domain-node-agent.service /etc/systemd/system/domaincheck-node-agent.service
systemctl daemon-reload
systemctl restart domaincheck-node-agent
systemctl cat domaincheck-node-agent | grep -E '^(User|Group|SupplementaryGroups)='
systemctl status domaincheck-node-agent --no-pager -l
journalctl -u domaincheck-node-agent -n 60 --no-pager
回传给 Codex 的结果:
1. systemctl cat 中是否出现 SupplementaryGroups=systemd-journal
2. systemctl status 是否 active (running)
3. journalctl 是否还出现 insufficient permissions
```
## 一句话结论
项目现在不缺接管能力,也不缺控制面能力;真正剩下的只是把两台大陆节点上的 Node Agent unit 刷新到最新,然后重跑 acceptance 把最后一个 `node_agent_logs` 失败点清掉。