当前开发分支能力说明:本页所呈现的 Agent Lab 配对评估、双工作树隔离、SessionStart Hook 与 SafeApply/Undo 能力处于当前源码开发分支,尚未打包入已发布的 0.1.0-preview.2 安装包中。
当前开发分支 Agent Lab 配对工作树 独立 Verifier 判定 SafeApply & Undo

对照与复用:保留证据,也保留“不确定”

工程师常见困扰:调整了系统规则、工程约束或上下文配置后,模型在个别用例下的表现并不能证明它产生了全局优化。工程团队缺乏系统的对照实验手段,往往将随机方差误判为能力跃升,或是将未经验证的提议直接应用污染工程全局。

01
从有据可查的 Suggestion 进入 Lab
从实际会话中沉淀出的配置调整建议或特定记忆 Treatment 触发实验。在进入测试前明确核对改动意图,避免盲目创建对照。
02
冻结配对运行条件与隔离 Git Worktree
同时冻结相同的任务提示词、模型版本请求、起点 Git Commit。系统为 Baseline 与 Candidate 分配完全独立的 Git worktree 隔离沙盒,严格限制验证与输出文件范围,Pending Approval 绝不等于已经执行。
03
独立 Verifier 判定:把 Inconclusive 视为常态
运行项目真实的任务验收脚本与观测测试。系统严格依据真实测试输出划定三种明确边界:Improved(确证改进)、Worse(确证劣化)与 Inconclusive(结论不明确/证据不足)。绝不编造虚假的百分之百提升胜率。
04
严格限定范围的显式晋升(Memory-only)
在当前开发分支中,仅有具备确凿正面证据的纯记忆项(Memory-only)允许工程师手动确认晋升;证据不足、存在指标缺失或判定为 Inconclusive 的候选条目严禁自动激活。
05
项目 Hook 只读预览、确认 Apply 与 Safe Undo
通过确定性生成机制输出 SessionStart Hook 草稿供工程师只读审查;确认后经由 SafeApply 写入项目(如 .codex/hooks),并在 Codex 中显式审阅信任。每次写入保留哈希校验快照,支持无损 Undo 恢复。
Vela 开发分支工作区界面:展示实验对照、配置建议、状态流转与双向验证面板
实际 macOS 原生开发分支界面 (源码 commit 91d34e2) · 合成示例数据 · 未包含在 preview.2 下载包中
功能边界与已知限制
  • 开发分支专属特性:Agent Lab 配对工作树评估、独立 Verifier 判定、SessionStart Hook 与 SafeApply/Undo 属于当前仓库源码能力,未包含在已发布的 0.1.0-preview.2 安装包中。
  • Inconclusive 是客观规律:因大语言模型输出天然具备随机波动与非确定性,实验出现“结论不明确(Inconclusive)”是常见且完全正常的现象。Vela 拒绝为了演示效果而伪造胜率闭环。
  • 配置生效不等于模型必然遵循:即便通过 Hook 注入了规范或在 Codex 中配置了信任,具体编码智能体在面对复杂长程任务时仍可能出现幻觉或忽略指令,实际效果须在具体会话中核查证据。