Task Accuracy
Current legacy eval suite(2026-07-15):本目录验证现有
taskDecisions[] / typeCategory / closeResultexecutable behavior,不定义 Target Task domain。V3 的 eval、prompt vocabulary 和 Policy fixtures 必须从 Task System Design V3 的 Task Policy Catalog 重新生成,不能把旧 Lead relay 或 globalcloseResult当 acceptance criteria。
这个目录只放和 Current legacy Task Accuracy 直接相关的文档:AI 是否能把 contact / call / message / lead / task context 稳定转换成现有 taskDecisions[]。
Current legacy 主线:
- AI Evaluation Playbook:给 Peter 的总入口,说明各层 eval 测什么、怎么跑、cases 在哪里。
- Baseline v1 Design:定义 demo 前要证明什么、不动什么、怎么验证。
- Baseline v1 Scenario Review:按 Task Decision 质量组织的可评审 scenario 清单。
- Revenue Rehearsal Playbook:说明 revenue / retention / safety objective 的 scenario registry、objective policy map、staging injector 和 report artifacts。
- Task Prompt Architecture And Agent Evolution:记录 prompt accuracy 工作法、system/user/schema/writer 分层、taxonomy 使用原则,以及 push context -> pull context / self-check agent 的演进顺序。
历史 AI Agent Foundation 盘点见 AI Agent Foundation 最终态与当前缺口;它同样已 superseded,不是 V3 架构入口。
Upstream input smoke 已经拆到独立目录:
- Call Input Smoke:检查
calls表和 call analysis structured fields 是否正确进入 downstream context。 - Contact Context Smoke:检查
contacts / messages / leads / tasks等 contact context 是否正确进入contacts-analyzer。
边界说明:当前目录只聚焦 Task Accuracy Foundation。Call / Contact / Task 三者是上下游关系,不应该都塞进 task-accuracy 目录。