Research Harness / 教学原型全部数据为教学假数据
CREATE / SCOPE FIRST

把 10 份访谈整理成可回源洞察

先确认目标与项目范围,再让 Agent 运行。

预计 45–60 分钟
已授权目录/research/demo-r17 · 10 个 Markdown · corpus-v17-a93
研究目标找出影响新团队首次采用的主题、反例与证据缺口
边界只读 · 原文不上传 · 不自动发布 · 仅导出草稿
RUNNING / ONE SCREEN

正在核对跨访谈主题

你可以离开页面;本地 Runtime 会保留检查点。

running · 07/10
14:08:21search_interviews · “首次采用”完成
14:08:28read_span · I04-S02完成
14:08:31checkpoint · event 84已保存
现在正在等待:第 8 份访谈返回7 秒
EVIDENCE / TRACEABLE

洞察 02 · 范围确认比生成速度更影响信任

2 个来源、2 个角色;仍缺一个运营角色反例。

confidence 0.74
I02-S01 · 研究经理 · interview-02.md:14

“如果一开始能看到它会读哪些资料,我更愿意让它跑完整个任务。”

I05-S03 · 产品研究员 · interview-05.md:31

“比起再快十分钟,我更想知道哪些结论是从哪段原话来的。”

反例与缺口

尚未覆盖运营角色;I03-S02 认为固定范围会遗漏最新资料。交付前要么补证据,要么把 claim 限定到研究角色。

POLICY / BEFORE EXECUTION

需要你的批准

Agent 想读取未脱敏原文;对应 Tool 尚未执行。

waiting_approval

新增范围:/research/demo-r17/raw/interview-08.md

原因:确认一条定价反例。
数据:可能含姓名与邮箱。
权限:仅本 task、最长 10 分钟、只读 1 个文件。
当前副作用:read_count=0。

VERIFY / USER CONFIRMS

5 条洞察通过回源检查

Verifier 从真实 fixture 重查来源,不相信模型自报完成。

verified
来源有效

12 / 12

source_id、hash、exact_quote 一致
范围覆盖

10 / 10

3 个角色;2 条反例
权限事件

0 越权

1 次拒绝;对应 read_count=0
交付状态

待确认

确认后执行幂等导出