Skip to content

v2.11.0

@sheldonisspark-lab sheldonisspark-lab tagged this 13 Jul 16:33
v2.11 foundation: evaluate whether agents reuse prior failure lessons.

- docs/lesson-reuse-benchmark.md: benchmark design doc
- tasks/reuse/: 3 A/B task pairs (DCO, secret-scan, db-lock)
- scripts/lesson_reuse_bench.py: runner with dry-run/compare modes
- data/lesson_reuse_leaderboard.json: results storage
- Scoring: 40% task_b_pass + 20% retrieval + 15% avoidance + 15% lesson + 10% CI

Closes #457

Signed-off-by: Ikalus1988 <sheldonisspark@gmail.com>
Assets 2
Loading