|
| 1 | +# PCS rendering benchmarks |
| 2 | + |
| 3 | +Scientific Memory evidence-layer benchmarks for PCS release import, portal read-model |
| 4 | +rendering, query correctness, release comparison, and failed-release interpretability. |
| 5 | + |
| 6 | +## Layout |
| 7 | + |
| 8 | +Each case directory contains: |
| 9 | + |
| 10 | +- `case.json` — case metadata and fixture pointer |
| 11 | +- `release_manifest.v0.json` — manifest alias (artifacts resolve via `fixture_dir`) |
| 12 | +- `expected_sections.json` — required interpretability sections |
| 13 | +- `expected_queries.json` — CLI query expectations |
| 14 | +- `expected_lineage.json` — lineage fields after import |
| 15 | +- `expected_staleness.json` — staleness expectations |
| 16 | +- `expected_compare.json` — release comparison expectations (when applicable) |
| 17 | +- `expected_failure.json` — failure-evidence checks (failed cases only) |
| 18 | + |
| 19 | +### Success-path cases |
| 20 | + |
| 21 | +- `labtrust_qc_release/` |
| 22 | +- `tool_use_safety/` |
| 23 | +- `computation_reproducibility/` |
| 24 | + |
| 25 | +### Failed-release cases |
| 26 | + |
| 27 | +Under `failed/`: |
| 28 | + |
| 29 | +- `rejected_certificate/` — computation witness rejected |
| 30 | +- `stale_release/` — stale lineage after bundle drift |
| 31 | +- `failed_lean_check/` — formal kernel failed obligation (read-model evidence) |
| 32 | +- `failed_pf_verification/` — PF explain on failed formal check |
| 33 | +- `missing_registry_metadata/` — deferred registry checks in read model |
| 34 | + |
| 35 | +## Run |
| 36 | + |
| 37 | +```bash |
| 38 | +just pcs-benchmark-rendering CASES=benchmarks/rendering/labtrust_qc_release OUT=benchmark_runs/labtrust_rendering |
| 39 | + |
| 40 | +just pcs-benchmark-rendering-all OUT=benchmark_runs/pcs_rendering |
| 41 | + |
| 42 | +python -m sm_pipeline.benchmark.rendering --cases benchmarks/rendering --out benchmark_runs/pcs_rendering |
| 43 | +``` |
| 44 | + |
| 45 | +Reports are written to: |
| 46 | + |
| 47 | +- `rendering_benchmark_report.json` — full case results (`PcsRenderingBenchmarkReport.v0`) |
| 48 | +- `pcs_bench_payload.json` — flattened metrics for **pcs-bench** |
| 49 | +- `rendering_benchmark_summary.md` — human-readable summary |
| 50 | + |
| 51 | +Regression floors: `baseline_thresholds.json` (enforced by default via `--check-regression`). |
| 52 | + |
| 53 | +## Regenerate expectations |
| 54 | + |
| 55 | +After fixture or import changes: |
| 56 | + |
| 57 | +```bash |
| 58 | +python scripts/bootstrap_pcs_rendering_benchmarks.py |
| 59 | +``` |
0 commit comments