Needs human adjudication: comparison is withheld because rank stability was not measured.
| Contract | comparison_pack.v0 |
| Comparison ID | airport-audit-festival-audit |
| Common extraction basis | full_document |
| Pairwise stability | 0% |
| Top-set stability | 0% |
| Exact-rank stability | 0% |
| False-positive risk | 43% |
| Sample denominator | 2,995 |
| Minimum denominator | 1,304 |
| Study | Basis | Source confidence | Evidence safe | Claims | Open support gaps | Triage |
|---|---|---|---|---|---|---|
| Airport Expansion Sample Audit | full_document | 95% | yes | 3 | 1 | 8.100 |
| Festival Impact Sample Audit | full_document | 94% | yes | 3 | 2 | 11.600 |
| Study | Source | Triage score | Flags |
|---|---|---|---|
| Festival Impact Sample Audit | festival_impact_sample.txt | 11.600 | comparison profile derived from audit JSON; no human caveat labeling attached, claims_without_nearby_qualification, low_qualification_rate_with_detector_precision_warning, detector_miss_risk |
| Airport Expansion Sample Audit | airport_expansion_sample.txt | 8.100 | comparison profile derived from audit JSON; no human caveat labeling attached, low_qualification_rate_with_detector_precision_warning, detector_miss_risk |
Detector recall is measured by split and document in tests/test_recall.py; not matched is not proof of absence.