{
  "run": {
    "measurement": "Aurora end-to-end speaker attribution and word error, four public-corpus suites",
    "measured_on": "2026-06-17",
    "published_on": "2026-09-18",
    "app_repository": "https://github.com/ComicBit/Aurora",
    "app_commit": "c029825ef19547b9581b12dd9bf38eb106f0341f",
    "app_commit_subject": "test(evals): TDT/unified suite reports, eval runner, and coverage map",
    "source_files": [
      "suites/tier1-librispeech/suite-report.uni.json",
      "suites/tier2-real/suite-report.uni.json",
      "suites/reference-ami/suite-report.uni.json",
      "suites/tier3-wild/suite-report.uni.json"
    ],
    "pipeline_config": "uni_full (the unified transcription + diarization path; the repository's tdt_full reports are a separate configuration and are not published here)",
    "recognition_model": "openai_whisper-base (145 MB, d_model 512); recorded in the reports under Aurora's internal tier id 'medium' \u2014 see docs/model-tier-ids.md in the app repository",
    "diarization_model": "FluidInference/diar-streaming-sortformer-coreml (NVIDIA Streaming Sortformer, 4 speakers), Core ML",
    "harness": "AuroraCore Swift eval suite, driven by tools/run-evals.sh; silent fixture injection through FileAudioSource, no microphone in the loop",
    "device": "the maintainer's Apple silicon Mac (the harness result paths are rooted at /Users/comicbit/Projects/Aurora). These are NOT iPhone measurements.",
    "audio_format": "16 kHz mono PCM, 16-bit",
    "runs_per_case": 1,
    "metrics": {
      "wder": "Word diarization error rate: the share of recognized words carrying the wrong speaker label, over an alignment between reference words and recognized words. 0.34 means about 34 of every 100 words are attributed to the wrong person. Lower is better. Defined in arXiv:1907.05337.",
      "der": "Diarization error rate: the share of audio TIME labelled with the wrong voice (miss + false alarm + speaker error). Lower is better. A system can score a good DER and a bad WDER.",
      "app_wer": "Word error rate of the app path's transcript against the corpus reference transcript. Lower is better.",
      "der_miss_rate": "DER component: reference speech the system labelled as nobody.",
      "der_false_alarm_rate": "DER component: non-speech or unlabelled time the system attributed to a speaker.",
      "der_speaker_error_rate": "DER component: speech attributed to the wrong speaker."
    },
    "limitations": [
      "One run per case: the harness's own determinism check reports 'not-enough-current-runs', so none of these numbers has a repeatability interval.",
      "Every case carries verdict 'fail' because the suite's boundary-quality gate is stricter than these results; the verdict is a gate outcome, not a claim that the measurement is invalid.",
      "Two of the eight Earnings-21 cases (the 18-minute and 25-minute slices) did not complete and are reported as incomplete rather than dropped.",
      "Provisional: no independent verification pass has run, and the suite README marks the Earnings-21 and AMI imports as pending completion.",
      "Measured on a Mac through the eval harness, not on an iPhone. Phone numbers would be slower and are not published here.",
      "LibriSpeech and AMI are in the diarization model's published training data, so their scores are a regression floor and a parity probe, never a quality claim.",
      "MSDWild ships time-level RTTM labels only: WDER is reported as unavailable rather than estimated.",
      "The reference anchor column is pyannote 3.1 as published by Argmax OpenBench: a different pipeline with different models. It is context, not a like-for-like comparison."
    ],
    "reference_anchor_source": "https://github.com/argmaxinc/OpenBench/blob/main/BENCHMARKS.md (pyannote 3.1: DER 0.23 AMI-SDM, 0.32 MSDWild, 0.10 Earnings-21)",
    "license_note": "This file contains aggregate scores and corpus provenance only. No audio, no transcript text and no personal data. Corpus licenses: LibriSpeech (public-domain LibriVox readings via OpenSLR), Earnings-21 CC-BY-SA-4.0, AMI CC BY 4.0, MSDWild research-use only."
  },
  "suite_summary": [
    {
      "suite": "tier1-librispeech",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "cases_in_suite": 10,
      "cases_scored": 10,
      "cases_incomplete": 0,
      "wder": {
        "n": 10,
        "min": 0.052,
        "median": 0.089,
        "max": 0.188
      },
      "der": {
        "n": 10,
        "min": 0.05,
        "median": 0.08,
        "max": 0.176
      },
      "app_wer": {
        "n": 10,
        "min": 0.009,
        "median": 0.038,
        "max": 0.054
      },
      "reference_anchor_der_pyannote_3_1": null
    },
    {
      "suite": "tier2-real",
      "corpus": "Earnings-21 (rev.ai speech-datasets)",
      "suite_role": "load-bearing quality numbers (only permitted tuning target)",
      "cases_in_suite": 8,
      "cases_scored": 6,
      "cases_incomplete": 2,
      "wder": {
        "n": 6,
        "min": 0.204,
        "median": 0.336,
        "max": 0.492
      },
      "der": {
        "n": 6,
        "min": 0.099,
        "median": 0.275,
        "max": 0.436
      },
      "app_wer": {
        "n": 6,
        "min": 0.135,
        "median": 0.157,
        "max": 0.316
      },
      "reference_anchor_der_pyannote_3_1": 0.1
    },
    {
      "suite": "reference-ami",
      "corpus": "AMI Meeting Corpus (SDM, full-corpus test split)",
      "suite_role": "parity probe against published anchors (trained-on data, never a tuning target)",
      "cases_in_suite": 3,
      "cases_scored": 3,
      "cases_incomplete": 0,
      "wder": {
        "n": 3,
        "min": 0.628,
        "median": 0.661,
        "max": 0.709
      },
      "der": {
        "n": 3,
        "min": 0.255,
        "median": 0.302,
        "max": 0.385
      },
      "app_wer": {
        "n": 3,
        "min": 0.468,
        "median": 0.503,
        "max": 0.52
      },
      "reference_anchor_der_pyannote_3_1": 0.23
    },
    {
      "suite": "tier3-wild",
      "corpus": "MSDWild few.val evaluation list",
      "suite_role": "wild-acoustics stress, time-level DER only",
      "cases_in_suite": 4,
      "cases_scored": 4,
      "cases_incomplete": 0,
      "wder": null,
      "der": {
        "n": 4,
        "min": 0.06,
        "median": 0.102,
        "max": 0.186
      },
      "app_wer": null,
      "reference_anchor_der_pyannote_3_1": 0.32
    }
  ],
  "cases": [
    {
      "suite": "tier1-librispeech",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "case_id": "librispeech_clean_2spk_art_review",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "contamination": "trained (LibriSpeech simulated mixtures are in the diarizer's training data)",
      "audio_seconds": 27.58,
      "reference_speakers": 2,
      "reference_turns": 4,
      "reference_words": 91,
      "overlap_word_rate": 0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.043478260869565216,
      "der": 0.077188006483,
      "wder": 0.086956521739,
      "der_miss_rate": 0.022285251216,
      "der_false_alarm_rate": 0.0,
      "der_speaker_error_rate": 0.054902755267,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier1-librispeech",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "case_id": "librispeech_clean_2spk_narrative",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "contamination": "trained (LibriSpeech simulated mixtures are in the diarizer's training data)",
      "audio_seconds": 41.48,
      "reference_speakers": 2,
      "reference_turns": 4,
      "reference_words": 116,
      "overlap_word_rate": 0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.008620689655172414,
      "der": 0.068567725211,
      "wder": 0.051724137931,
      "der_miss_rate": 0.026441996111,
      "der_false_alarm_rate": 0.0,
      "der_speaker_error_rate": 0.042125729099,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier1-librispeech",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "case_id": "librispeech_clean_2spk_dialogue",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "contamination": "trained (LibriSpeech simulated mixtures are in the diarizer's training data)",
      "audio_seconds": 31.14,
      "reference_speakers": 2,
      "reference_turns": 4,
      "reference_words": 91,
      "overlap_word_rate": 0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.04395604395604396,
      "der": 0.072946175637,
      "wder": 0.10989010989,
      "der_miss_rate": 0.024787535411,
      "der_false_alarm_rate": 0.0,
      "der_speaker_error_rate": 0.048158640227,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier1-librispeech",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "case_id": "librispeech_clean_3spk_mixed_a",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "contamination": "trained (LibriSpeech simulated mixtures are in the diarizer's training data)",
      "audio_seconds": 52.83,
      "reference_speakers": 3,
      "reference_turns": 6,
      "reference_words": 149,
      "overlap_word_rate": 0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.053691275167785234,
      "der": 0.063314711359,
      "wder": 0.093959731544,
      "der_miss_rate": 0.027726050072,
      "der_false_alarm_rate": 0.0,
      "der_speaker_error_rate": 0.035588661287,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier1-librispeech",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "case_id": "librispeech_clean_3spk_mixed_b",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "contamination": "trained (LibriSpeech simulated mixtures are in the diarizer's training data)",
      "audio_seconds": 33.26,
      "reference_speakers": 3,
      "reference_turns": 6,
      "reference_words": 76,
      "overlap_word_rate": 0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.025974025974025976,
      "der": 0.117872044506,
      "wder": 0.051948051948,
      "der_miss_rate": 0.090055632823,
      "der_false_alarm_rate": 0.0,
      "der_speaker_error_rate": 0.027816411683,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier1-librispeech",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "case_id": "librispeech_clean_4spk_roundtable_a",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "contamination": "trained (LibriSpeech simulated mixtures are in the diarizer's training data)",
      "audio_seconds": 81.75,
      "reference_speakers": 4,
      "reference_turns": 8,
      "reference_words": 235,
      "overlap_word_rate": 0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.03375527426160337,
      "der": 0.049570389954,
      "wder": 0.067510548523,
      "der_miss_rate": 0.009649702578,
      "der_false_alarm_rate": 0.0,
      "der_speaker_error_rate": 0.039920687376,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier1-librispeech",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "case_id": "librispeech_clean_4spk_roundtable_b",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "contamination": "trained (LibriSpeech simulated mixtures are in the diarizer's training data)",
      "audio_seconds": 73.78,
      "reference_speakers": 4,
      "reference_turns": 8,
      "reference_words": 202,
      "overlap_word_rate": 0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.0297029702970297,
      "der": 0.175962177735,
      "wder": 0.188118811881,
      "der_miss_rate": 0.031321563123,
      "der_false_alarm_rate": 0.0,
      "der_speaker_error_rate": 0.144640614612,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier1-librispeech",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "case_id": "librispeech_clean_2spk_short",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "contamination": "trained (LibriSpeech simulated mixtures are in the diarizer's training data)",
      "audio_seconds": 27.26,
      "reference_speakers": 2,
      "reference_turns": 4,
      "reference_words": 65,
      "overlap_word_rate": 0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.046153846153846156,
      "der": 0.123973727422,
      "wder": 0.092307692308,
      "der_miss_rate": 0.098522167488,
      "der_false_alarm_rate": 0.0,
      "der_speaker_error_rate": 0.025451559934,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier1-librispeech",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "case_id": "librispeech_clean_3spk_late",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "contamination": "trained (LibriSpeech simulated mixtures are in the diarizer's training data)",
      "audio_seconds": 37.51,
      "reference_speakers": 3,
      "reference_turns": 6,
      "reference_words": 98,
      "overlap_word_rate": 0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.04081632653061224,
      "der": 0.128142986974,
      "wder": 0.091836734694,
      "der_miss_rate": 0.086337473493,
      "der_false_alarm_rate": 0.0,
      "der_speaker_error_rate": 0.041805513481,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier1-librispeech",
      "suite_role": "determinism and regression floor (not a quality claim)",
      "case_id": "librispeech_clean_4spk_longer",
      "corpus": "LibriSpeech clean validation synthetic turns",
      "contamination": "trained (LibriSpeech simulated mixtures are in the diarizer's training data)",
      "audio_seconds": 88.89,
      "reference_speakers": 4,
      "reference_turns": 8,
      "reference_words": 259,
      "overlap_word_rate": 0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.03474903474903475,
      "der": 0.083338365843,
      "wder": 0.069498069498,
      "der_miss_rate": 0.049882239266,
      "der_false_alarm_rate": 0.0,
      "der_speaker_error_rate": 0.033456126578,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier2-real",
      "suite_role": "load-bearing quality numbers (only permitted tuning target)",
      "case_id": "earnings21_4320211_2251s_4spk",
      "corpus": "Earnings-21 (rev.ai speech-datasets)",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 223.08,
      "reference_speakers": 4,
      "reference_turns": 77,
      "reference_words": 642,
      "overlap_word_rate": 0.0109,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.15146831530139104,
      "der": 0.215760423763,
      "wder": 0.276661514683,
      "der_miss_rate": 0.019464178959,
      "der_false_alarm_rate": 0.059887107762,
      "der_speaker_error_rate": 0.136409137042,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier2-real",
      "suite_role": "load-bearing quality numbers (only permitted tuning target)",
      "case_id": "earnings21_4346818_2942s_4spk",
      "corpus": "Earnings-21 (rev.ai speech-datasets)",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 181.03,
      "reference_speakers": 4,
      "reference_turns": 62,
      "reference_words": 522,
      "overlap_word_rate": 0.0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.21595330739299612,
      "der": 0.426273949199,
      "wder": 0.492217898833,
      "der_miss_rate": 0.006633426893,
      "der_false_alarm_rate": 0.097636024477,
      "der_speaker_error_rate": 0.32200449783,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier2-real",
      "suite_role": "load-bearing quality numbers (only permitted tuning target)",
      "case_id": "earnings21_4364366_long18m_4spk",
      "corpus": "Earnings-21 (rev.ai speech-datasets)",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 1095.81,
      "reference_speakers": 4,
      "reference_turns": 161,
      "reference_words": 2418,
      "overlap_word_rate": 0.0,
      "model_tier": null,
      "model_identifier": null,
      "pipeline_config": null,
      "app_wer": null,
      "der": null,
      "wder": null,
      "der_miss_rate": null,
      "der_false_alarm_rate": null,
      "der_speaker_error_rate": null,
      "runs": 0,
      "case_verdict": "incomplete"
    },
    {
      "suite": "tier2-real",
      "suite_role": "load-bearing quality numbers (only permitted tuning target)",
      "case_id": "earnings21_4365948_long25m_4spk",
      "corpus": "Earnings-21 (rev.ai speech-datasets)",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 1503.63,
      "reference_speakers": 4,
      "reference_turns": 302,
      "reference_words": 3949,
      "overlap_word_rate": 0.0,
      "model_tier": null,
      "model_identifier": null,
      "pipeline_config": null,
      "app_wer": null,
      "der": null,
      "wder": null,
      "der_miss_rate": null,
      "der_false_alarm_rate": null,
      "der_speaker_error_rate": null,
      "runs": 0,
      "case_verdict": "incomplete"
    },
    {
      "suite": "tier2-real",
      "suite_role": "load-bearing quality numbers (only permitted tuning target)",
      "case_id": "earnings21_4368670_4034s_4spk",
      "corpus": "Earnings-21 (rev.ai speech-datasets)",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 181.19,
      "reference_speakers": 4,
      "reference_turns": 33,
      "reference_words": 514,
      "overlap_word_rate": 0.0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.1348747591522158,
      "der": 0.09935238374,
      "wder": 0.204238921002,
      "der_miss_rate": 0.030617247814,
      "der_false_alarm_rate": 0.027558450112,
      "der_speaker_error_rate": 0.041176685815,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier2-real",
      "suite_role": "load-bearing quality numbers (only permitted tuning target)",
      "case_id": "earnings21_4387332_1098s_4spk",
      "corpus": "Earnings-21 (rev.ai speech-datasets)",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 183.28,
      "reference_speakers": 4,
      "reference_turns": 46,
      "reference_words": 581,
      "overlap_word_rate": 0.0034,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.15780445969125215,
      "der": 0.333973987882,
      "wder": 0.380789022298,
      "der_miss_rate": 0.035714561383,
      "der_false_alarm_rate": 0.059812434873,
      "der_speaker_error_rate": 0.238446991625,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier2-real",
      "suite_role": "load-bearing quality numbers (only permitted tuning target)",
      "case_id": "earnings21_4394084_1319s_3spk",
      "corpus": "Earnings-21 (rev.ai speech-datasets)",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 185.53,
      "reference_speakers": 3,
      "reference_turns": 76,
      "reference_words": 392,
      "overlap_word_rate": 0.0,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.3157894736842105,
      "der": 0.203022123329,
      "wder": 0.385964912281,
      "der_miss_rate": 0.011271407467,
      "der_false_alarm_rate": 0.089323168396,
      "der_speaker_error_rate": 0.102427547466,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier2-real",
      "suite_role": "load-bearing quality numbers (only permitted tuning target)",
      "case_id": "earnings21_4394084_1551s_4spk",
      "corpus": "Earnings-21 (rev.ai speech-datasets)",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 204.16,
      "reference_speakers": 4,
      "reference_turns": 62,
      "reference_words": 517,
      "overlap_word_rate": 0.0097,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.1553398058252427,
      "der": 0.436371151807,
      "wder": 0.291262135922,
      "der_miss_rate": 0.0093273188,
      "der_false_alarm_rate": 0.300190500153,
      "der_speaker_error_rate": 0.126853332854,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "reference-ami",
      "suite_role": "parity probe against published anchors (trained-on data, never a tuning target)",
      "case_id": "ami_sdm_es2004a_352s_4spk",
      "corpus": "AMI Meeting Corpus (SDM, full-corpus test split)",
      "contamination": "trained (AMI is in NVIDIA Streaming Sortformer training data; parity probe by design \u2014 never a tuning target)",
      "audio_seconds": 285.11,
      "reference_speakers": 4,
      "reference_turns": 202,
      "reference_words": 709,
      "overlap_word_rate": 0.4104,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.5034578146611342,
      "der": 0.38541014402,
      "wder": 0.661134163209,
      "der_miss_rate": 0.240137758297,
      "der_false_alarm_rate": 0.022698810269,
      "der_speaker_error_rate": 0.122573575454,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "reference-ami",
      "suite_role": "parity probe against published anchors (trained-on data, never a tuning target)",
      "case_id": "ami_sdm_en2002a_608s_4spk",
      "corpus": "AMI Meeting Corpus (SDM, full-corpus test split)",
      "contamination": "trained (AMI is in NVIDIA Streaming Sortformer training data; parity probe by design \u2014 never a tuning target)",
      "audio_seconds": 200.46,
      "reference_speakers": 4,
      "reference_turns": 295,
      "reference_words": 825,
      "overlap_word_rate": 0.543,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.4678362573099415,
      "der": 0.255159093219,
      "wder": 0.628070175439,
      "der_miss_rate": 0.094541018603,
      "der_false_alarm_rate": 0.048185422385,
      "der_speaker_error_rate": 0.112432652231,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "reference-ami",
      "suite_role": "parity probe against published anchors (trained-on data, never a tuning target)",
      "case_id": "ami_sdm_en2002a_1835s_4spk",
      "corpus": "AMI Meeting Corpus (SDM, full-corpus test split)",
      "contamination": "trained (AMI is in NVIDIA Streaming Sortformer training data; parity probe by design \u2014 never a tuning target)",
      "audio_seconds": 214.64,
      "reference_speakers": 4,
      "reference_turns": 394,
      "reference_words": 960,
      "overlap_word_rate": 0.625,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": 0.5199610516066212,
      "der": 0.302000245429,
      "wder": 0.708860759494,
      "der_miss_rate": 0.103325561419,
      "der_false_alarm_rate": 0.036814333047,
      "der_speaker_error_rate": 0.161860350963,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier3-wild",
      "suite_role": "wild-acoustics stress, time-level DER only",
      "case_id": "msdwild_01548_3spk",
      "corpus": "MSDWild few.val evaluation list",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 105.86,
      "reference_speakers": 3,
      "reference_turns": 68,
      "reference_words": null,
      "overlap_word_rate": null,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": null,
      "der": 0.186386970023,
      "wder": null,
      "der_miss_rate": 0.066016012844,
      "der_false_alarm_rate": 0.003633521347,
      "der_speaker_error_rate": 0.116737435832,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier3-wild",
      "suite_role": "wild-acoustics stress, time-level DER only",
      "case_id": "msdwild_02241_3spk",
      "corpus": "MSDWild few.val evaluation list",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 63.37,
      "reference_speakers": 3,
      "reference_turns": 23,
      "reference_words": null,
      "overlap_word_rate": null,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": null,
      "der": 0.106892116405,
      "wder": null,
      "der_miss_rate": 0.051851653358,
      "der_false_alarm_rate": 0.007931829144,
      "der_speaker_error_rate": 0.047108633903,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier3-wild",
      "suite_role": "wild-acoustics stress, time-level DER only",
      "case_id": "msdwild_02864_2spk",
      "corpus": "MSDWild few.val evaluation list",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 65.34,
      "reference_speakers": 2,
      "reference_turns": 42,
      "reference_words": null,
      "overlap_word_rate": null,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": null,
      "der": 0.09630576589,
      "wder": null,
      "der_miss_rate": 0.046186121218,
      "der_false_alarm_rate": 0.00852263415,
      "der_speaker_error_rate": 0.041597010522,
      "runs": 1,
      "case_verdict": "fail"
    },
    {
      "suite": "tier3-wild",
      "suite_role": "wild-acoustics stress, time-level DER only",
      "case_id": "msdwild_00474_2spk",
      "corpus": "MSDWild few.val evaluation list",
      "contamination": "clean (absent from NVIDIA Streaming Sortformer training data; model card verified 2026-06-11)",
      "audio_seconds": 102.91,
      "reference_speakers": 2,
      "reference_turns": 38,
      "reference_words": null,
      "overlap_word_rate": null,
      "model_tier": "medium",
      "model_identifier": "openai_whisper-base",
      "pipeline_config": "uni_full",
      "app_wer": null,
      "der": 0.060351232158,
      "wder": null,
      "der_miss_rate": 0.019031661477,
      "der_false_alarm_rate": 0.020770434535,
      "der_speaker_error_rate": 0.020549136146,
      "runs": 1,
      "case_verdict": "fail"
    }
  ]
}
