Benchmarks
Head-to-head evaluations and dataset validations, with the data, task, baseline, method, and outputs disclosed.
July 2026
Reproducibility
Sutrix vs. Claude API
Three synthetic ground-truth studies · 5 runs per arm
Exact reproducibility of the primary numerical result
Sutrix returned an identical primary statistic in all 15 runs. Claude’s exact result varied across repeated runs.
2026
Head-to-head
Sutrix vs. Julius AI
De-identified concussion-knowledge survey · 348 participants × 152 columns
Instrument-aware data preparation and scoring
Sutrix scored 31/31. Julius scored 18/31 and reversed 305 of 309 recorded gender values.
2026
Head-to-head
Sutrix vs. ChatGPT (GPT-4o)
De-identified concussion-knowledge survey · 348 participants × 152 columns
Research-data preparation and instrument scoring
Sutrix scored 31/31. ChatGPT scored 2/31 and did not produce an analysis-ready dataset.