A $37 GLM 5.3 red team: the Alloy-modeled auth layer held, but two bugs outsidegoodmem.ai·1 pts·svcrunch·0
GPT-6 Astra soundly defeats Fable 5.1 on recognizing handwritten correctionsdorrit.pairsys.ai·3 pts·svcrunch·1
Handwritten-edit benchmark: Fable 5 is #1, Opus 4.8 regresses 55% on miscountingdorrit.pairsys.ai·4 pts·svcrunch·1
GPT-5.4 Scores 0.62 F1 on Understanding Handwritten Edits in Dickensdorrit.pairsys.ai·2 pts·svcrunch·0