I tested 10 model/harness combinations on the same Three.js task
Model ↕ Harness ↕ File ↕ Duration ↕ TTFT ↕ Input tokens ↕ Output tokens ↕ Reasoning tokens ↕ Total tokens ↕ Cached input % ↕ Tool calls ↕ Tool errors ↕ Opened in browser ↕ Checked screenshots ↕ GLM 5.3 Flash Max Codex Open 9m 0.232s 9.344s 457,685 17,458 7,694 475,143 85.26% 14 1 Blocked No Luna 5.6 Max Codex Open 9m 13.098s 6.199s 1,146,755 25,512 6,879 1,172,267 92.76% 32 2 Yes Yes SOL 5.6 Max Codex Open 10m 48.765s 8.460s 1,069,163 28,278 7,515 1,097,441 94.60% 21 5 No No Astra 6.0 Max Codex Open 37m 29.705s 3.589s 1,292,366 43,129 15,271 1,335,495 94.93% 20 5 Yes No GLM 5.3 Flash Max OMP Open 30m 14.979s 6.596s 1,678,509 63,405 — 1,741,914 78.54% 57 0 Yes Yes Qwen 3.8 27B x-high OMP Open 41m 25.836s 15.275s 3,407,451 71,935 49,131 3,479,386 86.92% 89 0 Yes Yes GLM 5.3 Flash Max OpenCode Open 20m 28.948s 6.284s 4,305,447 50,468 33,414 4,355,915 96.89% 67 0 Yes Yes Qwen 3.8 27B x-high OpenCode Open 8m 48.470s 10.182s 665,490 41,817 28,788 707,307 95.64% 13 0 Yes Yes Qwen 3.8 27B x-high DSH / PTC Open 24m 32.929s 7.724s 1,012,499 89,894 — 1,102,393 91.69% 23 5 Yes Yes Qwen 3.8 27B x-high DSH Open 18m 15.239s 6.755s 2,654,457 78,232 — 2,732,689 95.48% 42 2 No No