Por Simon Gonzalez de Cruz (el build en público en X @KyaniteLabs_). 2026-08-20. Canon: FACTS-PACK.
El número primero: 20/30 = 67% LiveCodeBench-30, best-per-problem entre brazos etiquetados, en un GMKtec EVO-X2 de $1.400. IC Wilson 95% [49%, 81%]. Cita siempre el intervalo. n=30 es chico; el intervalo es el número honesto.
Split: easy 10/10, medium 8/10, hard 2/10. Campeón: Qwen3.8-27B UD-Q4_K_XL, K+V q4_0, temp 0, casos públicos livecodebench v6, estratificado 10/10/10, semilla 20260820.
Una celda de un solo config (2048 tokens, thinking off) dio 13/30, reproducción 14/30, acuerdo per-problem 25/30. Eso es un piso de ruido de ±2 problemas a temp 0. No trates una corrida como exacta.
Thinking: en los 15 problemas donde no-thinking no produjo código a 4096 tokens, thinking (presupuesto 2048) rescató 5. En hard, la prosa se come el código. En HumanEval-30 thinking no compró nada (28/30 idéntico). Línea citable: el razonamiento paga exactamente donde la tarea es dura, nada donde es fácil.
Esto no es la card oficial de LiveCodeBench del set completo. Otro instrumento: corrimos un subset público de 30 a Q4 en esta caja. Solo chequeo de banda, y dilo.
Caveat de contaminación: los problemas v6 (~mayo 2025) son anteriores al modelo. Si acaso el número está inflado contra una ventana limpia. El hallazgo del split hard es la parte conservadora.
Crudo: results/lcb-30-2026-08-20.