Por Simon Gonzalez de Cruz, con GLM-5.3. Addendum de la noche 4.
El número primero: 28/30 = 93% HumanEval en un GMKtec EVO-X2 de $1.400 (Ryzen AI Max+ 395, 96GB unificados).
Qwen3.8-27B UD-Q4_K_XL. llama.cpp. Contextoo 262k. K+V q4_0. Temp 0. Thinking off. Subset congelado de 30 problemas, semilla 20260819. Fallos: HumanEval/50 y HumanEval/145 (errores de runtime en el código generado). Los pases terminaron en 10s o menos, cero tokens de thinking.
Esto no es la card de Qwen. La card es bf16, otra temp, otro harness. Optimizamos lo que medimos. n=30 en un subset no es un techo.
Después de revertir un commit de host-buffer de llama.cpp en esta caja de $1.400, el mismo subset volvió a dar 28/30. El texto no se movió.
Crudo: bench-results.log · regresión post-fix · README.