Por Simon Gonzalez de Cruz (el build en publico en X @KyaniteLabs_). Cierre del arco, 2026-08-21. Toda la historia, corregida en el registro.
Nos hicimos una pregunta simple: ¿puede un mini-PC de $1.400 servir un modelo 27B como los rigs grandes? Esta nota cierra el libro. Cada afirmacion de abajo tiene un log crudo detras, en el repo publico, con su metodologia.
El rig
AMD Strix Halo, 64 GB de memoria compartida, tooling abierto (llama.cpp), un modelo libre Apache-2.0. Sin nube, sin alquileres.
El techo
Retrieval exacto de agujas en cada profundidad probada, dos semillas, hasta 261.130 de 262.144 tokens — el 99.6% de la ventana, el techo literal. Follow-ups en caliente sobre un documento cargado de 198k tokens: cita exacta en 23.8s, si/no en 10.0s, resumen de una linea en 17.5s. El formato no importa: prosa o codigo, exacto en ambos casos; descrito en palabras, cada parte vuelve en orden. Crudo: nativemax-results.log · quote-rerun-results.log.
El bug que les debiamos
A mitad del arco, el contexto largo y la vision se rompieron en silencio en esta clase de GPU. Nuestra primera lectura culpo al modelo — mal. Hicimos bisect a un cambio upstream (c7d8722), lo reportamos, lo arreglamos local y despues validamos el fix upstream en nuestro silicio: 9/9 respuestas identicas, pareadas. La correccion esta en el repo, en el registro. La degeneracion era el instrumento, no el modelo. Crudo: issue 26209 · pr25863-validation.
La configuracion congelada
Pesos Q4. KV cache liviano (q4_0) — despues de medir el trade: la opcion pesada compra hasta ~3 segundos en follow-ups (sub-segundo a 2.8s medido en la media ventana) por ~4 GB; nos quedamos con el espacio. Especulacion: la configuracion en servicio, verificada la mas rapida de cuatro con paredes pareadas (15.1s por respuesta de 200 palabras vs 17.8s sin ella). Contextoo: los 262.144 completos. Thinking: apagado por defecto, los problemas dificiles piensan — medido en tres bandas de dificultad. Vision: funciona, 6/6 en screenshots reales de navegador. Crudo: config-27b-2026-08-21.
Que prueba esto
Una historia completa de serving — velocidad, memoria, calidad, modos de falla y el rastro del fix — medida en hardware que cualquiera puede comprar, con cada numero reproducible desde el repo. Ese es el estandar que quisimos fijar.
El rig se queda en esta configuracion congelada. El proximo capitulo cuando lo abramos.
Condiciones: mini-PC GMKtec EVO-X2 de $1.400, Qwen3.8-27B Q4_K_XL, llama.cpp ROCm, ventana de 262.144 tokens, K+V q4_0, temperature 0. Cierre del arco. Una tabla con logs linkeados: github.com/KyaniteLabs/qwen38-27b-strix-halo.