LLM local / Benchmarks

Notas de lab: el modelo que no puede olvidar pero no puede recordar

El número primero: este modelo es 75% no transformer. 48 de 64 capas guardan un estado. En un rig de $1.400, carga 198k una vez (1818s) y consulta en 9-27s.

Por Simon Gonzalez de Cruz (el build en público en X @KyaniteLabs_), con GLM-5.3. Noche 4.

El número primero: este modelo es 75% no transformer. 48 de sus 64 capas corren Gated DeltaNet: atención lineal con un estado de tamaño fijo. Solo 16 capas hacen lo que llamarías atención. El KV cache vive solo en esas 16. Por eso el flip KV a 4 bits ahorró 4.3GB a 262k, no los ~15GB que daba la aritmética de un transformer denso.

Hardware: GMKtec EVO-X2, Ryzen AI Max+ 395, 96GB unificados, $1.400. Modelo: Qwen3.8-27B UD-Q4_K_XL. llama.cpp. Ventana nativa 262.144 tokens.

La curva KV fue plana porque el cache es chico

Gate pareado, n=60, q8_0 vs q4_0: ambos 96.67%, McNemar p=1.0, cero discordantes, cero tripwires de corrupción. q5_0 y q5_1 igualaron la misma accuracy. q4_0 es campeón porque la calidad no se movió y nos quedamos el 4.3GB. Crudo: results/kv-curve-2026-08-19.

Carga una vez, consulta muchas

Cargamos un prefijo de 198k tokens en esta caja de $1.400. Prefill en frío: 1818s (~30 min). Luego cuatro follow-ups contra el prefijo caliente, todos finish_reason=stop: recuperar el código plantado; citar la frase (16s); sí/no (9s); resumir (27s). El retrieval es selectivo. Las cadenas distintivas sobreviven. Los misses de IDs arbitrarios de la noche 3 eran el mismo bug de buffer llama.cpp c7d8722; el remap post-revert recuperó IDs plantados a las seis profundidades a 198k. Ver la inversión de la noche 3. Crudo: quote-results.log.

El quote es la forma de producto: cargar es caro; mantener es barato. Los misses de 50k pre-revert quedan en cuarentena con el binario viejo. No hemos repetido 50k en el build arreglado.

Lo que nos salió mal

Publicamos aritmética de KV que tardó tres pases (15 → 11.5 → 7.4 → 4.3GB). Culpé «el fork». El binario es llama.cpp de era upstream más un cherry-pick HIP chico. Tratamos un hit de código memorable como ventana de posición. Las celdas n=1 siguen siendo mapas, no leyes.

Presupuestos de thinking en GSM8K hard filtrado: think_med=241ch en off/512/1024/2048/65536. Caps ≥512 no ataron en ese set. Crudo: kneemap-gsm8k-hard.log.

No publico un número de spec-decode en esta nota. El writeup existe; el log de brazos está vacío. Esa fila no sale hasta que el log tenga filas.

Condiciones: mini-PC GMKtec EVO-X2 de $1.400, Qwen3.8-27B Q4_K_XL, llama.cpp ROCm, ventana 262.144, K+V q4_0, temperature 0. Noche 4. Un mapa con logs linkeados.

Trabajar con Kyanite

¿Quieres que esto funcione en tu entorno?

Si esta nota describe una herramienta o resultado de Kyanite que necesitas, la ayuda de implementación cubre setup, asesoría, docs, ejemplos, checks y un handoff usable.

Límite de fit

Kyanite offers help grounded in its tools, products, and build practice. La consultoria mas amplia se enruta por PuenteWorks.

Sigue el sistema.

The Delegation Card: we asked a $1,400 mini-PC to take our jobs

Not is-it-smart but can-you-hand-it-work-and-walk-away. 495 trials, certified floors.

Qwen 3.8 27B en Strix Halo: la historia completa, medida

Cada dial medido, cada numero publico: la configuracion optima congelada para un 27B en un mini-PC de $1.400.

Notas: the measured-knees method for reasoning effort

A methods note on reasoning-effort calibration. Thinking rescued 15/40 hards vs 4/40 off. On easy tasks it bought nothing. Publish the knee.

Notas de lab: 67% LiveCodeBench-30 en un rig de $1.400

20/30 = 67% LiveCodeBench-30 en un mini-PC de $1.400. IC Wilson 95% 49-81%. Easy 10/10, medium 8/10, hard 2/10. Subset n=30. No es la card.

Notas de lab: revertimos una regresión de llama.cpp

Encontramos una regresión de llama.cpp y la revertimos. Batería n=6 en un rig de $1.400: 0/6 slashes antes, 5/6 después. Mismo Q4_K_XL. No es una historia de quant.

Notas de lab: 93% HumanEval en un rig de $1.400

28/30 = 93% HumanEval en un mini-PC de $1.400. Qwen3.8-27B Q4_K_XL. Temp 0, thinking off. Fallos: 50 y 145. Log crudo linkeado.

Notas de lab: la cuenca era un bug

Publicamos una cuenca. El hueco era el binario. Tras revertir c7d8722: 6/6 HIT a 198k. Mapa n=1 del build arreglado.

Notas de lab: el veredicto del KV

La pregunta q8-a-q4 del KV de la noche 1 ya tiene respuesta pareada: misma accuracy, cero tripwires, la mitad del cache. Y el label que tuvimos que corregir en público cuando el contador del server le ganó al estimado.

Notas de lab: la noche del veredicto

Un mini-PC de $1.400 sirviendo un 27B a 262k de contexto hace una pregunta: ¿capear cuánto piensa el modelo te cuesta accuracy? La respuesta pareada, el primer intento inválido, y la doctrina que quedó.

Un mini-PC, una noche y los numeros que discutian entre si: afinando Qwen3.8-27B en Strix Halo

Una noche y una tarde de medicion afinando un modelo denso de 27B en un mini-PC Strix Halo: las bandas honestas, la reversion, la doctrina de crashes y la historia detectivesca del EC.

GPT-5.6 Sol vs. Terra vs. Luna: politica de ruteo basada en evidencia

La division practica es Sol para descubrir, Terra para ejecutar trabajo acotado y Luna para procesar volumen verificable, cada uno con un contrato distinto.

Los agentes necesitan herramientas verificables, no mejor teatro de prompts

El patron util no es un prompt mas bonito. Es una superficie de herramienta que el agente puede llamar, inspeccionar, verificar y revisar.

El historial del repo es una señal de producto

Un repo no es solo almacenamiento. Es evidencia de decisiones, reparaciones, releases, cambios de nombre, huecos de pruebas y oficio real.

La ayuda de implementacion es parte de la superficie del producto

Una herramienta open source util todavia necesita una ruta desde repo publico hasta entorno funcionando. Esa ruta es producto.

Por que importa Kinocut

Kinocut da a los agentes de IA herramientas llamables sobre timelines, efectos, Hyperframes y medios terminados en kinocut.dev.

Monos infinitos, LLMs y el cuarto alrededor de la maquina

El argumento detras del video: la calidad no es solo probabilidad. Es arquitectura, filtros y gusto humano.

Lo que una herramienta de IA necesita antes de que alguien pueda usarla

Una guia practica para convertir una herramienta, flujo o app medio cruda en algo que otros puedan entender, instalar y usar.

Checklist de implementacion para servidores MCP

El checklist que Kyanite usa para distinguir un servidor MCP de juguete, una herramienta usable y algo que vale la pena implementar.

La arqueologia de repos convierte historia en evidencia

Por que el historial de commits es una de las fuentes de prueba mas fuertes para diagnosticos, implementacion y confianza tecnica.

El descubrimiento por IA necesita mas que un sitemap

Lo que Kyanite agrega para que buscadores y asistentes de IA entiendan herramientas, productos, prueba y rutas de soporte.