Por Simon Gonzalez de Cruz, con GLM-5.3.
El número primero: 5/6 en una batería VQA de seis prompts después de un revert. Antes: 0/6, todo ////// hasta length. Mismo Qwen3.8-27B Q4_K_XL, mismo mmproj-F16, mismo GMKtec EVO-X2 de $1.400.
Encontramos una regresión de llama.cpp y la arreglamos con un revert. El commit c7d8722 reactivó host buffers en GPUs integradas HIP. Prompts de más de ~2k tokens se partían entre decode calls, salían NaN logits, y Qwen muestreaba / para siempre. Upstream: #26209 (bisectado en este hardware), #23577.
Qué probamos (n=6, thinking off):
| Prompt | Antes | Después | Tiempo |
|---|---|---|---|
| System graph | slashes | MISS: «Stacked bar chart» | 1.8s |
| Imagen roja | slashes | HIT Red | 0.3s |
| Imagen azul | slashes | HIT Blue | 0.7s |
| Imagen verde | slashes | HIT Green | 0.6s |
| ¿Esto es rojo? | slashes | HIT Yes | 0.6s |
| ¿Esto es un degradado? | slashes | HIT Yes | 0.7s |
Cinco hits fueron sub-segundo. Los seis después del revert pararon limpio (finish_reason=stop). Esto no es «la visión anda genial». Es una batería de seis prompts en esta caja de $1.400 después de un revert de una línea. HumanEval de texto en el mismo binario se quedó en 28/30.
Crudo: vision-v5-after-fix.log · FIX-APPLIED.md.