Forward Deployed Engineering

Qué hace realmente un forward deployed engineer

La respuesta directa y luego los recibos: todo el trabajo de un FDE sobre un mini-PC de $1.400, con evals públicas.

Por Simon Gonzalez de Cruz (el build en público en X @KyaniteLabs_). 2026-08-24. Primero la respuesta directa, después los recibos.

Un forward deployed engineer es el ingeniero que va adonde la IA tiene que funcionar de verdad, y logra que funcione ahí. No es quien entrena el modelo. Es quien toma un modelo que se ve bien en un benchmark y lo convierte en un sistema que un negocio real puede usar todos los días. El trabajo tiene tres partes: encontrar el punto de palanca en un flujo real, construir lo más pequeño que lo mueva, y quedarse a cargo en producción. El resto del post es esa frase desempacada, demostrada en un mini-PC de $1.400.

El título suena fuerte ahora porque los laboratorios de IA están contratando gente para este puesto tan rápido como pueden. El trabajo es más viejo que el nombre. Cualquiera que haya instalado software en una sucursal bancaria, un hospital o una planta ha hecho trabajo forward deployed. Yo hice versiones de esto durante doce años en sistemas de aprendizaje empresariales. Hoy corro el trabajo completo en mi propio hardware, y cada número que vas a ver es público.

Parte uno: encontrar el punto de palanca

En un negocio hay diez cosas que parecen automatizables. Normalmente solo una importa. El FDE la encuentra mirando el trabajo real, no leyendo un pitch. La herramienta para esto es la medición, no la opinión.

Una decisión de palanca medida en este escritorio: ¿el modelo local debe razonar por defecto? Lo corrimos de las dos formas sobre un set fijo de problemas. En 40 problemas duros, pensar rescató 15 que fallaban sin él. En HumanEval-30, pensar no compró nada: 28/30 en ambos casos. Así que el default que se entrega es pensar apagado, con override manual para tareas duras. Esa sola decisión de ruteo ahorra tokens todo el día y no cuesta nada donde el trabajo es fácil. Método completo en la nota de knees medidos.

Ese patrón escalado se vuelve ruteo de modelos: aquí el trabajo se mueve entre cinco lanes, elegidos por costo y velocidad medidos, no por marca. La misma disciplina, más superficie.

Parte dos: construir con evals

El cliente nunca pregunta "es inteligente". Pregunta "puedo entregarle trabajo e irme". Ningún leaderboard responde eso. Así que el FDE construye la prueba que sí.

Construimos una. Es open source: delegation-bench. Nueve clases de trabajo real. Tests ocultos que el sistema nunca ve. Una celda de sabotaje con una instrucción mala plantada. Pisos certificados, es decir estadística exacta que dice "al menos esto de confiable", no vibras. Resultado en esta máquina: 495 trials, 29 celdas, todas las celdas de capacidad en 20/20, y ocho celdas con certificación walk-away en 35/35 o 30/30 con pisos de 90.5 a 91.8 por ciento. Código, debugging, búsqueda en documentos, razonamiento, decisiones, dos tipos de visión: todos en el nivel walk-away.

La habilidad de código debajo de eso también es medible. 93% HumanEval (28/30, subset congelado, semilla publicada) y 67% LiveCodeBench-30 (20/30, intervalo Wilson 95% de 49 a 81). Siempre cita el intervalo. Misma caja de $1.400.

Parte tres: quedarse a cargo en producción

Esta es la parte que separa el título del demo. El sistema corre sin atención. Está siempre encendido, con watchdogs automáticos, recuperación de reinicios y disciplina de cola. Cuando se rompe, el FDE es el pager.

Una historia real de producción de este rig: a mitad de proyecto, el contexto largo y la visión se rompieron en silencio. La lectura fácil era "el modelo empeoró". No nos quedamos con la lectura fácil. Hicimos bisect de noches de cambios hasta un commit upstream de llama.cpp, lo reportamos como issue 26209, lo arreglamos local y validamos el fix upstream en nuestro silicio con 9/9 respuestas idénticas pareadas. Después re-corrimos los benchmarks congelados para confirmar que nada se movió. Ese es el trabajo. La historia completa de serving está en este blog con logs crudos.

La lista real de habilidades FDE

La gente busca "habilidades fde" y encuentra listas de deseos. Esta es la honesta, cada habilidad probada con un artefacto de arriba:

  • Evals y estadística básica. Puedes probar "al menos 90 por ciento confiable" con intervalos exactos, o no puedes afirmarlo.
  • Pegamento de integración. La IA nunca trabaja sola. Vive en un pipeline con documentos, colas y aprobaciones.
  • Debugging de entorno. Cuando la salida se vuelve basura, encuentras la capa que se rompió. Aquí fue un commit de host buffers, no el modelo.
  • Ownership de producción. Watchdogs, reinicios, logs, y la disposición a que te llamen de noche.
  • Hablar claro con no ingenieros. La tabla de decisión se entrega con los pisos impresos, para que un operador lea "puedes irte" sin saber qué es un quant.

Lo que el trabajo no es

No es trucos de prompt. No es un demo que funciona una vez en el escenario. Y no es data science: el FDE entrega sistemas, no notebooks. Si te gusta más la última milla que el laboratorio, este es tu trabajo. Si te gustan los problemas limpios, quédate cerca del modelo.

Cada afirmación de este post tiene un log crudo o un repo público detrás. Ese es el estándar. Apúntalo a tu propia máquina y mira cómo se ven tus pisos.

Siguiente en la serie: el decodificador de títulos FDE y por qué las evals son la habilidad FDE que nadie lista. Necesitas este tipo de trabajo en tu entorno? Intake de implementacion. Condiciones de cada número: GMKtec EVO-X2 de $1.400, Qwen3.8-27B Q4_K_XL, llama.cpp, logs crudos en delegation-bench y el repo del stack.

Trabajar con Kyanite

¿Quieres que esto funcione en tu entorno?

Si esta nota describe una herramienta o resultado de Kyanite que necesitas, la ayuda de implementación cubre setup, asesoría, docs, ejemplos, checks y un handoff usable.

Límite de fit

Kyanite offers help grounded in its tools, products, and build practice. La consultoria mas amplia se enruta por PuenteWorks.

Sigue el sistema.

The One-Line Bug That Crashed Our Fast Lane: finding, fixing, and measuring a speculative-decoding crash on a $1,400 mini-PC

Spec decoding crashed our fastest lane on day one. The bug was one missing line in our fork; the fix bought +17.7% and a surprise about draft quantization.

Dos modelos, una mini-PC de $1,400: los números emparejados, fracasos incluidos

Un modelo de razonamiento de 35B ya corre junto a nuestro 27B diario en una caja de $1,400, al mismo tiempo. Cada número emparejado, mismos problemas, misma máquina. Los fracasos también están aquí.

How I became a forward deployed engineer without a software engineer title

The title is new; the work is old. Twelve years of enterprise deployments plus public, measured AI work. The honest path, artifacts included.

Evals are the FDE skill nobody lists: my 495-trial public benchmark

The market says it cannot find people who can build AI evals. The skill is learnable and I published mine: 495 trials, certified floors, sabotage cell, open source.

Forward deployed vs solutions engineer vs implementation vs customer engineer: el decodificador

Cuatro títulos, una familia de trabajo, barras de código distintas. Un decodificador para leer cualquier vacante y saber en qué te estás metiendo.

The Delegation Card: we asked a $1,400 mini-PC to take our jobs

Not is-it-smart but can-you-hand-it-work-and-walk-away. 495 certified trials, then re-validated at deeper n after the product changed: 965 total, floors to 92.8%.

Qwen 3.8 27B en Strix Halo: la historia completa, medida

Cada dial medido, cada numero publico: la configuracion optima congelada para un 27B en un mini-PC de $1.400.

Notas: the measured-knees method for reasoning effort

A methods note on reasoning-effort calibration. Thinking rescued 15/40 hards vs 4/40 off. On easy tasks it bought nothing. Publish the knee.

Notas de lab: 67% LiveCodeBench-30 en un rig de $1.400

20/30 = 67% LiveCodeBench-30 en un mini-PC de $1.400. IC Wilson 95% 49-81%. Easy 10/10, medium 8/10, hard 2/10. Subset n=30. No es la card.

Notas de lab: revertimos una regresión de llama.cpp

Encontramos una regresión de llama.cpp y la revertimos. Batería n=6 en un rig de $1.400: 0/6 slashes antes, 5/6 después. Mismo Q4_K_XL. No es una historia de quant.

Notas de lab: 93% HumanEval en un rig de $1.400

28/30 = 93% HumanEval en un mini-PC de $1.400. Qwen3.8-27B Q4_K_XL. Temp 0, thinking off. Fallos: 50 y 145. Log crudo linkeado.

Notas de lab: el modelo que no puede olvidar pero no puede recordar

El número primero: este modelo es 75% no transformer. 48 de 64 capas guardan un estado. En un rig de $1.400, carga 198k una vez (1818s) y consulta en 9-27s.

Notas de lab: la cuenca era un bug

Publicamos una cuenca. El hueco era el binario. Tras revertir c7d8722: 6/6 HIT a 198k. Mapa n=1 del build arreglado.

Notas de lab: el veredicto del KV

La pregunta q8-a-q4 del KV de la noche 1 ya tiene respuesta pareada: misma accuracy, cero tripwires, la mitad del cache. Y el label que tuvimos que corregir en público cuando el contador del server le ganó al estimado.

Notas de lab: la noche del veredicto

Un mini-PC de $1.400 sirviendo un 27B a 262k de contexto hace una pregunta: ¿capear cuánto piensa el modelo te cuesta accuracy? La respuesta pareada, el primer intento inválido, y la doctrina que quedó.

Un mini-PC, una noche y los numeros que discutian entre si: afinando Qwen3.8-27B en Strix Halo

Una noche y una tarde de medicion afinando un modelo denso de 27B en un mini-PC Strix Halo: las bandas honestas, la reversion, la doctrina de crashes y la historia detectivesca del EC.

GPT-5.6 Sol vs. Terra vs. Luna: politica de ruteo basada en evidencia

La division practica es Sol para descubrir, Terra para ejecutar trabajo acotado y Luna para procesar volumen verificable, cada uno con un contrato distinto.

Los agentes necesitan herramientas verificables, no mejor teatro de prompts

El patron util no es un prompt mas bonito. Es una superficie de herramienta que el agente puede llamar, inspeccionar, verificar y revisar.

El historial del repo es una señal de producto

Un repo no es solo almacenamiento. Es evidencia de decisiones, reparaciones, releases, cambios de nombre, huecos de pruebas y oficio real.

La ayuda de implementacion es parte de la superficie del producto

Una herramienta open source util todavia necesita una ruta desde repo publico hasta entorno funcionando. Esa ruta es producto.

Por que importa Kinocut

Kinocut da a los agentes de IA herramientas llamables sobre timelines, efectos, Hyperframes y medios terminados en kinocut.dev.

Monos infinitos, LLMs y el cuarto alrededor de la maquina

El argumento detras del video: la calidad no es solo probabilidad. Es arquitectura, filtros y gusto humano.

Lo que una herramienta de IA necesita antes de que alguien pueda usarla

Una guia practica para convertir una herramienta, flujo o app medio cruda en algo que otros puedan entender, instalar y usar.

Checklist de implementacion para servidores MCP

El checklist que Kyanite usa para distinguir un servidor MCP de juguete, una herramienta usable y algo que vale la pena implementar.

La arqueologia de repos convierte historia en evidencia

Por que el historial de commits es una de las fuentes de prueba mas fuertes para diagnosticos, implementacion y confianza tecnica.

El descubrimiento por IA necesita mas que un sitemap

Lo que Kyanite agrega para que buscadores y asistentes de IA entiendan herramientas, productos, prueba y rutas de soporte.