Ruteo de modelos / Sistemas agenticos

GPT-5.6 Sol vs. Terra vs. Luna: politica de ruteo basada en evidencia

La division practica es Sol para descubrir, Terra para ejecutar trabajo acotado y Luna para procesar volumen verificable, cada uno con un contrato distinto.

Resumen ejecutivo — TL;DR / BLUF

  • Sol High es la ruta de descubrimiento. Usalo cuando todavia no sabes cual es el camino, el subsistema responsable o la causa de la falla. Dale una meta de evidencia y una condicion de salida.
  • Terra Medium es la ruta de ejecucion. Usalo cuando la decision ya esta tomada y el trabajo tiene archivos, limites, comportamiento esperado y gates de aceptacion.
  • Luna es la ruta de procesamiento. Usalo para tareas estrechas, repetibles y de alto volumen que un schema, prueba determinista o auditoria por muestra pueda verificar.
  • Max es una escalada diagnosticada. En DeepSWE, el salto observado desde High fue modesto frente a un costo estimado por tarea unas 2.4 veces mayor, con intervalos de confianza que se superponen ligeramente.
  • Fast y Ultra son controles distintos. Fast es una opcion de mayor consumo de creditos para modelos compatibles. Ultra usa razonamiento maximo y puede agregar agentes para usuarios elegibles.
  • Nota de uso actual: algunas cuentas personales Plus y Pro elegibles pueden comprar un reset instantaneo que restaura el uso de cinco horas y el uso semanal de Work/Codex. El reset inicia un nuevo calendario semanal; no agrega una asignacion separada.

BLUF: no elijas el modelo por prestigio. Elige segun la incertidumbre del trabajo y el costo de demostrar que el resultado es correcto.

El ruteo es un problema de contratos de finalizacion

Sol, Terra y Luna no son solamente tres escalones de “mas potente” a “mas barato”. Cada uno funciona mejor con una definicion de terminado diferente. Sol necesita una frontera de investigacion. Terra necesita una especificacion. Luna necesita un validador.

ModeloTrabajoContrato de finalizacionFalla a prevenir
SolDescubrirPregunta, meta de evidencia, limites protegidos y condicion de paradaSeguir despues de encontrar la respuesta o ampliar el alcance sin evidencia
TerraEjecutarPlan aprobado, archivos nombrados, gates y pruebas requeridasTratar incertidumbre pendiente como si fuera un detalle de implementacion
LunaProcesarSchema exacto, ejemplos, validador determinista y regla de reintentoPermitir que un error barato y silencioso se propague por el pipeline

La guia actual de modelos de OpenAI presenta una jerarquia de capacidad y costo parecida. Para un sistema agentico, el paso importante es convertirla en una arquitectura de contratos y verificadores.

Lo que cambio despues de una semana de uso

Probamos las tres rutas en investigacion, evaluaciones, sitios y herramientas. Fue observacion operativa, no un benchmark controlado; por eso estas son notas de campo y no un ranking universal.

Sol rindio mejor cuando el trabajo tenia que descubrir su propia ruta. Sostuvo investigaciones largas y encontro errores importantes que un pase mas estrecho podia perder. Su falla caracteristica fue la persistencia sin salida: podia seguir explorando aun despues de tener la respuesta util. La mejora fue definir evidencia requerida, limites protegidos y una regla clara para parar.

Terra rindio mejor cuando el contrato de aceptacion ya estaba escrito. Con un alcance acotado produjo hallazgos adversariales concretos y decisiones limpias de aprobar o detener. Cuando todavia habia descubrimiento escondido, el supuesto trabajo de ejecucion habia sido ruteado demasiado pronto.

Luna fue consistente cuando el borde de salida se podia verificar por maquina. JSON con schema exacto, extraccion, metadata y tareas parecidas llegaron repetidamente con la forma pedida. Algunas corridas necesitaron un recordatorio explicito de cierre. El sistema de control no era solamente el modelo: era el modelo mas el schema y el validador.

Router de referencia para agentes de codigo

def rutear(tarea):
    if tarea.incierta or tarea.cruza_subsistemas:
        return ("Sol", "high", "evidencia + condicion de salida")
    if tarea.especificada and tarea.acotada:
        return ("Terra", "medium", "gates de aceptacion")
    if tarea.repetible and tarea.barata_de_verificar:
        return ("Luna", "minimo suficiente", "schema + validador")
    return ("Sol", "high", "evidencia + condicion de salida")

El fallback a Sol High es intencional. Si una tarea no esta acotada y tampoco es barata de verificar, probablemente todavia contiene trabajo de descubrimiento. Conviene resolver esa incertidumbre antes de pagarle a un ejecutor para adivinar.

Primero limita el router a la superficie real

Una politica no puede seleccionar un modelo que el producto actual no expone. “GPT-5.6” ofrece controles distintos en ChatGPT, Codex y el API, asi que la superficie debe formar parte de la decision.

  • ChatGPT estandar: la tabla actual dice que Medium, High y Extra High usan GPT-5.6 Sol con la misma tarifa por mensaje. Instant puede cambiar una solicitud a Medium.
  • ChatGPT Work y Codex: la tabla actual lista Sol, Terra y Luna con tarifas de creditos por token. La disponibilidad y los limites incluidos todavia dependen de la cuenta y el plan.
  • API: los tres modelos soportan none, low, medium, high, xhigh y max.

Revisa la tabla vigente de ChatGPT y el catalogo de modelos del API al implementar el router. Una captura del selector no es un contrato de arquitectura: la disponibilidad puede cambiar por producto y por plan.

Escala el esfuerzo solo despues de diagnosticar la falla

El esfuerzo de razonamiento es una segunda dimension del ruteo. Un nivel mayor deja mas espacio para explorar, usar herramientas y revisar, pero no corrige una premisa equivocada, permisos faltantes, un entorno de pruebas roto o un entregable ambiguo.

Esfuerzo SolDeepSWE v1.1Costo estimado por tarea
High69.4%$3.47
Extra High70.7%$4.70
Max72.7%$8.39

Los valores del 9 de julio de 2026 vienen del artefacto crudo de DeepSWE v1.1 de DataCurve. De High a Max hay 3.3 puntos porcentuales observados, mientras el costo estimado pasa de $3.47 a $8.39 por tarea, unas 2.4 veces mas. Son 113 tareas y los intervalos de confianza de 95% para High y Max se superponen ligeramente.

Eso convierte a Max en una escalada diagnosticada: usalo cuando High fallo porque abandono demasiado pronto una rama dificil o no exploro lo suficiente. El benchmark aporta evidencia de un harness; no promete la misma ganancia en un repo particular.

Manten separados los tres sistemas de costo

Precio del API, costo estimado por un benchmark y creditos Codex no son unidades intercambiables. OpenAI publica actualmente $4/$20 por millon de tokens de entrada/salida para Sol, $2/$12 para Terra y $0.20/$1.20 para Luna. La tabla vigente para Business y Enterprise/Edu lista entrada/entrada en cache/salida a 100/10/500 creditos para Sol, 50/5/300 para Terra y 5/0.5/30 para Luna.

El numero en dolares de un benchmark pertenece a su propio harness. Una corrida real tambien paga contexto, cache, salida de herramientas, reintentos, validacion y ramas paralelas. Usa la tabla vigente de ChatGPT Work y Codex para el plan que cubre y mide costo hasta una finalizacion verificada dentro del sistema.

P. D. Limites actuales de cinco horas y semanales

La guia vigente de OpenAI trata Work y Codex como productos con limites de cinco horas y semanales. Las cuentas personales Plus y Pro elegibles pueden comprar un reset instantaneo desde Usage, sujeto a disponibilidad por cuenta. La opcion no esta disponible para Free, Go, Business, Enterprise o Edu.

La compra restaura de inmediato tanto el uso de cinco horas como el semanal. Adelanta la asignacion semanal normal en vez de agregar otro derecho y no se puede guardar ni programar.

El nuevo periodo semanal comienza con la primera solicitud de Work o Codex despues del reset. El siguiente reset automatico ocurre siete dias despues de esa solicitud, no necesariamente siete dias despues del pago. Los creditos de uso son un saldo separado.

No conviertas Max, Fast y Ultra en una sola escalera

  • Max da mas tiempo de razonamiento a un modelo GPT-5.6.
  • Fast existe como opcion de Codex que consume mas creditos para modelos compatibles. La tabla actual no identifica cuales modelos GPT-5.6 lo soportan ni publica un multiplicador para GPT-5.6, asi que no codifiques ninguna de esas afirmaciones.
  • Ultra usa razonamiento maximo y puede ejecutar agentes adicionales para usuarios elegibles. No es una fila de modelo separada; los creditos dependen del modelo elegido y de los tokens producidos por la tarea y sus agentes.

Ultra justifica su overhead cuando cada rama puede producir evidencia independiente: revisar subsistemas separados, comparar implementaciones o investigar preguntas sin estado mutable compartido. Desperdicia contexto y genera colisiones cuando todos necesitan los mismos archivos, la misma decision o una dependencia secuencial.

El verificador tambien pertenece a la tabla de ruteo

RutaEvidencia requeridaVerificador tipico
Descubrimiento con SolReproduccion, investigacion citada o registro de decisionPrueba, auditoria de fuentes o revision independiente
Ejecucion con TerraDiff acotado mas los gates nombrados en el planPruebas, lint, tipos y revision del diff
Procesamiento con LunaSalida estructurada que cumple el contratoSchema, chequeo determinista, muestra o revision con modelo mas fuerte
El modelo economico es el que minimiza el costo total hasta un resultado verificado, no el que cobra menos por token.

Checklist de implementacion

  1. Clasifica la tarea por incertidumbre: descubrimiento, ejecucion acotada o procesamiento repetible.
  2. Nombra la superficie y confirma que el modelo y el control de esfuerzo existan ahi.
  3. Adjunta el contrato correcto: evidencia y salida, gates de aceptacion, o schema y validador.
  4. Empieza trabajo incierto y dificil en Sol High. Escala a Max solo despues de diagnosticar exploracion insuficiente.
  5. Entrega decisiones cerradas a Terra y unidades de volumen verificable a Luna.
  6. Mide finalizaciones verificadas, reintentos, tiempo de revision, latencia y consumo, no solamente cantidad de salida.

Esta politica vuelve auditable la seleccion. Una falla puede rastrearse hasta la ruta, el contrato, el entorno o el verificador, en vez de resumirse como “el modelo no fue suficientemente inteligente”. Para la version orientada a costo, aprobacion y riesgo del dueño, lee la guia complementaria de PuenteWorks: usa el modelo de IA mas barato que pueda terminar bien el trabajo.

Preguntas frecuentes

¿Sol siempre es el mejor GPT-5.6 para codigo?

No. Sol es la mejor ruta de descubrimiento cuando el camino es incierto. Terra suele ser mejor cuando el plan ya esta acotado y Luna cuando la transformacion es estrecha y tiene validacion determinista.

¿Debo usar Sol High o Max por defecto?

Empieza el trabajo dificil e incierto en Sol High. Escala a Max solo despues de identificar que la causa fue exploracion insuficiente, no un brief o entorno defectuoso.

¿Ultra es mas inteligente que Max?

No. Max aumenta el esfuerzo de un modelo. Ultra coordina varios agentes. El paralelo ayuda solo cuando el trabajo puede separarse sin duplicar contexto ni chocar sobre estado compartido.

¿Que pasa cuando compro un reset instantaneo de Work o Codex?

Para cuentas personales Plus y Pro elegibles, restaura de inmediato el uso de cinco horas y el semanal. El siguiente periodo semanal empieza con la primera solicitud posterior y el reset automatico ocurre siete dias despues. No es uso adicional guardado.

Fuentes y limites

Verificado el 4 de septiembre de 2026. Disponibilidad, precios, limites, tablas de uso y benchmarks pueden cambiar. Las notas de campo son observacionales; valida la politica contra tus propios repos y costos de verificacion.

Trabajar con Kyanite

¿Quieres que esto funcione en tu entorno?

Si esta nota describe una herramienta o resultado de Kyanite que necesitas, la ayuda de implementación cubre setup, asesoría, docs, ejemplos, checks y un handoff usable.

Límite de fit

Kyanite offers help grounded in its tools, products, and build practice. La consultoria mas amplia se enruta por PuenteWorks.

Sigue el sistema.

The One-Line Bug That Crashed Our Fast Lane: finding, fixing, and measuring a speculative-decoding crash on a $1,400 mini-PC

Spec decoding crashed our fastest lane on day one. The bug was one missing line in our fork; the fix bought +17.7% and a surprise about draft quantization.

Dos modelos, una mini-PC de $1,400: los números emparejados, fracasos incluidos

Un modelo de razonamiento de 35B ya corre junto a nuestro 27B diario en una caja de $1,400, al mismo tiempo. Cada número emparejado, mismos problemas, misma máquina. Los fracasos también están aquí.

How I became a forward deployed engineer without a software engineer title

The title is new; the work is old. Twelve years of enterprise deployments plus public, measured AI work. The honest path, artifacts included.

Evals are the FDE skill nobody lists: my 495-trial public benchmark

The market says it cannot find people who can build AI evals. The skill is learnable and I published mine: 495 trials, certified floors, sabotage cell, open source.

Forward deployed vs solutions engineer vs implementation vs customer engineer: el decodificador

Cuatro títulos, una familia de trabajo, barras de código distintas. Un decodificador para leer cualquier vacante y saber en qué te estás metiendo.

Qué hace realmente un forward deployed engineer

La respuesta directa y luego los recibos: todo el trabajo de un FDE sobre un mini-PC de $1.400, con evals públicas.

The Delegation Card: we asked a $1,400 mini-PC to take our jobs

Not is-it-smart but can-you-hand-it-work-and-walk-away. 495 certified trials, then re-validated at deeper n after the product changed: 965 total, floors to 92.8%.

Qwen 3.8 27B en Strix Halo: la historia completa, medida

Cada dial medido, cada numero publico: la configuracion optima congelada para un 27B en un mini-PC de $1.400.

Notas: the measured-knees method for reasoning effort

A methods note on reasoning-effort calibration. Thinking rescued 15/40 hards vs 4/40 off. On easy tasks it bought nothing. Publish the knee.

Notas de lab: 67% LiveCodeBench-30 en un rig de $1.400

20/30 = 67% LiveCodeBench-30 en un mini-PC de $1.400. IC Wilson 95% 49-81%. Easy 10/10, medium 8/10, hard 2/10. Subset n=30. No es la card.

Notas de lab: revertimos una regresión de llama.cpp

Encontramos una regresión de llama.cpp y la revertimos. Batería n=6 en un rig de $1.400: 0/6 slashes antes, 5/6 después. Mismo Q4_K_XL. No es una historia de quant.

Notas de lab: 93% HumanEval en un rig de $1.400

28/30 = 93% HumanEval en un mini-PC de $1.400. Qwen3.8-27B Q4_K_XL. Temp 0, thinking off. Fallos: 50 y 145. Log crudo linkeado.

Notas de lab: el modelo que no puede olvidar pero no puede recordar

El número primero: este modelo es 75% no transformer. 48 de 64 capas guardan un estado. En un rig de $1.400, carga 198k una vez (1818s) y consulta en 9-27s.

Notas de lab: la cuenca era un bug

Publicamos una cuenca. El hueco era el binario. Tras revertir c7d8722: 6/6 HIT a 198k. Mapa n=1 del build arreglado.

Notas de lab: el veredicto del KV

La pregunta q8-a-q4 del KV de la noche 1 ya tiene respuesta pareada: misma accuracy, cero tripwires, la mitad del cache. Y el label que tuvimos que corregir en público cuando el contador del server le ganó al estimado.

Notas de lab: la noche del veredicto

Un mini-PC de $1.400 sirviendo un 27B a 262k de contexto hace una pregunta: ¿capear cuánto piensa el modelo te cuesta accuracy? La respuesta pareada, el primer intento inválido, y la doctrina que quedó.

Un mini-PC, una noche y los numeros que discutian entre si: afinando Qwen3.8-27B en Strix Halo

Una noche y una tarde de medicion afinando un modelo denso de 27B en un mini-PC Strix Halo: las bandas honestas, la reversion, la doctrina de crashes y la historia detectivesca del EC.

Los agentes necesitan herramientas verificables, no mejor teatro de prompts

El patron util no es un prompt mas bonito. Es una superficie de herramienta que el agente puede llamar, inspeccionar, verificar y revisar.

El historial del repo es una señal de producto

Un repo no es solo almacenamiento. Es evidencia de decisiones, reparaciones, releases, cambios de nombre, huecos de pruebas y oficio real.

La ayuda de implementacion es parte de la superficie del producto

Una herramienta open source util todavia necesita una ruta desde repo publico hasta entorno funcionando. Esa ruta es producto.

Por que importa Kinocut

Kinocut da a los agentes de IA herramientas llamables sobre timelines, efectos, Hyperframes y medios terminados en kinocut.dev.

Monos infinitos, LLMs y el cuarto alrededor de la maquina

El argumento detras del video: la calidad no es solo probabilidad. Es arquitectura, filtros y gusto humano.

Lo que una herramienta de IA necesita antes de que alguien pueda usarla

Una guia practica para convertir una herramienta, flujo o app medio cruda en algo que otros puedan entender, instalar y usar.

Checklist de implementacion para servidores MCP

El checklist que Kyanite usa para distinguir un servidor MCP de juguete, una herramienta usable y algo que vale la pena implementar.

La arqueologia de repos convierte historia en evidencia

Por que el historial de commits es una de las fuentes de prueba mas fuertes para diagnosticos, implementacion y confianza tecnica.

El descubrimiento por IA necesita mas que un sitemap

Lo que Kyanite agrega para que buscadores y asistentes de IA entiendan herramientas, productos, prueba y rutas de soporte.

La Contribution Economy de ResonantDAO, explicada con recibos

Lo contrario de un DAO normal: primero la contribución verificada, el token después. El primer análisis en español del movimiento, con recibos.