Ejecuta OpenAI Codex más barato que una suscripción ChatGPT: 98% de cache, GPT-5.5 con low reasoning y el workflow Grill-Me
Cómo usar OpenAI Codex CLI a través de Smart AIPI por menos que una suscripción ChatGPT. Tasas sostenidas de 98% de aciertos de cache en sesiones agentic largas, GPT-5.5 con low reasoning para la ejecución, el skill grill-me de Matt Pocock con high para la creación de tareas, más logos de gpt-image-2 generados directo en tu frontend.
TL;DR: Ejecuta OpenAI Codex CLI a través de Smart AIPI y la mayoría de los usuarios pagan menos que una suscripción ChatGPT Plus — sin el rate limit. El truco son dos ventajas que se acumulan: ~98% de tasa de aciertos en el prompt cache sostenida en sesiones agentic largas (cached input es 10× más barato que uncached), y usar GPT-5.5 con low reasoning effort para la ejecución, gastando high reasoning solo en la creación de tareas. Combínalo con el skill grill-me de Matt Pocock (github.com/mattpocock/skills) y tienes la harness de coding más barata y afilada del mercado.
La aplicación Codex de OpenAI es la mejor harness de coding de propósito general que existe hoy. Tiene modo dictado, un diff viewer real, un ecosistema profundo de plugins y skills (incluido el plugin computer-use), y corre GPT-5.5 — actualmente state-of-the-art en Terminal-Bench 2.0, Expert-SWE y FrontierMath. El único pero: la suscripción ChatGPT con la que viene Codex limita tu uso. Llegas al tope y te throttlean por horas.
Smart AIPI lo soluciona. Apunta Codex a https://api.smartaipi.com/v1 y obtienes pricing pay-as-you-go en los mismos modelos, con el prompt cache y el state de tool-call preservados a lo largo de sesiones largas. Para la mayoría de los usuarios sale más barato que una suscripción de tarifa plana — y nunca te throttlea.
Pay-as-you-go le gana a la suscripción ChatGPT para la mayoría de los usuarios de Codex
La suscripción ChatGPT Plus cuesta $20/mes. Pro cuesta $200/mes. Ambas vienen con caps duros de uso en Codex — unas pocas horas de trabajo agentic intenso y te throttlean hasta que se resetee la ventana de quota.
Smart AIPI cobra por token, sin mínimo, sin tarifa mensual, sin cap. Pricing de GPT-5.5 a través de Smart AIPI:
| GPT-5.5 (por 1M tokens) | Smart AIPI | Efectivo en una sesión Codex larga |
|---|---|---|
| Input (uncached) | $1.25 | ~2% de los input tokens |
| Input (cached prefix) | $0.125 | ~98% de los input tokens |
| Output | $7.50 | escala con el reasoning effort |
Haz las cuentas en una sesión Codex típica. 200K tokens de cached prefix por turno (tu repo + agents.md + historia), 5K de input nuevo por turno, 3K de output por turno con low reasoning. Eso son unos $0.054 por turno. Un día intenso de 100 turnos termina alrededor de $5. Un día normal de 20 turnos está más cerca de $1.
La ventaja del pay-as-you-go se compone en dos direcciones. Usuarios light — la mayoría — pagan entre $5 y $15 al mes por el mismo acceso por el que una suscripción de $20 cobraría y te capearía. Usuarios heavy que quemarían la quota de un Plus en una sola tarde pagan solo por lo que realmente computan, sin throttle y sin esperar. Ganas igual.
Cómo Smart AIPI sostiene el 98% de tasa de aciertos de cache en sesiones Codex largas
El pricing de portada solo importa si realmente aciertas en el cache. Muchos gateways nominalmente proxean los requests de OpenAI pero rompen el prompt cache upstream al re-keyear el request, descartar state mid-stream o perder el orden de los tool calls en los retries. Smart AIPI está diseñado específicamente para no hacer nada de eso.
Tres cosas mantienen el cache caliente:
- Preservación de la cache-key end-to-end. La prompt-cache key que OpenAI computa a partir del input prefix se preserva textualmente a través del gateway. No reescribimos, reordenamos ni normalizamos el contenido de los mensajes de formas que invaliden el cache.
- State de tool resistente al redial. Cuando upstream le aplica rate-limit a un request mid-stream, Smart AIPI redialea de forma transparente y reproduce el cached input — incluyendo items
function_callycustom_tool_callen vuelo. Codex nunca ve el redial, así que el cache sigue acertando en el siguiente turno en lugar de reiniciar en frío. - Preservación del state de sesión sobre WebSocket. Codex CLI streamea sobre WebSockets. Smart AIPI mantiene el cached input a lo largo de todo el ciclo de vida del WS, así una sesión agentic de 50 turnos comparte un cache caliente en lugar de pagar el precio de input completo en cada turno.
Efecto neto: una tarea Codex larga que costaría $40 de uncached input a través de un proxy ingenuo cuesta unos $4 a través de Smart AIPI. La diferencia 10× es el cache.
Usa low reasoning effort para casi todo
Contraintuitivo pero cierto: GPT-5.5 con low reasoning effort produce output igual o mejor que high en la gran mayoría de las tareas de coding, y lo hace a una fracción del costo de output. Los reasoning tokens se facturan como output, y high effort gasta entre 5 y 10× más reasoning tokens que low. En trabajo de rutina — escribir código, aplicar diffs, ejecutar comandos, resumir logs, refactorizar — esa deliberación extra no aporta nada. A menudo perjudica activamente: el modelo se cuestiona decisiones obvias, sobre-ingeniería cambios simples y entrega código verboso que sale más caro de leer.
| Tipo de tarea | Effort recomendado | Por qué |
|---|---|---|
| Escribir o editar código | low | GPT-5.5 ya sabe la respuesta; el reasoning añade tokens, no calidad |
| Aplicar diffs, ejecutar tools | low | Trabajo mecánico; high effort solo lo ralentiza |
| Refactorizar patrones familiares | low | El reconocimiento de patrones es la fortaleza de GPT-5.5 en cualquier nivel de effort |
| Resumir o explicar | low | Trabajo extractivo; el reasoning effort no ayuda |
| Crear una tarea desde un objetivo difuso | high | Traducir ambigüedad a un plan concreto requiere deliberación |
| Manejar fallos genuinamente novedosos | high | El trabajo de root-cause sin respuesta obvia es donde el reasoning paga |
La implicación económica: cada output token con high reasoning cuesta lo mismo que un token con low reasoning, pero generas muchos más. Tener low por defecto y solo cambiar a high cuando la tarea realmente lo exige reduce tu factura de output aproximadamente a la mitad en un proyecto típico.
El workflow Grill-Me: high reasoning donde es estructural
La forma más limpia de obtener lo mejor de ambos niveles de effort es el skill grill-me de Matt Pocock (github.com/mattpocock/skills). Hace exactamente lo que sugiere su nombre: el modelo te interroga sobre tu spec de tarea — haciendo preguntas aclaratorias dirigidas hasta que el objetivo, las constraints, los archivos en el alcance, los criterios de éxito y los edge cases sean inequívocos.
El workflow:
- Ejecuta
grill-mecon xhigh reasoning para la fase de spec. Típicamente 3–5 turnos cortos. Gasto total: unos pocos centavos de reasoning premium. La salida es un spec ajustado y completo contra el que el modelo puede ejecutar sin segundas dudas. - Baja a low reasoning para la fase de ejecución. Codex ejecuta el plan — 30 a 100 turnos escribiendo código, aplicando diffs, corriendo tests, iterando. Cada turno es barato porque el reasoning es mínimo y el input prefix está caliente en el cache.
- Vuelve a engagear high reasoning solo si la ejecución revela una ambigüedad genuina — una bifurcación arquitectónica real, un modo de falla inesperado sin solución obvia. Si no, quédate en low.
Este patrón cuesta aproximadamente la mitad que correr high reasoning todo el tiempo, con calidad al menos igual de buena — normalmente mejor, porque high reasoning durante la ejecución tiende a sobre-ingenierizar el trabajo de rutina.
Por qué Codex le gana a Claude Code como harness
Claude Code es una harness decente. Codex es una mejor para la mayoría de los workflows en 2026, y la brecha se está ampliando. Las features que importan en el día a día:
- Modo dictado. Habla tu tarea en lugar de tipearla. Codex transcribe y le pasa el texto al modelo. Para descripciones largas de tareas, revisiones de plan y cualquier momento en que quieras pensar en voz alta, esto es aproximadamente el doble de rápido que tipear.
- Diff viewer real. Cada edit pendiente aparece como un diff unificado antes de aplicarse, con accept/reject a nivel de chunk. Nunca te sorprende lo que hizo el agente porque ya lo aprobaste. El manejo de diffs de Claude Code es usable; el de Codex es significativamente más pulido.
- Skills y plugins. El formato de skill de Codex está bien documentado y se está formando un ecosistema activo a su alrededor. Más allá de
grill-me, el plugincomputer-usedeja a Codex manejar un browser, tomar screenshots y clickear — convirtiendo la misma harness en un agent de browser automation sin salir del terminal. - GPT-5.5 con low reasoning. La combinación es difícil de batir en productividad cruda por dólar. Claude Sonnet al mismo costo efectivo entrega código más verboso con menos confiabilidad de tool-use en sesiones largas.
GPT-Image-2 dentro de Codex: logos directo al frontend
GPT-Image-2 es el modelo de imagen flagship de OpenAI, y está live en Smart AIPI desde $0.003 por imagen. El encaje natural dentro de Codex es el skill image-generation: en lugar de cambiar de contexto a una herramienta de diseño, le pides a Codex que diseñe un logo, lo genere vía API y lo embeba directamente en tu frontend — todo en una sola tarea.
# Inside Codex, with the image-generation skill installed:
> design a clean monochrome logo for "Helix Analytics", generate it,
save it to public/logo.png, and reference it from the navbar.
[Codex calls /v1/images/generations with model=gpt-image-2,
saves the returned PNG to disk, edits the React component to import
and render it, and shows you the diff before apply.]
El mismo workflow maneja mascotas, hero images, marketing assets, headers de blog post — cualquier cosa visual por la que de lo contrario saldrías del terminal. A $0.003 por draft de baja calidad puedes iterar decenas de veces por el precio de un café.
El skill image-generation no es específico de Codex. Apuntado al endpoint /v1/images de Smart AIPI, funciona en cualquier harness que pueda llamar HTTP — incluido Claude Code. Mételo en tu setup de Claude Code y le das super-poder a la harness con la capacidad de generar logos y mascotas al vuelo durante una sesión de coding, algo que de fábrica no trae.
Configúralo en 60 segundos
Una env var y una línea de config:
# shell
export OPENAI_BASE_URL=https://api.smartaipi.com/v1
export OPENAI_API_KEY=sk-your-smartaipi-key
# ~/.codex/config.toml
model = "gpt-5.5"
model_reasoning_effort = "low" # default to low for execution
model_reasoning_summary = "auto"
Ese es el setup completo. Skills, plugins, modo dictado, el diff viewer, la integración computer-use — todo sigue funcionando. Lo único que cambia es a quién le pagas y qué tan barato.
Empieza — $5 gratis al registrarte
Cada cuenta nueva recibe $5 en créditos gratis de API — sin tarjeta de crédito.
$5 alcanzan para aproximadamente 1,650 drafts de GPT-Image-2, 600,000 output tokens de GPT-5.5, o cerca de 5 millones de cached input tokens — más que suficiente para correr grill-me + algunas tareas Codex completas de punta a punta antes de decidir si recargas.
- Regístrate en smartaipi.com/signup ($5 gratis, sin tarjeta de crédito)
- Crea una API key en el dashboard
- Configura
OPENAI_BASE_URLahttps://api.smartaipi.com/v1y tuOPENAI_API_KEYa la nueva key - En
~/.codex/config.tomlconfiguramodel = "gpt-5.5"ymodel_reasoning_effort = "low" - Instala grill-me y úsalo con xhigh reasoning para speccear tu próxima tarea
El mismo Codex que ya conoces — dictado, diff viewer, skills, plugins, computer-use, generación de imágenes — ahora corriendo en un modelo de pricing que escala con lo que realmente computas, con la tasa de aciertos de cache que hace baratas las sesiones agentic largas.
Puerta de enlace de API compatible con OpenAI. Accede a modelos de AI de frontera con un 75% menos de costo.
Empieza gratis