Tokens, créditos y cómo verificarlos
El Chat estándar aún procesa tokens internamente y sigue sujeto a los límites de mensajes y razonamiento de tu plan. La documentación actual de OpenAI lista Work y Codex —no el Chat estándar— como los que extraen del pool compartido de créditos agénticos.[1]
Nota de disponibilidad: ChatGPT Work se está desplegando gradualmente en cuentas elegibles.[1] Si Work aún no aparece en tu cuenta, usa Chat para planificación y Codex para ejecución técnica de archivos donde esté disponible.
| Entorno | Lo que experimentas |
|---|---|
| ChatGPT Chat estándar | Modelo específico del plan, mensajes y permisos de razonamiento |
| Work y Codex | Estructura de uso agéntico compartido; el uso adicional puede consumir créditos |
| API de OpenAI | Facturación separada de cuenta API basada en tarifas de tokens del modelo en USD — no créditos de suscripción de ChatGPT |
Cómo verificar tu uso
Abre Configuración de Codex → Uso en ChatGPT web o en la app de Codex.[2] Dependiendo de tu plan y rol en el workspace, el panel puede mostrar uso reciente, créditos restantes, opciones de compra y controles de recarga automática. Si no puedes añadir créditos tú mismo, consulta al propietario o administrador del workspace.
El uso incluido en tu plan se consume primero. Los créditos comprados se utilizan después de alcanzar los límites incluidos para funciones compatibles.[2]
El Chat estándar generalmente muestra límites de plan o modelo en lugar de un registro detallado de tokens por conversación.
Por qué los tokens de salida cuestan más
En la tarifa actual de Codex, los tokens de salida cuestan aproximadamente seis veces más créditos por token que los tokens de entrada ordinarios.[3] Para GPT-5.5 estándar, las tarifas son 125 créditos por millón de tokens de entrada y 750 créditos por millón de tokens de salida.[3] Sin embargo, en tareas agénticas largas, los tokens de entrada a menudo dominan el costo total porque el mismo contexto se reprocesa en cada turno.[8]
GPT-5.5 estándar cuesta 125 créditos por millón de tokens de entrada, en comparación con 18.75 para GPT-5.4-Mini.[3] Una tarea típica de Codex usando GPT-5.5 puede consumir entre 5 y 45 créditos dependiendo del tamaño del contexto y las iteraciones.[3] Usa el modelo más pequeño capaz de realizar la tarea. La tarifa actual también incluye los niveles más nuevos GPT-5.6 Sol, Terra y Luna; consulta la tarifa en vivo antes de elegir un modelo porque la disponibilidad y los precios pueden cambiar.[3]
¿Necesitas el sistema completo de Projects, archivos, Memory, Work y Tasks?
Esta página se centra en la economía de tokens y el enrutamiento. La guía complementaria muestra cómo organizar todo el flujo de trabajo de ChatGPT alrededor del contexto duradero del proyecto y la revisión humana.
Leer la Guía de flujo de trabajo de ChatGPT →Chat vs Work vs Codex: ¿Qué modo debo usar?
La prueba de enrutamiento de cinco segundos
Haz tres preguntas. La primera coincidencia gana.
El Ciclo de Vida del Contexto: Explorar → Fijar → Ejecutar → Verificar → Aprender
Este es el framework central de esta guía. Explica cómo el contexto debe transformarse entre las etapas de cualquier tarea asistida por IA — no solo cómo escribir un prompt más corto.
Explorar — usar Chat
Aclara el problema. Compara enfoques. Identifica supuestos. Define el éxito. El resultado es un problema mejor definido, no el trabajo terminado.
Fijar — crear un artefacto de tarea duradero
Convierte la conversación en un archivo estructurado: TASK.md, PLAN.md, un manifiesto de auditoría o un registro de decisiones. Esto fija el objetivo acordado antes de que comience la ejecución. Sobrevive a un nuevo hilo, un modelo diferente, una pausa de dos días o una revisión independiente.
Ejecutar — usar Work o Codex
Carga el artefacto fijado, no la conversación exploratoria completa. En la app de escritorio de ChatGPT, Work puede usar archivos locales aprobados y aplicaciones de escritorio con tu permiso.[1] Work en web y móvil opera en la nube y no puede abrir carpetas arbitrarias directamente en tu computadora.[1] Codex sigue siendo una vista separada para trabajo técnico con carpetas locales, repositorios, terminales y herramientas de desarrollador.[1]
Verificar — usar una pasada de evidencia limpia
La verificación comienza desde la especificación, los criterios de aceptación, los archivos resultantes y el conjunto de pruebas. No depende de la memoria del agente implementador sobre lo que pretendía hacer.
Aprender — actualizar instrucciones duraderas
Cuando un patrón de fallo se repite, añade una regla a tu archivo de gobernanza, actualiza el validador o mejora la plantilla de tarea. La guía de Codex de OpenAI recomienda mantener instrucciones duraderas en AGENTS.md y actualizarlas después de errores recurrentes observados.[5]
Deuda de contexto y los tres tipos de contexto
La deuda de contexto es el costo futuro creado cuando explicaciones temporales, correcciones, excepciones y decisiones no resueltas se acumulan sin consolidarse en la fuente de verdad.
- Corregir la misma regla cinco veces en un solo chat
- Dejar tanto las URLs antiguas como las nuevas en el proyecto
- Continuar después de que el agente adopta la interpretación errónea
- Añadir "tampoco cambies…" después de cada intento fallido
- Mantener planes rechazados dentro de la conversación de ejecución
Cada solicitud posterior debe procesar la instrucción original, el error, cada corrección, cada excepción y la decisión final. Eso aumenta tanto el uso como la posibilidad de elegir la versión incorrecta.
Cuando llegue la tercera corrección, deja de parchear la conversación. Reescribe la tarea o actualiza el archivo fuente de verdad.
Los tres tipos de contexto
Contexto duradero
Reglas de marca, estándares de codificación, enlaces canónicos, estructura de carpetas
Contexto de tarea
Resultado actual, archivos afectados, restricciones, pruebas de aceptación
Contexto de conversación
Preguntas, ideas rechazadas, razonamiento exploratorio, aclaraciones temporales
No uses la conversación como base de datos del proyecto.
Los Projects en ChatGPT pueden proporcionar continuidad entre chats, y la memoria exclusiva del proyecto puede aislar un proyecto de conversaciones no relacionadas.[4] Sin embargo, la documentación de OpenAI describe Projects como un límite de contexto — no una garantía de que cada detalle histórico siempre se recuperará correctamente. El estado crítico pertenece a archivos explícitos del proyecto.
¿Mismo chat, nuevo chat, proyecto o rama?
No crees un nuevo chat para cada fase. Crea un nuevo chat cuando el contexto cambie más de lo que la tarea se beneficia de la continuidad.
| Necesidad | Acción correcta |
|---|---|
| Continuar la misma tarea acordada | Permanecer en el hilo |
| Continuar con contexto más limpio | Crear un paquete de handoff + hilo nuevo |
| Explorar una alternativa sin perturbar el original | Ramificar la conversación |
| Aislar reglas del proyecto de la memoria personal | Usar memoria exclusiva del proyecto |
Una rama preserva la opcionalidad. Un handoff preserva la continuidad. Resuelven problemas diferentes.
Disparadores conductuales — inicia un nuevo hilo cuando el modelo:
- Reabre una decisión ya establecida
- Lee los mismos archivos repetidamente
- Reintroduce un error corregido previamente
- No puede declarar con precisión los criterios de aceptación actuales
Verificación de salud del contexto
Antes de continuar, declara:
1. El resultado actual
2. Las decisiones fijadas
3. Los archivos en alcance
4. Las restricciones de no tocar
5. Las pruebas de aceptación restantes
No continúes el trabajo aún.
Guía de memoria
| Usar memoria guardada para | Usar memoria exclusiva del proyecto para | No depender de memoria para |
|---|---|---|
| Preferencias estables, estilo de respuesta | Un sitio web específico, un cliente, un área confidencial | Precios exactos, URLs, números de versión, pruebas de aceptación, reglas legales |
La memoria personaliza. Los archivos gobiernan.
Generador de handoff
Un resumen general describe lo que se discutió. Un paquete de handoff declara lo que el siguiente agente necesita para actuar correctamente.
Eficiencia de Codex: Radio de búsqueda, razonamiento y puntos de control
El framework de Radio de Búsqueda de NotebookLM Guide
Instrucciones de archivo imprecisas hacen que Codex busque ampliamente, inflando el contexto antes de que comience el trabajo.
| Radio | Instrucción | Cuándo |
|---|---|---|
0 — Objetivo exacto | Edita solo /assets/nav.js. | Corrección de archivo único conocida |
1 — Familia acotada | Inspecciona /assets/ y el marcado nav de HTML. | Categoría de archivos conocida |
2 — Descubrimiento de repositorio | Busca todas las instancias del patrón. | Ubicación desconocida, patrón conocido |
3 — Exploración abierta | Busca en todo el repositorio. | Ubicación y patrón desconocidos |
Invierte inteligencia en la ambigüedad, no en el número de archivos. Un cambio en 100 archivos puede ser mecánicamente simple. Un bug de una línea puede requerir razonamiento profundo.
Razonamiento y enrutamiento de modelos
| Tarea | Nivel de razonamiento |
|---|---|
| Renombrar una etiqueta en archivos conocidos | Bajo |
| Reparar un bug CSS reproducible | Medio |
| Diagnosticar una regresión desconocida entre páginas | Medio–Alto |
| Diseñar una nueva arquitectura | Alto |
| Ejecutar una migración larga y ambigua | Alto–Muy alto |
Puntos de control
Un punto de control es una versión de referencia conocida como buena. Después de cada familia de incidencias exitosa, ejecuta las pruebas, inspecciona las salidas representativas, guarda el estado, registra lo que cambió y comienza la siguiente incidencia desde ese estado. Cuando una reparación falla, revierte al punto de control.
Reintenta desde un estado limpio, no desde el daño acumulado.
Bucle de retroalimentación de corrección a regla
Error → Causa raíz → Regla preventiva → Verificación automática → Actualización de la fuente de verdad
La mejor instrucción no es la que escribes antes de la primera ejecución. Es la regla extraída de un fallo real y luego aplicada automáticamente.
Independencia de verificación
| Nivel | Método | Fortaleza |
|---|---|---|
1 — Auto-verificación | El mismo agente ejecuta pruebas después de los cambios | Rápido; vulnerable a sus propios supuestos |
2 — Contexto fresco | Un nuevo hilo recibe especificación + archivos + pruebas, no la conversación de reparación | Juicio independiente |
3 — Determinista + humano | Validadores + pruebas + verificación de enlaces + capturas de pantalla + inspección humana | Máxima fiabilidad |
El verificador debe heredar los requisitos, no las excusas del implementador.
Lo que sucedió cuando le pedimos a la IA que reparara un sitio web de 288 archivos
La solicitud original
Subimos un ZIP de sitio web de 288 archivos a ChatGPT Work y le pedimos que corrigiera todos los problemas de CRO, SEO, navegación, Stripe y móvil en una sola ejecución.
Por qué falló
Cinco documentos de gobernanza contenían contradicciones — nombres de componentes antiguos junto a nuevos, texto CTA conflictivo, múltiples URLs de Stripe para el mismo producto. El modelo seguía un documento y violaba otro.
El patrón repetido
Reparar navegación → romper diseño. Reparar diseño → reintroducir selectores antiguos. Reparar selectores → duplicar CTAs. Cada reparación creaba el siguiente problema porque la deuda de contexto se acumulaba más rápido de lo que se resolvía.
Lo que realmente funcionó
Descomponer en el Ciclo de Vida del Contexto: un único archivo fuente de verdad (Explorar + Fijar), una familia de incidencias por ejecución de Codex (Ejecutar), validadores independientes (Verificar), y convertir cada error repetido en una regla de gobernanza (Aprender).
Resultados medidos
Los datos de uso observados de un ciclo de despliegue medido se publicarán aquí después del próximo despliegue. No publicaremos porcentajes de ahorro estimados — solo créditos medidos, ejecuciones y tasas de retrabajo.
Plantillas de prompt listas para copiar
Pre-flight de Chat — convertir una solicitud en paquete de tarea
Reparación con Codex — ejecutar una tarea fijada
Verificación independiente
Costo por resultado verificado y el modelo de madurez
Eficiencia Agéntica =
Resultados verificados completados ÷ Uso agéntico consumido
Tasa de éxito en primer intento =
Reparaciones que pasan todas las verificaciones en el primer intento ÷ Total de incidencias reparadas
Tasa de retrabajo =
Incidencias reabiertas después de completadas ÷ Incidencias marcadas como completadas
Ratio de deuda de contexto =
Instrucciones obsoletas o contradictorias ÷ Instrucciones autoritativas activas
El modelo de madurez de uso de IA
Prompting
Escribes mejores solicitudes. Un prompt a la vez.
Enrutamiento
Eliges Chat, Work o Codex correctamente.
Especificación de tarea
Defines resultado, restricciones y condiciones de finalización antes de la ejecución.
Estado externalizado
Los planes, decisiones e instrucciones viven fuera de la conversación.
Ejecución verificada
Cada resultado tiene evidencia determinista. La verificación es independiente.
Sistema de aprendizaje
Los fallos actualizan automáticamente la gobernanza, validadores y plantillas.
La ingeniería de prompts mejora una solicitud. La ingeniería de flujos de trabajo mejora todas las solicitudes futuras.
La tarjeta de decisión
Mantén esto accesible durante cada sesión.
- ¿Necesito una respuesta o un cambio de archivo?
Respuesta → Chat. Artefacto → Work. Código → Codex. - ¿El resultado es verificable?
Si no, define los criterios de aceptación en Chat primero. - ¿Es una sola familia de causa raíz?
Si no, crea paquetes de tarea separados. - ¿Cuál es la fuente de verdad canónica?
Nómbrala. Define la precedencia. - ¿Qué no debe cambiar?
Declara las exclusiones explícitamente. - ¿Puede un solo cambio compartido resolverlo?
Verifica antes de permitir ediciones por instancia. - ¿Cuál es el radio de búsqueda?
Nombra los archivos exactos. Expande solo con evidencia. - ¿Qué evidencia demostrará el éxito?
Comandos, pruebas, diferencias, archivos, inspecciones. - ¿Estoy midiendo o adivinando?
Etiqueta las estimaciones. Registra el uso observado.
Preguntas frecuentes
Sí. Chat procesa tokens internamente. Sin embargo, la documentación actual de OpenAI lista Work y Codex —no el Chat estándar— como los que extraen del pool compartido de créditos agénticos. El Chat estándar opera bajo los límites de mensajes y razonamiento específicos de cada plan.
El Chat estándar generalmente no extrae del pool de créditos agénticos. Work y Codex comparten ese pool. Usar Chat para planificación e interpretación preserva esta capacidad más restringida.
Sí. OpenAI indica que Codex, ChatGPT Work, ChatGPT for Excel y los Workspace Agents extraen del mismo pool de uso y créditos agénticos cuando esas funciones están disponibles en tu plan.
Usa Chat cuando necesites una respuesta, comparación, decisión o ayuda para definir una tarea: cualquier cosa que no requiera cambiar archivos ni producir un entregable final de múltiples fuentes.
Usa Codex cuando la tarea requiera cambiar archivos, ejecutar comandos de terminal, ejecutar pruebas, inspeccionar diferencias o crear paquetes de despliegue.
No automáticamente. Un nuevo chat reinicia el contexto y elimina información obsoleta acumulada, pero puede que necesites restablecer el contexto si la tarea depende de trabajo previo. Inicia un nuevo chat cuando el contexto cambie más de lo que la tarea se beneficia de la continuidad.
Las conversaciones más largas generalmente requieren que se lleve más contexto adelante. ChatGPT y Codex también pueden compactar o resumir el estado anterior cerca del límite de contexto, por lo que el contexto procesado exacto no es necesariamente la transcripción completa en cada turno.
Las tareas agénticas pueden consumir órdenes de magnitud más tokens que las conversaciones simples, con los tokens de entrada impulsando el costo general. La elección del modelo importa: GPT-5.5 estándar cuesta 125 créditos por millón de tokens de entrada versus 18.75 para GPT-5.4-Mini.
Abre Configuración de Codex, luego el panel de Uso en ChatGPT web o en la app de Codex. Dependiendo de tu plan y rol de workspace, el panel puede mostrar uso reciente, créditos restantes, opciones de compra y controles de recarga automática.
La deuda de contexto es el costo futuro creado cuando explicaciones temporales, correcciones, excepciones y decisiones no resueltas se acumulan sin consolidarse en la fuente de verdad. Se compone con cada intercambio e incrementa tanto el uso como las tasas de error.
No. Un prompt corto y ambiguo puede causar que el modelo explore múltiples enfoques incorrectos, consumiendo mucho más tokens que una instrucción más larga y precisa. La claridad es más eficiente en costes que la brevedad.
El Ciclo de Vida del Contexto es un framework de cinco etapas: Explorar (aclarar en Chat), Fijar (escribir artefactos de tarea duraderos), Ejecutar (usar Work o Codex con la especificación fijada), Verificar (probar contra la especificación de forma independiente) y Aprender (actualizar la gobernanza a partir de fallos observados).
Rastrea Eficiencia Agéntica = Resultados Verificados dividido por Uso Consumido. También rastrea Tasa de Éxito en Primer Intento y Tasa de Retrabajo. Solo cuantifica los ahorros después de tres o más ciclos de datos medidos.
ChatGPT Work se está desplegando gradualmente en cuentas elegibles. La disponibilidad depende de tu plan, configuración de workspace, rol y estado del despliegue. Si Work aún no aparece, usa Chat para planificación y Codex para ejecución técnica de archivos donde esté disponible.
Construye un sistema operativo multi-IA fiable
Obtén prompts de enrutamiento de tareas, frameworks de orquestación, patrones de handoff y puntos de verificación para trabajar con múltiples herramientas de IA.
Fuentes y metodología
- [1] Centro de ayuda de OpenAI. "ChatGPT Work and Codex." help.openai.com
- [2] Centro de ayuda de OpenAI. "Using Credits for Flexible Usage in ChatGPT." help.openai.com
- [3] Centro de ayuda de OpenAI. "Codex Rate Card." help.openai.com
- [4] Centro de ayuda de OpenAI. "Projects in ChatGPT." help.openai.com
- [5] OpenAI Developers. "Best Practices — Codex." developers.openai.com
- [6] OpenAI Developers. "Using Goals in Codex." developers.openai.com
- [7] OpenAI Developers. "Compaction." developers.openai.com
- [8] Bai, L. et al. (2026). "How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks." arXiv:2604.22750. arxiv.org
- [9] r/ChatGPT. "Long ChatGPT chats go bad…" reddit.com
- [10] r/codex. "Best Practices and workflows." reddit.com
Metodología
Todas las afirmaciones del producto se basan en la documentación oficial de OpenAI vigente al 23 de julio de 2026. Las afirmaciones conductuales sobre la variabilidad del consumo de tokens citan investigación en preprint (Bai et al., 2026, arXiv — sin revisión por pares). Los patrones de practicantes citan Reddit y publicaciones de la comunidad. Las comparaciones de costes utilizan términos relativos. Las afirmaciones de ahorro describen lo que el flujo de trabajo está diseñado para reducir — no mediciones observadas, a menos que estén explícitamente etiquetadas como datos medidos de un ciclo de proyecto específico. Los límites del producto, sistemas de créditos y precios pueden cambiar. Verifica los detalles actuales en help.openai.com.
Empieza con un flujo de trabajo de investigación con IA repetible
Obtén flujos de trabajo prácticos, prompts listos para copiar y una lista de verificación antes de construir un sistema multi-IA más grande.
Obtener el Kit gratuito →Privacidad y uso responsable de IA
Sabe qué subir, qué desidentificar y cuándo el trabajo sensible requiere un entorno organizacional aprobado.