×

El consumo de tokens no es una métrica: cómo deben medir las redacciones el ROI real de la producción de contenido con IA

Qué pasa con los paneles de uso de herramientas de IA

Boris Cherny, creador de Claude Code —la principal herramienta de programación de Anthropic—, formuló en una serie de publicaciones un problema que afecta por igual a las redacciones: el uso mide la actividad, no el retorno. Un panel que muestra cuántos tokens ha consumido tu equipo en una semana, cuántos prompts se han enviado y cuántos documentos se han generado, responde a la pregunta «¿qué está haciendo el equipo?», pero no a «¿qué está obteniendo el equipo a cambio?».

Para los equipos de contenido esto es especialmente crítico. Un editor que generó 40 borradores de artículos en un mes no necesariamente produjo 40 materiales listos para publicar. Algunos pudieron ser descartados en la fase de verificación de datos, otros enviados a revisión por ser triviales, y otros rechazados por problemas de originalidad. El consumo de tokens aumenta, pero la producción real de contenido puede seguir igual o incluso disminuir, porque el equipo pierde tiempo revisando borradores de baja calidad en lugar de trabajar de forma independiente.

La pregunta clave que Cherny sugiere hacerse en lugar de «¿cuántos tokens hemos gastado?» es: «¿Habríamos tenido que invertir recursos de ingeniería en esta tarea si no existiera la IA?». Para las redacciones se reformula así: «¿Cuántas horas de editor/autor/verificador habría tomado esta tarea sin IA, y cuántas tomó con IA?».

Por qué el consumo de tokens es una mala métrica para los equipos de contenido

El consumo de tokens es una métrica de consumo. Muestra cuánta «materia prima» procesó el modelo, pero no dice nada sobre:

  • La calidad del resultado. 100.000 tokens pueden dar un artículo analítico sólido o diez reseñas triviales que no pasarán el filtro editorial.
  • La tasa de rechazo. Si el 60% de los borradores generados van a la papelera, el consumo de tokens aumenta, pero la producción neta no.
  • El tiempo de revisión. Un borrador de IA que requiere cuatro horas de verificación y edición estructural puede resultar más caro que escribirlo manualmente desde cero.
  • La canibalización. Si un autor usa IA para una tarea que habría resuelto en 20 minutos a mano, la ganancia neta es cero o negativa (descontando el coste de la llamada a la API y el cambio de contexto).

En las operaciones de contenido, el consumo de tokens solo es útil como métrica técnica de presupuestación —para controlar los gastos de API y planificar límites—. Pero como métrica de éxito, resulta engañoso.

Infografía: pirámide de cuatro niveles de métricas de ROI en la producción de contenido con IA —desde el consumo de tokens hasta el impacto empresarial
Cuatro niveles de métricas: consumo → sustitución de esfuerzos → calidad → impacto empresarial. Solo los niveles superiores reflejan el retorno real.

Cuatro niveles de métricas para la producción de contenido con IA

Basándose en el marco de cuatro pasos de Cherny y adaptándolo a los flujos de trabajo editoriales, se pueden identificar cuatro niveles de medición:

Nivel 1: Métricas de consumo (técnicas)

La capa base, necesaria para la presupuestación, pero no para evaluar el resultado:

  • Volumen de tokens por tipo de tarea (borrador, revisión, resumen, verificación de datos)
  • Cantidad de llamadas a la API por usuario/equipo
  • Coste de la API por unidad de contenido (artículo, página, material)
  • Distribución de uso por herramientas (Claude, GPT, Gemini, Perplexity)

Estos datos muestran dónde se aplica la IA, pero no qué tan efectivamente.

Nivel 2: Métricas de sustitución de esfuerzos

El nivel clave. Aquí se mide cuánto tiempo humano ahorró realmente la IA. Metodología:

  1. Valoración base. Para cada categoría de contenido se fija una norma «pre-IA» —cuántas horas dedicaba el autor/editor a un artículo de este tipo antes de implementar la IA—.
  2. Valoración actual. Tras implementar el flujo de IA, se mide el tiempo real dedicado al mismo tipo de contenido —incluyendo el tiempo de prompting, revisión, verificación y edición final—.
  3. Ahorro neto = valoración base − valoración actual − tiempo de trabajo con la IA.

Ejemplo: un artículo de revisión de la industria solía tomar 8 horas del autor + 2 horas del editor = 10 horas. Con el flujo de IA (plantilla de prompt → borrador → edición estructural → verificación) — 2 horas del autor para prompting y revisión + 1,5 horas del editor + 0,5 horas del verificador = 4 horas. Ahorro neto: 6 horas por artículo, o 60%.

Importante: si el tiempo de trabajo con la IA más la revisión genera un ahorro negativo, la tarea no es apta para la automatización con IA. Esto es normal. No todos los tipos de contenido se benefician de la IA generativa.

Nivel 3: Métricas de calidad del resultado

El ahorro de tiempo carece de sentido si la calidad cae. Las métricas de calidad deben medirse en paralelo con las de velocidad:

  • Tasa de aceptación en la primera revisión. Qué porcentaje de borradores asistidos por IA pasan el filtro editorial sin una reescritura sustancial. Un porcentaje bajo significa que el sistema de prompts o el modelo no están cumpliendo con la tarea.
  • Evaluación de editores (comparación a ciegas). El editor califica el artículo sin saber si está asistido por IA o es totalmente manual. Si las versiones de IA reciben sistemáticamente calificaciones más bajas, el problema es de calidad, no de velocidad.
  • Métricas de originalidad. Porcentaje de materiales que pasan la verificación de plagio/detección de IA sin marcarse. El aumento de alertas significa que el modelo reproduce patrones que los detectores reconocen como sintéticos.
  • Puntuación E-E-A-T. Experiencia, Autoridad, Fiabilidad, Trayectoria —una evaluación subjetiva pero sistemática por parte del editor en una escala del 1 al 5 para cada material.

Nivel 4: Métricas de impacto empresarial

El nivel final: vincula la producción de contenido con resultados significativos para el negocio:

  • Tráfico orgánico al contenido asistido por IA frente al contenido manual (ajustado por tiempo de indexación y antigüedad)
  • Índice de citación en motores de respuesta con IA —si el contenido se menciona en las respuestas de ChatGPT, Perplexity, Gemini—.
  • Tiempo hasta la publicación (time-to-publish) —si se reduce el ciclo de producción sin perder calidad—.
  • Volumen del portafolio de contenido —si el flujo de IA permite ampliar el portafolio sin un crecimiento proporcional de la plantilla—.
  • Conversión desde el contenido —solicitudes, suscripciones, registros que pueden atribuirse a materiales específicos—.

Cómo construir un sistema de medición: enfoque práctico

Paso 1: Categorización del contenido

Divide todo el contenido en tipos: notas de noticias, artículos analíticos, reseñas de productos, guías/instrucciones, artículos largos, base de conocimientos. Para cada tipo, su propia norma «pre-IA» y su evaluación de aplicabilidad de la IA. Una nota de noticias puede casi no beneficiarse de la IA (la verificación de datos consume el ahorro), mientras que la base de conocimientos puede beneficiarse de forma exponencial.

Paso 2: Etiquetado de tareas

Cada tarea asistida por IA debe estar etiquetada: tipo de contenido, fase del flujo de trabajo (investigación, borrador, revisión, verificación, localización), herramienta utilizada, plantilla de prompt. Esto permite segmentar los datos y ver dónde la IA ofrece el máximo rendimiento y dónde el mínimo.

Paso 3: Registro de tiempo

Lo mínimo suficiente: el autor y el editor registran el tiempo real dedicado a cada material desglosado por fases. No hace falta medir cada minuto —basta con una precisión de 15 minutos—. En 2 o 3 meses se acumulan suficientes datos para obtener conclusiones estadísticamente significativas.

Paso 4: Auditoría trimestral del ROI

Cada trimestre compara:

  • Las normas base frente a los costes de tiempo actuales por cada tipo de contenido
  • La calidad (tasa de aceptación, evaluaciones de editores, originalidad)
  • Las métricas de negocio (tráfico, citaciones, conversión)
  • El coste de la API frente al ahorro de horas-hombre

Si el ahorro de horas-hombre en términos monetarios es inferior al coste de la API + los gastos generales de gestión del flujo de IA, el ROI es negativo, y debes optimizar el sistema de prompts o prescindir de la IA para ese tipo de contenido.

Trampas típicas al medir

Trampa 1: Medir solo la velocidad. «Escribimos artículos 3 veces más rápido» carece de sentido sin una métrica de calidad. Si es más rápido, pero peor, degradas tu portafolio.

Trampa 2: No tener en cuenta los gastos generales. Configurar sistemas de prompts, capacitar al equipo, mantener plantillas, gestionar claves de API: todos son costes ocultos. Si un editor dedica el 20% de su tiempo a mantener la infraestructura de IA, hay que contabilizarlo.

Trampa 3: Comparar lo incomparable. Un artículo largo asistido por IA y una reseña de noticias manual son tipos de contenido diferentes. Compara dentro de la misma categoría.

Trampa 4: Ignorar la canibalización. Si un autor usa IA para una tarea que habría hecho a mano en 15 minutos, pero gasta 10 minutos en prompting + 5 minutos en revisión, la ganancia neta es cero, y el riesgo de introducir errores es distinto de cero.

Trampa 5: Calcular el ahorro solo en función del salario. La hora de un editor cuesta más que su salario: también implica un coste de oportunidad. El tiempo liberado por la IA debe redirigirse a tareas de mayor valor añadido: investigaciones originales, entrevistas, columnas de opinión. Si el tiempo liberado simplemente se «ahorra», estás dejando de percibir ROI.

Cuando el ROI del flujo de contenido con IA es negativo —y está bien—

No todos los tipos de contenido se benefician de la IA. La práctica demuestra que:

  • Las notas de noticias a menudo no ofrecen un ROI positivo —la verificación de datos consume el ahorro de tiempo—.
  • Las columnas de autor y opiniones —aquí la IA estorba más que ayuda, porque el valor reside en la voz del autor, no en la estructura—.
  • Los materiales de referencia breves —si el autor puede escribir una referencia en 10 minutos, el prompting + la revisión con IA llevarán el mismo tiempo o más—.

El ROI positivo suele darse en:

  • La base de conocimientos y las guías —contenido estructurado y formateado, donde la IA acelera el borrador de 3 a 5 veces—.
  • La localización y adaptación —traducción y adaptación de materiales largos a nuevos idiomas—.
  • La sistematización de grandes volúmenes de datos —resumen de investigaciones, compilación de fuentes, preparación de reseñas—.
  • Las reseñas basadas en plantillas —productos, servicios, comparaciones— donde la estructura es repetible y la verificación es mínima—.

La relación con la visibilidad en la búsqueda con IA

Las métricas de impacto empresarial (Nivel 4) están directamente relacionadas con cómo los motores de respuesta con IA perciben tu contenido. Si los materiales asistidos por IA reciben más citaciones en Perplexity y ChatGPT que los manuales, puede indicar que el sistema de prompts estructura mejor el contenido para la lectura automática. Pero también puede significar que el contenido de IA es más trivial y fácil de citar, lo cual no es necesariamente bueno para la marca.

Principio clave: las métricas de visibilidad deben separarse por tipo de contenido y método de producción. Solo así se puede entender si la producción con IA ofrece una ventaja real en descubribilidad o simplemente genera más «ruido citable».

Lista de comprobación: cómo iniciar la medición del ROI del flujo de contenido con IA

  • Categoriza todos los tipos de contenido del portafolio —mínimo 5-7 categorías con diferentes normas de producción—.
  • Registra las normas de tiempo «pre-IA» para cada categoría —basándote en datos de los últimos 3-6 meses—.
  • Etiqueta cada tarea de IA: tipo de contenido, fase del flujo de trabajo, herramienta, plantilla de prompt —sin etiquetas, los datos son insuficientes—.
  • Registra el tiempo real con una precisión de 15 minutos —autor, editor, verificador por separado en cada fase—.
  • Mide la tasa de aceptación en la primera revisión —si es inferior al 50%, el sistema de prompts necesita reconfigurarse—.
  • Realiza una auditoría trimestral: ahorro de tiempo × coste por hora − coste de API − gastos generales = ROI neto.
  • Si el ROI es negativo para un tipo de contenido, no intentes «mejorar los prompts»; es posible que la tarea no sea apta para la IA.

Práctica: qué muestra la experiencia de implementación

Los equipos que han implementado una medición sistemática del ROI suelen descubrir uno de estos tres escenarios:

Escenario A: «Expectativas superadas». La IA ofrece un 40-60% de ahorro de tiempo en bases de conocimientos y guías manteniendo la calidad. El ROI neto es positivo. Recomendación: ampliar el flujo de IA a categorías afines.

Escenario B: «Ilusión de velocidad». La velocidad aumentó, pero la calidad cayó —la tasa de aceptación en la primera revisión es inferior al 40%, las evaluaciones de los editores son más bajas que las manuales—. El ROI neto es negativo o cero. Recomendación: revisar el sistema de prompts, introducir un humano en el bucle (human-in-loop) en la fase de estructura, o prescindir de la IA para este tipo de contenido.

Escenario C: «Ganancia puntual». La IA ofrece un ROI positivo en 2 o 3 categorías de contenido y negativo en el resto. Este es el escenario más frecuente y realista. Recomendación: centrar la IA en las categorías ganadoras, no intentar automatizarlo todo.

Justamente el escenario C es el objetivo correcto de implementación. El intento de «automatizar todo el contenido» es una utopía que conduce a un aumento del consumo de tokens sin un crecimiento real de la producción.

Preguntas frecuentes (FAQ)

¿En qué se diferencia el ROI de la producción de contenido con IA de la métrica habitual de rendimiento de la redacción?

El ROI de la producción con IA mide la diferencia neta entre los costes con y sin IA —incluyendo el coste de la API, los gastos generales de gestión del flujo y el tiempo de revisión—. El rendimiento habitual calcula la producción de contenido por unidad de tiempo sin tener en cuenta el método de producción.

¿Cuántos datos hay que acumular para que las conclusiones sean estadísticamente significativas?

Un mínimo de 2-3 meses y 30-50 materiales en cada categoría. Con menos, los datos son ruidosos; con más, corres el riesgo de tardar demasiado en tomar decisiones sobre flujos ineficientes.

¿Qué hacer si el consumo de tokens aumenta, pero la producción neta de contenido no lo hace?

Es una señal de que el equipo está usando la IA para tareas que no generan ahorro. Divide los datos por tipos de contenido y fases del flujo de trabajo: lo más probable es que encuentres categorías donde la IA canibaliza el tiempo en lugar de ahorrarlo.

¿Es necesario medir por separado el ROI de diferentes herramientas de IA (Claude, GPT, Gemini)?

Sí, si el equipo utiliza varios modelos. Los diferentes modelos ofrecen distinta calidad en distintos tipos de contenido —Claude puede ser más fuerte en análisis, GPT en textos basados en plantillas—. Sin una medición separada, no optimizas la distribución de las tareas.

¿Cómo contabilizar el coste de oportunidad del tiempo liberado en el cálculo del ROI?

Si las horas liberadas se redirigen a contenido de mayor valor añadido (investigaciones, entrevistas, materiales de expertos), es un plus adicional para el ROI. Si el tiempo simplemente se «ahorra» y no se redirige, el coste de oportunidad es cero y el ROI solo contabiliza el ahorro directo.