Ir al contenido
← Todos los artículos

Lo que realmente cuesta ejecutar una funcionalidad de IA

Ingeniería de IA 4 min de lectura

“¿Cuánto costará ejecutarlo?” suele preguntarse después de construir la funcionalidad, que es el extremo equivocado. La respuesta se puede saber de antemano hasta un factor de dos, y saberlo cambia decisiones de diseño que son caras de revisar.

La fórmula

Los proveedores facturan por token, con precio distinto para lo que envías y para lo que recibes. Un token son más o menos cuatro caracteres de inglés, así que 750 palabras son unos 1.000 tokens.

El coste por llamada es por tanto:

(input tokens × input rate) + (output tokens × output rate)

Toma una funcionalidad de respuesta de soporte. Las instrucciones de sistema ocupan 300 tokens. Recuperas cinco pasajes de unos 400 tokens cada uno, o sea 2.000. La pregunta del usuario son 50. Son 2.350 tokens de entrada. La respuesta vuelve alrededor de 250 tokens de salida.

A precios de gama media de 2026 para un modelo capaz (del orden de 2,50 € por millón de tokens de entrada y 10 € por millón de salida) eso es más o menos 0,006 € más 0,0025 €, o sea unos 0,0085 € por llamada. Cincuenta mil llamadas al mes son alrededor de 425 €.

El número que hay que notar es que la retrieval representó el 85% de la entrada. Eso es típico, y es donde está el margen.

Dónde va de verdad el dinero

El contexto recuperado, primero y con diferencia. Cinco pasajes en vez de diez recortan a la mitad el coste de entrada, en la mayoría de los casos sin pérdida medible de precisión. Los equipos recuperan de más porque se siente más seguro; merece la pena medirlo en vez de asumirlo.

Reintentos. Una llamada que falla la validación y se ejecuta otra vez cuesta el doble. Incluye un presupuesto de reintentos de forma explícita, y registra con qué frecuencia se dispara. Un bucle de reintento sin examinar es la causa más común de una factura que llega tres veces más grande que la estimación.

Cadenas de varios pasos. Un agente que planifica, llama a dos herramientas y resume son cuatro llamadas, cada una cargando la conversación acumulada. El coste crece más rápido que el recuento de pasos porque el contexto crece con él.

Embeddings, una vez. Indexar el corpus es un coste puntual, y pequeño: embedir un millón de tokens cuesta céntimos. Volver a embedir en cada despliegue porque el pipeline no detecta cambios no es pequeño, y ocurre.

Los cuatro cambios que recortan la factura de forma fiable

Recupera menos, mejor. Mejorar el ranking para que tres pasajes ganen a diez es a la vez más barato y más preciso: los modelos se degradan cuando la frase relevante está enterrada en contexto irrelevante.

Enruta por dificultad. La mayoría de las preguntas son fáciles. Envíalas a un modelo pequeño y escala solo lo que un clasificador barato marca como difícil. Un reparto 70/30 contra un modelo a un décimo del precio recorta la factura más o menos dos tercios.

Ordena el prompt para la caché. Pon el contenido estable (instrucciones, material de referencia compartido) al principio y la parte variable al final, para que la caché de prompt del proveedor pueda descontar el prefijo repetido.

Limita la longitud de salida. Si necesitas dos frases, dilo y pon un máximo. Los tokens de salida tienen el precio unitario más alto, y un modelo sin techo llenará el espacio que se le da.

Qué presupuestar en la práctica

Para una sola funcionalidad anclada a volumen moderado (unas decenas de miles de llamadas al mes) la factura del modelo suele estar entre 100 € y 1.000 €. Eso es casi siempre pequeño frente al coste de ingeniería de construirla, y pequeño frente al trabajo que sustituye.

Los costes que sorprenden a la gente están en otro sitio: el almacén vectorial si tiras de uno gestionado antes de necesitarlo, el volumen de logs si guardas cada prompt y cada respuesta para siempre, y la persona que tiene que mirar los resultados de evaluación cada mes. Presupuesta esa última. Una funcionalidad que nadie mide se degrada en silencio a medida que cambian los datos a su alrededor.

El único número que hay que tener antes de construir

El coste por llamada, en una servilleta, usando el tamaño de contexto que de verdad esperas. Lleva diez minutos y determina si la funcionalidad merece construirse, alrededor de qué tramo de modelo diseñar, y si necesitas enrutado desde el primer día o puedes añadirlo después.

La alternativa es enterarte en el segundo mes, cuando la arquitectura que lo habría arreglado barato es la arquitectura que ya publicaste.

Preguntas que también surgen

¿Qué es más caro, los tokens de entrada o los de salida?

Los tokens de salida cuestan varias veces más por token, pero el volumen de entrada suele ser mucho mayor por el contexto recuperado. En una funcionalidad anclada típica, el lado de entrada domina la factura pese al precio unitario más bajo.

¿Las cachés ayudan de verdad?

Sustancialmente, cuando una parte grande del prompt se repite. La caché de prompt del proveedor descuenta el prefijo repetido, así que poner las instrucciones de sistema estables y el contexto compartido al principio, y la parte variable al final, vale dinero real a volumen.

¿Deberíamos alojar un modelo nosotros para ahorrar?

Solo a volumen alto y sostenido. Una instancia de GPU cuesta lo mismo esté ocupada o idle, así que el self-hosting gana con carga continua y pierde feo con tráfico a picos. La calidad por euro también se mueve lo bastante rápido como para que una API alojada sea el valor por defecto más seguro.

¿Cómo evitamos una factura desbocada?

Límites duros de llamadas por usuario y por día, un tope a la longitud del contexto recuperado, y una alerta de gasto diario. Añádelos antes del lanzamiento: el mes más barato para descubrir un bucle que llama a la API en un reintento es el primero.

Quién escribe esto

Alexander (Sander) van Hooff

Alexander (Sander) van Hooff construye aplicaciones web desde 2015 y hoy dedica la mayor parte de su tiempo a llevar funciones de IA a productos que ya tienen usuarios. Vuewer es su estudio, dirigido desde la provincia de Alicante para clientes de toda Europa.

Trabaja con Vuewer

Lecturas relacionadas

Ingeniería de IA 4 min de lectura

RAG frente a fine-tuning: ¿cuál necesita tu producto?

La retrieval enseña al modelo lo que tú sabes; el fine-tuning le enseña cómo comportarse. La mayoría de las funcionalidades de producto necesitan lo primero, unas pocas ambas, y casi ninguna solo lo segundo.

Ingeniería de IA 5 min de lectura

Cómo añadir IA a una aplicación web existente

Una secuencia práctica para meter una funcionalidad de IA en una aplicación que ya tiene usuarios: elige un trabajo, ancla el modelo en tus datos, fija presupuestos y publícala detrás de un flag.

Aplicaciones web 5 min de lectura

Laravel multilingüe: rutas traducidas bien hechas

Por qué /nl/pricing pierde frente a /nl/tarieven, cómo construir slugs traducidos en Laravel, y los errores de hreflang que te cuestan en silencio los otros idiomas.

Ponte en contacto

Nos encantará saber de ti.

¿Tienes una pregunta o necesitas ayuda con una web o una aplicación web? Tanto si empiezas de cero, como si quieres mejorar lo que ya tienes o te has atascado en algo complejo.

Rellena el formulario y te responderemos lo antes posible.