# Lo que realmente cuesta ejecutar una funcionalidad de IA

> Estima el coste por llamada como tokens de entrada más tokens de salida al precio del proveedor, y multiplica por el volumen mensual. Para una funcionalidad de preguntas y respuestas anclada en 2026, espera más o menos de 0,002 € a 0,02 € por llamada. 50.000 llamadas al mes quedan entre 100 € y 1.000 €. El contexto recuperado, no la respuesta, suele ser la parte más grande de la factura.

"¿Cuánto costará ejecutarlo?" suele preguntarse después de construir la funcionalidad, que es el extremo equivocado. La respuesta se puede saber de antemano hasta un factor de dos, y saberlo cambia decisiones de diseño que son caras de revisar.

## La fórmula

Los proveedores facturan por token, con precio distinto para lo que envías y para lo que recibes. Un token son más o menos cuatro caracteres de inglés, así que 750 palabras son unos 1.000 tokens.

El coste por llamada es por tanto:

```
(input tokens × input rate) + (output tokens × output rate)
```

Toma una funcionalidad de respuesta de soporte. Las instrucciones de sistema ocupan 300 tokens. Recuperas cinco pasajes de unos 400 tokens cada uno, o sea 2.000. La pregunta del usuario son 50. Son 2.350 tokens de entrada. La respuesta vuelve alrededor de 250 tokens de salida.

A precios de gama media de 2026 para un modelo capaz (del orden de 2,50 € por millón de tokens de entrada y 10 € por millón de salida) eso es más o menos 0,006 € más 0,0025 €, o sea unos 0,0085 € por llamada. Cincuenta mil llamadas al mes son alrededor de 425 €.

El número que hay que notar es que la retrieval representó el 85% de la entrada. Eso es típico, y es donde está el margen.

## Dónde va de verdad el dinero

**El contexto recuperado, primero y con diferencia.** Cinco pasajes en vez de diez recortan a la mitad el coste de entrada, en la mayoría de los casos sin pérdida medible de precisión. Los equipos recuperan de más porque se siente más seguro; merece la pena medirlo en vez de asumirlo.

**Reintentos.** Una llamada que falla la validación y se ejecuta otra vez cuesta el doble. Incluye un presupuesto de reintentos de forma explícita, y registra con qué frecuencia se dispara. Un bucle de reintento sin examinar es la causa más común de una factura que llega tres veces más grande que la estimación.

**Cadenas de varios pasos.** Un agente que planifica, llama a dos herramientas y resume son cuatro llamadas, cada una cargando la conversación acumulada. El coste crece más rápido que el recuento de pasos porque el contexto crece con él.

**Embeddings, una vez.** Indexar el corpus es un coste puntual, y pequeño: embedir un millón de tokens cuesta céntimos. Volver a embedir en cada despliegue porque el pipeline no detecta cambios no es pequeño, y ocurre.

## Los cuatro cambios que recortan la factura de forma fiable

**Recupera menos, mejor.** Mejorar el ranking para que tres pasajes ganen a diez es a la vez más barato y más preciso: los modelos se degradan cuando la frase relevante está enterrada en contexto irrelevante.

**Enruta por dificultad.** La mayoría de las preguntas son fáciles. Envíalas a un modelo pequeño y escala solo lo que un clasificador barato marca como difícil. Un reparto 70/30 contra un modelo a un décimo del precio recorta la factura más o menos dos tercios.

**Ordena el prompt para la caché.** Pon el contenido estable (instrucciones, material de referencia compartido) al principio y la parte variable al final, para que la caché de prompt del proveedor pueda descontar el prefijo repetido.

**Limita la longitud de salida.** Si necesitas dos frases, dilo y pon un máximo. Los tokens de salida tienen el precio unitario más alto, y un modelo sin techo llenará el espacio que se le da.

## Qué presupuestar en la práctica

Para una sola funcionalidad anclada a volumen moderado (unas decenas de miles de llamadas al mes) la factura del modelo suele estar entre 100 € y 1.000 €. Eso es casi siempre pequeño frente al coste de ingeniería de construirla, y pequeño frente al trabajo que sustituye.

Los costes que sorprenden a la gente están en otro sitio: el almacén vectorial si tiras de uno gestionado antes de necesitarlo, el volumen de logs si guardas cada prompt y cada respuesta para siempre, y la persona que tiene que mirar los resultados de evaluación cada mes. Presupuesta esa última. Una funcionalidad que nadie mide se degrada en silencio a medida que cambian los datos a su alrededor.

## El único número que hay que tener antes de construir

El coste por llamada, en una servilleta, usando el tamaño de contexto que de verdad esperas. Lleva diez minutos y determina si la funcionalidad merece construirse, alrededor de qué tramo de modelo diseñar, y si necesitas enrutado desde el primer día o puedes añadirlo después.

La alternativa es enterarte en el segundo mes, cuando la arquitectura que lo habría arreglado barato es la arquitectura que ya publicaste.

---

Publicado por Vuewer. Funciones de IA y aplicaciones web, llevadas a producción.
Versión canónica: https://vuewer.com/es/blog/lo-que-cuesta-ejecutar-una-funcionalidad-de-ia