Práctica · El dinero
Coste y
economía
Parece gratis por consulta. La factura llega al escalar.
Céntimos que se multiplican
Una llamada suelta cuesta una miseria. Pero un agente que hace decenas de llamadas por tarea, miles de veces al día, convierte esos céntimos en una factura muy real.
Entender cómo se cobra es lo que separa un piloto rentable de una sorpresa a fin de mes.
I
La mecánica
Cómo se factura
La unidad de cuenta
Se paga por token
No pagas por consulta, sino por tokens (esos trozos del Laboratorio). Y hay dos precios: los de entrada (lo que mandas) y los de salida (lo que responde) — la salida suele costar bastante más.
Detalle clave: en una conversación, el contexto se reenvía entero en cada turno. Cuanto más larga la charla, más pagas por mensaje… aunque no escribas más.
Calculadora
¿Cuánto costaría al mes?
II
De dónde sale el gasto
Qué lo encarece
Los cuatro multiplicadores
Dónde se va el dinero
- ·El tamaño del modelo: un frontera puede costar 50× más que uno pequeño por el mismo texto.
- ·El contexto largo: se reenvía en cada turno — crece con la conversación.
- ·La salida larga: pedir "explícamelo todo" cuesta más que pedir un resumen.
- ·El nº de llamadas: un agente multiplica las llamadas por tarea. Ahí se dispara.
III
Pagar menos por lo mismo
Cómo optimizar
Palancas de ahorro
Más barato, igual de bueno
- ·Modelo pequeño donde basta; el frontera solo para lo difícil (enlaza con elegir modelo).
- ·Caché de prompts: reutilizar el contexto fijo en vez de reenviarlo y pagarlo cada vez.
- ·RAG en vez de meterlo todo: recuperar solo lo relevante en lugar de cargar documentos enteros.
- ·Acota la salida y procesa en lote cuando no necesites respuesta inmediata.
La idea para llevarse
El token más barato es el que no envías
Antes de optimizar precios, optimiza cuánto pides: menos contexto inútil, salidas más cortas, el modelo justo. La eficiencia se diseña, no se negocia con el proveedor.
Fin · Coste y economía
Cuenta los tokens
antes de que cuenten ellos.