Volver al blog
Por Alonso Grimaldo|||9 min de lectura

Caso Jev Lab: Agente IA que Toma Decisiones en Tiempo Real

Jev Lab es un laboratorio interno de Latech: un agente de IA que decide cada 5 minutos sobre 12 mercados con datos reales y solo dinero simulado. Aquí verás cómo se construyó, qué mostró el benchmark de cuatro versiones y qué lecciones sirven para decisiones de negocio.

Agentes IACaso RealAutomatización

La respuesta corta: qué es Jev Lab y qué demostró

Jev Lab es un laboratorio interno de Latech: un agente de IA que toma decisiones cada 5 minutos sobre 12 mercados (7 criptoactivos y 5 ETF de EE. UU.) con datos de mercado reales y solo dinero simulado. Lo construimos y desplegamos el 21 de septiembre de 2026 con 100 USD de capital virtual, el modelo jev-1.13.0 de TypeSafe y barreras duras escritas en código.

No buscamos ganar dinero ni afirmamos que lo gane. Un mercado es un entorno exigente para probar un agente que decide solo: datos que cambian cada segundo, costos por equivocarse y cero tolerancia a duplicados.

Pasamos por cuatro versiones y la conclusión fue clara: el modelo casi nunca era el problema. Lo eran los datos que recibía, la forma de preguntarle y las reglas que lo rodeaban.

Cómo funciona un ciclo de decisión

Los precios de criptoactivos (BTC, ETH, SOL, XRP, LINK, AVAX y PAXG, un token respaldado en oro) salen de los datos públicos de mercado de Coinbase Exchange. Los ETF (SPY, QQQ, GLD, SLV y CPER) salen de Alpaca en modo solo lectura, con cotizaciones del exchange IEX; según la documentación de Alpaca, su plan básico cubre en tiempo real solo IEX. Los ETF se evalúan únicamente con la bolsa de EE. UU. abierta.

Cada periodo de 5 minutos hace una sola solicitud al modelo, con una pregunta por cada activo operable en ese momento. Estos son los pasos:

  1. Reserva el periodo en la base de datos antes de llamar a cualquier proveedor. Si el proceso se cae a mitad de ciclo, ese periodo queda registrado y no se repite: sin duplicados ni reintentos silenciosos.
  2. Descarga cotizaciones y velas horarias. Un activo con cotización de más de 90 segundos, precio inválido o spread mayor a 1% queda fuera de ese ciclo; los demás siguen.
  3. Calcula en código los indicadores de cada activo: retornos de 1 hora a 1 semana, volatilidad, posición en el rango del día y volumen relativo. Si faltan velas completas y recientes, no consulta al modelo.
  4. Envía una sola solicitud a jev-1.13.0 con una pregunta Choice por activo: comprar, vender o mantener.
  5. Valida cada respuesta (opción permitida, probabilidades que suman 1 con tolerancia, confianza entre 0 y 1) antes de simular nada.
  6. Aplica las reglas: solo actúa con confianza de 0.7 o más, pide una segunda cotización después de la inferencia y ejecuta primero ventas y luego compras en orden de confianza.
  7. Simula la operación con 10 bps de comisión y 5 bps de slippage, y guarda en una misma transacción el saldo, la operación y el registro del ciclo: entrada, pregunta exacta, probabilidades, modelo, latencia y costo estimado.

Preguntas cerradas y barreras duras: por qué es auditable

TypeSafe define Choice como una pregunta para elegir una opción de un conjunto fijo: la respuesta trae la opción elegida, una probabilidad por opción y un nivel de confianza. No hay texto libre que interpretar. Cada decisión se valida con código y el panel muestra lo observado y las reglas aplicadas, sin inventar justificaciones. La confianza mide la distribución de respuestas, no la probabilidad de ganar.

El modelo juzga cada activo por separado. El reparto del efectivo lo hace el código, con límites que ningún prompt puede mover:

  • Máximo 10 USD por activo por ciclo, en compra o venta.
  • Exposición total máxima de 25 USD al momento de comprar, sin apalancamiento.
  • Umbral de confianza de 0.7 para ejecutar cualquier operación.
  • Pausa automática si el patrimonio neto llega a 90 USD o menos. Es una pausa de la simulación, no una orden stop real.
  • Si llega una pausa durante la inferencia, la operación pendiente se descarta.
  • Si falta la credencial del modelo, el sistema solo registra precios y marca “esperando credencial”. Nunca fabrica un “mantener”.

Benchmark de versiones: de 763 ciclos en “mantener” a 12 mercados

La versión inicial arrancó con SOL y luego pasó a BTC, ETH y SOL. Los costos de IA son estimaciones (tokens reportados por 0.042 USD por millón), no facturas.

Para v4 medimos antes de programar. En Coinbase solo PAXG se parecía a una materia prima, así que los ETF llegaron por Alpaca. SPY tuvo spreads de 0.3 bps, pero USO llegó a 631 bps y quedó fuera.

Con el validador corregido, v4 evaluó 12 de 12 activos: mantuvo oro, plata y PAXG con confianza de 0.75 a 0.94 y se inclinó a comprar BTC, ETH, SOL y QQQ sin llegar a 0.7. No hubo operaciones nuevas.

Evolución de Jev Lab por versión (registro de validación interno, septiembre de 2026)
VersiónActivos y cadenciaQué ve el modeloTokens por solicitudResultado observado
v1 (inicial)3 criptoactivos, cada minuto30 cotizaciones de 1 minuto por activo~8.6k (8,583 medidos)763 ciclos sin salir de “mantener”, p(hold) ≥ 0.69; IA estimada ~0.52 USD/día
v36 criptoactivos, cada 15 minutosIndicadores calculados desde velas horarias4,598Primera compra simulada: 10 USD de BTC con confianza 0.72; ciclo de 2.6 s
v3.16 criptoactivos, cada 5 minutosMismos indicadores~4,590IA estimada ~0.056 USD/día (288 solicitudes)
v412 activos (7 cripto y 5 ETF), cada 5 minutosIndicadores con ventanas por tipo de activo~8,950Ciclo de 4.9 s; primer periodo rechazado por un bug del validador, ya corregido

Lo que aprendimos y aplica a cualquier empresa

La v1 no falló: acertó. Veía 30 cotizaciones de 1 minuto, y el movimiento típico en 30 minutos (mediana entre 26 y 35 bps) casi igualaba el costo simulado de entrar y salir: 30 bps, es decir, 10 de comisión más 5 de slippage, por dos. Con esa señal, mantener era lo sensato (su p(buy) máxima fue 0.28).

El problema era de diseño, y caro: 1,440 solicitudes diarias por unos 8,600 tokens a 0.042 USD por millón dan unos 0.52 USD al día. Los 10 USD entre el capital inicial y la pausa se habrían ido en unos 19 días (10 ÷ 0.52) sin una sola operación.

  • Si el ruido del dato iguala el costo de actuar, un buen modelo no hará nada. Antes de culpar al modelo, revisa qué le muestras.
  • Los indicadores calculados en código le ganan a mandar datos crudos. Pasamos de unos 2,861 a unos 766 tokens por activo (8,583 ÷ 3 frente a 4,598 ÷ 6) y aparecieron las primeras decisiones distintas de mantener.
  • Las barreras van en código, nunca en el prompt. Topes, umbrales y pausas se aplican después de la respuesta.
  • Las preguntas cerradas hacen cada decisión validable, comparable y barata.
  • Guarda cada decisión con entrada, pregunta, probabilidades, modelo, latencia y costo. Sin eso no hay auditoría.
  • Mide el costo de IA por decisión desde el primer día. Entre v1 y v3.1 el costo diario estimado bajó unas nueve veces (0.52 frente a 0.056 USD).
  • Los validadores deben tolerar el redondeo. El primer periodo de v4 se rechazó porque 0.34 + 0.34 + 0.33 no pasaba una tolerancia de 0.01: se cobraron 8,943 tokens sin simular nada. La misma solicitud guardada, repetida, dio 12 respuestas válidas. La tolerancia hoy es 0.02.
  • Revisa qué significa cada dato. El ticker de Coinbase marca la hora del último trade: PAXG parecía desactualizado (entre 23 y 132 segundos) con la oferta viva. Ahora se usa el libro de nivel 1.

El mismo patrón aplicado a decisiones de negocio

Quita los mercados y queda un patrón reutilizable: datos frescos, indicadores calculados en código, una pregunta cerrada, reglas duras y registro completo. Es el enfoque que usamos al diseñar escenarios como el agente de incidencias para courier o el de renovaciones de pólizas para corredores de seguros.

La regla no cambia: el modelo propone con probabilidades, el código decide si se ejecuta y todo queda registrado. Y conviene empezar como nosotros: en modo simulado, contra una referencia simple, antes de tocar algo real. Estos son ejemplos de diseño, no casos implementados:

Cómo se traduce el patrón de Jev Lab a decisiones de empresa (ejemplos ilustrativos)
DecisiónPregunta cerradaIndicadores en códigoBarrera dura en código
Reposición de inventarioReponer, esperar o transferir entre almacenesDías de cobertura, rotación, pedidos en tránsitoTope de compra por SKU y presupuesto del periodo
Priorización de cobranzaLlamar, enviar recordatorio o esperarDías de atraso, historial de pago, promesas incumplidasFrecuencia máxima de contacto y horarios permitidos
Asignación de pedidosAsignar al repartidor A, B o CDistancia, carga actual, puntualidad recienteCapacidad máxima por repartidor y zonas autorizadas
PreciosSubir, bajar o mantenerMargen, stock, precio de referencia del mercadoMargen mínimo y variación máxima por día

Cómo lo validamos antes de dejarlo solo

Un agente sin supervisión necesita pruebas de operación, no solo de lógica:

  • 33 pruebas en Python (costos, exposición, datos viejos, respuestas malformadas, caídas, duplicados, mercado cerrado) y pruebas end-to-end en navegador, escritorio y móvil.
  • Recuperación automática: tras matar el proceso a la fuerza, el servicio volvió en 7.27 segundos con la misma cuenta, el mismo historial y la pausa preservada.
  • Respaldo antes de cada migración y comparación posterior: tras desplegar v3, los 831 registros históricos quedaron idénticos byte a byte.
  • Despliegue primero en un entorno de pruebas y luego en el continuo, que opera sin navegador abierto.
  • Trazas de ciclos reales de jev-1.13.0 revisadas en el navegador.

Qué no es este proyecto

Un caso de IA con mercados se malinterpreta fácil. Precisiones:

  • No ejecuta órdenes reales. No tiene integración con billeteras, firma de transacciones ni endpoints de órdenes; de Alpaca solo consulta el reloj del mercado, cotizaciones y velas.
  • No maneja dinero. Los 100 USD son capital virtual.
  • No afirma rentabilidad. La referencia es comprar y mantener SOL desde el inicio, que no paga costos de IA, mientras la cartera del agente sí los descuenta. Ninguna cifra de este artículo indica ganancia.
  • La ventana de observación es corta: unos cientos de ciclos (855 registrados antes de desplegar v4).
  • Los costos son estimaciones, no facturas: excluyen hosting y solicitudes fallidas de costo desconocido. Comisión y slippage son supuestos.
  • No es asesoría financiera ni de inversión.

Fuentes y referencias

Preguntas frecuentes

¿Jev Lab gana dinero?

No lo sabemos y no lo afirmamos. Jev Lab opera solo con 100 USD virtuales en paper trading, no ejecuta órdenes reales y su ventana de observación es corta. El objetivo del laboratorio es probar la arquitectura, las barreras y la observabilidad de un agente que decide solo, no demostrar rentabilidad. No es asesoría financiera ni de inversión.

¿Por qué usar preguntas cerradas en lugar de pedirle a la IA que explique su razonamiento?

Porque una pregunta cerrada, como la primitiva Choice de TypeSafe, devuelve una opción de un conjunto fijo con probabilidades y confianza. Eso se valida con código, se compara entre ciclos y se audita sin interpretar texto. En Jev Lab el modelo elige entre comprar, vender o mantener, y el código decide si se ejecuta según el umbral y los límites.

¿Cuánto cuesta en IA un agente que decide cada 5 minutos?

Depende de cuántos datos le envíes. En Jev Lab, la primera versión costaba unos 0.52 USD diarios estimados al mandar datos crudos cada minuto. Con indicadores calculados en código y ciclos de 5 minutos, v3.1 bajó a unos 0.056 USD diarios estimados (288 solicitudes de unos 4,590 tokens). Son estimaciones por tokens reportados, sin hosting: mídelo por decisión desde el primer día.

Soluciones relacionadas

También te puede interesar

Si tienes una decisión repetitiva que hoy depende de planillas o de criterio manual, en Latech podemos ayudarte a diseñarla como un agente con barreras duras, registro completo y una fase simulada antes de tocar tu operación real.

Háblanos por WhatsApp