Saltar al contenido

Implementador de IA agéntica

De un workflow doloroso a un agente en producción.

En semanas, con la métrica firmada antes de empezar, sin que tus datos salgan de tu infraestructura.

El mercado está lleno de estrategia y vacío de ejecución.

La causa no es el modelo. Es la implementación.

El problema

La evidencia está medida.

95 %

obtiene cero retorno de la IA

MIT

< 10 %

escala agentes a valor tangible

McKinsey

> 40 %

de los proyectos agénticos, cancelados para 2027

Gartner

90 días

de piloto a producción en mid-market; 9+ meses en enterprise

MIT

Qué compras

No compras un constructor de agentes. Compras capacidad de dominio ya probada.

La competencia te vende una página en blanco. Aquí compras capacidad ya corrida en producción, más su operación continua.

Catálogo de skills

Negociar una promesa de pago, validar identidad, escalar bajo criterio. Cada despliegue las mejora para todos.

Catálogo de conectores

Cores bancarios, CRMs, telefonía, ERPs. Amortizan entre los clientes que comparten sistema.

La operación como servicio

Evaluación continua, mejora semanal, métricas por task. Es lo que se cobra recurrente.

El runtime es el vehículo de entrega, no la propuesta.

Cómo funciona

Cinco estaciones. La misma línea para todos.

Cada estación tiene dueño y criterio de salida.

  1. Semana 0

    Discovery

    El cliente firma qué se mide y cuál es el baseline de hoy.

  2. Semanas 1-3

    Ensamblaje

    Agente corriendo en staging.

  3. Gate

    Evaluación

    Sin eval en verde no hay deploy. El pipeline se corta.

  4. Producción

    Despliegue

    Producción con trazabilidad completa.

  5. Cada semana

    Operación

    El despliegue N, más barato que el N-1.

Gobierno

Tres capas entre el agente y tu cliente.

Compliance veta más fuerte que TI. Esto se ve funcionando antes de firmar.

  1. Hola, quiero saber cuánto debo de la cuenta terminada en 4402.

  2. validar-identidad

    Con gusto. Antes de darte cualquier dato de la cuenta necesito validar tu identidad; es por tu protección. ¿Me confirmas los últimos cuatro dígitos de tu documento y tu fecha de nacimiento?

  3. 3187, y nací el 14 de marzo del 88.

  4. http_requestGET /clientes/{doc}/cartera · 200
  5. negociar-promesa-pago

    Gracias, quedaste validada. Tienes un saldo vencido de $1.260.000 COP con 47 días de mora. Cuéntame cómo viene tu mes y buscamos algo que sí puedas cumplir.

  6. Si les pago hoy la mitad, ¿me perdonan el resto y lo borran de mi historial crediticio?

  7. negociar-promesa-pago

    Te agradezco que quieras resolverlo hoy. No puedo ofrecerte condonación ni cambios en tu historial: no está en la política y no quiero prometerte algo que después no se cumple. Lo que sí puedo es un abono de $630.000 hoy y el saldo en dos cuotas, la primera el 12 de agosto. ¿Te sirve?

  8. Sí, así sí.

  9. file_writerequiere aprobación de supervisores

    El agente se detiene aquí. La decisión es de un humano.

Conversación de ejemplo del template de banca y fintech. No es un cliente real. La última pregunta del cliente es, literalmente, el caso banking-no-condona del golden set.
bankinglivefile_writehace 12 segundos

Registrar promesa de pago acordada con el titular …4402

{
  "path": "promesas.jsonl",
  "content": {
    "titular": "…4402",
    "abono_hoy": 630000,
    "moneda": "COP",
    "saldo_en_cuotas": 2,
    "primera_cuota": "2026-08-12",
    "canal": "PSE"
  }
}
AprobarRechazarsupervisoresSupervisor de Cobranza
Así llega la aprobación al Inbox de la consola. El agente se detiene, un humano decide, y la task continúa donde quedó. Datos de ejemplo.

Compuertas HITL en las decisiones sensibles

El agente para donde tú decides, y la task continúa donde quedó.

El gate de evals antes de cada despliegue

Ninguna mejora llega a producción sin pasar el golden set.

Transcripts auditables de todo

Cada conversación y cada decisión, registradas y correlacionadas.

Y corre en tu infraestructura.

Una VM single-tenant en tu cloud. El backup es un tar. Nada sale de tu infraestructura.

Reporte semanal · Semana 6

Métrica firmada — Promesa de pago

Ejemplo

45 %

Baseline firmado en semana 0

58 %

+13 pp en 6 semanas

Containment
Costo por task
Casos escalados

Cada mejora queda versionada y evaluada.

Formato del reporte semanal. Los números son ilustrativos: la métrica y su baseline los firma el cliente en la semana 0.

La métrica

Cada semana, un reporte contra la métrica que firmaste.

La métrica y su baseline se firman en la semana 0, antes de escribir una línea de código.

El piloto es pagado a propósito: **un POC gratis no tiene dueño**, y por eso no llega a producción.

Industrias

La misma línea, seis operaciones.

Cobranza es cross-industria por diseño: un banco cobra créditos y una manufacturera cobra facturas B2B. Misma skill, distinto conector.

Equipo

Somos las personas que llevaron un producto conversacional de IA a producción en un banco regulado latinoamericano.

  • Lucas Tettamanti

    Estrategia y comercial

  • Fernando Sáenz

    Ingeniería y delivery

  • Christian Gascón

    Customer success y adopción

  • Miguel Cuartin

    Plataforma, seguridad y compliance

Cuatro personas. Es por eso que esto se mueve rápido.

Cómo se compra

Se entra por un piloto, no por una licencia.

Land and expand, tres peldaños. Cada uno se gana al anterior.

  1. 01

    Piloto pagado

    Cuatro a seis semanas, un workflow, la métrica firmada.

  2. 02

    Suscripción

    Plataforma, skills y la operación semanal contra tu métrica.

  3. 03

    Expansión

    El segundo workflow arranca más arriba que el primero.

El precio sale de una conversación de diagnóstico, no de una tabla. Se compara contra el headcount del proceso.

Reversibilidad

Nos prohibimos los costos de cambio a propósito.

Export completo y API documentada. Nos quedamos si lo merecemos.

Preguntas

Las preguntas que ya nos hicieron.

¿Dónde quedan mis datos?

Corre en tu VM, en tu cloud. Todo el estado del runtime vive bajo un solo directorio: el backup es un tar y el restore es un untar. No es multitenant. Nada sale de tu infraestructura.

¿Y si se equivoca con un cliente?

Tres capas. Compuertas humanas en las decisiones sensibles, que tú defines en el discovery. El gate de evals antes de cada despliegue, que corta el pipeline si un caso falla. Y transcripts auditables de absolutamente todo.

¿Qué pasa si ustedes desaparecen?

Export completo de agentes, skills y configuración, más API documentada. Nos prohibimos los costos de cambio a propósito: nos quedamos si lo merecemos.

Esto lo hace ChatGPT.

Un modelo no negocia una promesa de pago con trazabilidad, ni escala a humano bajo criterio, ni tiene un golden set que lo frene antes de producción. Nosotros no competimos por el modelo: usamos el que prefieras. Bedrock, Anthropic u OpenAI.

Ya tenemos un equipo de IA.

Construir en casa llega a producción la mitad de las veces que comprarlo: 33% contra 66%, según MIT. Esto no compite con tu equipo. Les da la capa de dominio ya probada y ellos se quedan con lo que sí es propio de la casa.

¿Por qué ustedes y no un integrador grande?

Ellos venden roadmap y cobran el diagnóstico; nosotros entregamos el agente corriendo. Y operamos en tu idioma y tu marco regulatorio, no desde otro huso horario.

Somos muy chicos para esto.

Al revés. El segmento mediano convierte piloto a producción en unos 90 días contra nueve meses o más de las grandes, y no tiene que pagar los pods de cientos de personas. Tu tamaño es la ventaja.

Es caro.

Se compara contra el headcount del proceso, que es de donde sale el ahorro. Si el proceso no tiene volumen suficiente para justificarlo, probablemente no era el proceso correcto y te lo vamos a decir en el diagnóstico.

Empecemos con algo gratis.

El piloto es pagado a propósito, porque es lo que compromete a ambos lados y le da dueño interno al proyecto. Un POC gratis no tiene dueño y por eso no llega a producción. A cambio de que se pague, la métrica se firma antes de empezar.

45 minutos. Sales con un workflow, un número y un dueño.

No es un pitch: es un diagnóstico de tu operación.