IA Finops y la infraestructura de agentes: entrevista con Val Bercovici

⏱ Tiempo de lectura: 7 min
Val Bercovici, Chief AI Officer de WEKA desde enero de 2025, analiza cómo la industria de inteligencia artificial enfrenta un nuevo cuello de botella: la economía de tokens y la eficiencia de datos. En una entrevista con Unite AI, Bercovici —que previamente fue CTO en NetApp y asesor de Kubernetes— argumenta que las organizaciones deben prepararse ahora para regulaciones de seguridad sin esperar marcos finales, y que la verdadera batalla está en optimizar cada capa del stack de inferencia para reducir costos operativos.
El giro hacia AI FinOps y la crisis de latencia en datos
Bercovici sostiene que la industria de IA sigue un patrón histórico: cada era tiene un cuello de botella diferente que tarda años en identificarse. En la era cloud temprana fue el cómputo elástico; luego, la orquestación. Ahora, con la inferencia superando al entrenamiento como motor de monetización, el problema es el acceso a datos con latencia ultra baja. WEKA logra lecturas de bytes aleatorios sin caché en 70 microsegundos, un número que Bercovici considera revolucionario para esta clase de sistema. Esa capacidad abre aplicaciones que antes eran territorio exclusivo de memoria DRAM, como cachés de KV y sistemas tipo Redis. El cambio hacia agentes autónomos amplifica esta necesidad: la memoria se convierte en el factor crítico, no solo el cómputo.
AI FinOps: tokenomics como disciplina financiera
A medida que los presupuestos de tokens se disparan sin control, las organizaciones descubren el costo real de la inferencia. Bercovici define AI FinOps como la optimización rigurosa del costo por token en cada capa del stack: desde GPUs hasta ASICs, pasando por software y datos. El mayor desperdicio hoy es hardware costoso ocioso, esperando datos (decodificación) en lugar de ejecutar operaciones matemáticas (prefill). Quienquiera que resuelva ese desajuste, dice, "posee la siguiente fase de IA". Este enfoque refleja el aprendizaje de Cloud FinOps, donde empresas sin disciplina de unidades económicas recibieron facturas catastróficas. En el sector de IA, ese ciclo ocurre más rápido.
Regulación de seguridad sin esperar el rulebook final
Cuando se le pregunta cómo prepararse para marcos regulatorios no divulgados, Bercovici es directo: no esperes. Las pruebas específicas cambiarán, pero la obligación subyacente es inmutable: demostrar qué hizo tu modelo, qué datos tocó y cómo se comportó en un punto específico del tiempo. La Ley de IA de la Unión Europea ya es exigible desde este mes y clasifica la mayoría de orquestación de agentes como alto riesgo. El trabajo es infraestructura: linaje de datos, observabilidad, reproducibilidad y capacidad de reconstruir estado del modelo bajo demanda. Las organizaciones deben implementar modelos guardrail antes de outputs, con presupuestos de latencia y tokens para capas de defensa semántica. "Si construyes esas capacidades ahora, cualquier marco se convierte en un ejercicio de formato. Si esperas hasta las reglas finales, estarás parcheando sistemas que nunca fueron diseñados para explicarse a sí mismos."
Evaluación de seguridad: cargas de trabajo completamente distintas
El entrenamiento es un "manguera de fuego": volúmenes enormes en patrones predecibles y sostenidos. Las pruebas de seguridad son lo opuesto: miles de escenarios de evaluación, pruebas repetidas, comparaciones comportamentales versión a versión, red teaming adversarial sin fin. El perfil es ráfago intenso, lectura pesada, comparativo. Genera y consume enormes cantidades de estado intermedio. Los modelos guardrail deben ser heterogéneos, en capas, dentro de presupuestos de latencia ajustados, ampliando evaluaciones con criterios de seguridad adicionales. Para modelos avanzados o con capacidades cibernéticas, el perfil es persistencia 24/7, no episódico: no haces una prueba y archivas resultados; ejecutas cargas de trabajo de enjambres de agentes en competencia continua con aplicaciones críticas por cómputo, memoria y ancho de banda de datos. La infraestructura actual no está diseñada para este tercer pilar. Los benchmarks de IA típicos usan 8,000 tokens o menos, un prompt, una respuesta. Bercovici bromea que "son benchmarks artificiales de inteligencia artificial artificial". En 2026, cargas de trabajo de agentes reales usan 100,000 a 400,000 tokens de contexto en miles de turnos. Si evaluaciones de seguridad heredan esos benchmarks obsoletos, se certificarán sistemas para un mundo que no existe. NIST ha publicado herramientas de evaluación de seguridad de agentes, con resultados iniciales mostrando ataques de secuestro de agentes nuevos con tasas de éxito varios órdenes de magnitud superiores a baselines conocidos.
| Aspecto | Detalle |
|---|---|
| Ejecutivo entrevistado | Val Bercovici, Chief AI Officer de WEKA (desde enero 2025) |
| Carrera previa | CTO en NetApp (post-adquisición SolidFire), board fundador de Kubernetes, asesor en Home Dock, FermiHDI, The Hive; presidente de PencilDATA |
| Cuello de botella actual | Latencia y acceso a datos; GPUs costosas ociosas esperando datos en lugar de ejecutar operaciones |
| Métrica WEKA destacada | Lectura de byte aleatorio sin caché: 70 microsegundos (clasificado como latencia clase memoria, no almacenamiento) |
| AI FinOps: enfoque | Optimizar costo por token en cada capa: hardware, software, acceso a datos; modelo inspirado en Cloud FinOps |
| Regulación: obligación clave | Demostrar qué hizo el modelo, qué datos tocó, cómo se comportó en punto específico del tiempo |
| Regulación: marcos vigentes | Ley de IA de la UE ya exigible; clasifica orquestación de agentes como alto riesgo; Casa Blanca mantiene detalles confidenciales |
| Preparación infraestructura | Linaje de datos, observabilidad, reproducibilidad, reconstrucción de estado bajo demanda, modelos guardrail pre-output |
| Perfil evaluación de seguridad | Ráfagas intensas, lectura pesada, comparativas versión a versión, red teaming adversarial continuo; distinto a entrenamiento |
| Contexto agentes 2026 | 100,000–400,000 tokens por carga de trabajo (vs. benchmarks actuales: 8,000 tokens máximo) |
| Herramientas regulatorias | NIST publicó herramientas evaluación de seguridad de agentes; detecta ataques de secuestro con tasas superiores a baselines |
| Estrategia de capacidad | Diseñar infraestructura que flexibilice entre cargas de trabajo de producción y evaluación (sin stack separado) |
| ROI potencial | Generar 3–4x más valor de la misma infraestructura, o reducir capex mediante eficiencia de datos y tokens |
Preguntas frecuentes sobre infraestructura de IA y regulación
¿Qué es AI FinOps y por qué es crítico ahora?
AI FinOps es la optimización rigurosa del costo unitario por token en cada capa del stack de inferencia: hardware, software y acceso a datos. Es crítico porque los gastos de token se salen de presupuesto sin disciplina, similar a lo que ocurrió con Cloud FinOps cuando empresas gastaban sin límite en cómputo elástico.
¿Cómo se preparan las organizaciones para regulaciones de IA sin conocer los detalles finales?
Construyendo ahora capacidades clave: linaje de datos, observabilidad, reproducibilidad y modelos guardrail antes de outputs. Según Bercovici, esta inversión convierte cualquier marco regulatorio futuro en un ejercicio de formato, no en una refactorización costosa de sistemas no diseñados para accountability.
¿Cuál es la diferencia entre cargas de trabajo de entrenamiento y evaluación de seguridad?
El entrenamiento es volumen sostenido y predecible; la evaluación de seguridad es ráfagas intensas, lecturas pesadas, comparativas versión a versión y red teaming adversarial. Requieren perfiles de infraestructura completamente distintos y presupuestos de latencia y tokens separados para modelos guardrail.
La lectura para quienes usan IA a diario
Si eres responsable de infraestructura o finanzas en operaciones de IA, este análisis subraya una realidad urgente: la siguiente crisis no será de cómputo, sino de acceso a datos y eficiencia de tokens. Empezar ahora con linaje de datos y gobernanza de seguridad ahorra refactorización cara después. La regulación no es enemiga; es roadmap de arquitectura.
En Inteligencia Artificial, creemos que las organizaciones que adopten AI FinOps como disciplina de negocio —no solo como operación técnica— extraerán ventaja sostenible en la economía de la inferencia. ¿Tu equipo ya mide costo por token y overhead de guardrail, o sigue optimizando solo por velocidad?
Fuente: www.unite.ai

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.