Figma usa agentes de IA en seguridad: 70% más rápido

Qué cambió: Figma mete agentes de IA en su SOC

El equipo de ingeniería de Figma publicó esta semana un caso de uso detallado de cómo opera agentes de IA dentro de su propio Security Operations Center (SOC): investigar alertas, cruzar logs entre AWS, Okta, GitHub, GCP y osquery, revisar incidentes pasados y abrir pull requests con posibles correcciones. Según la documentación reportada por InfoQ, los agentes resuelven alertas complejas cerca de un 70% más rápido que el flujo manual, siempre con revisión humana en el lazo y controles estrictos sobre las herramientas que el agente puede tocar.

Lo que vuelve este caso interesante para founders no es el número: es el dibujo de quién decide qué. En lugar de ceder el juicio al modelo, Figma modeló con cuidado dónde el humano sigue al mando y dónde el agente puede moverse solo. Esa es una decisión de producto y de operación, no de infraestructura.

Cómo está montado el sistema

La base es un SIEM sobre Panther que ingiere logs de auditoría de AWS, Okta, GitHub, GCP y osquery (la herramienta open source que permite consultar máquinas vía SQL). El sistema también consulta más de 100 fuentes adicionales y es capaz de generar pull requests automáticamente.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

El núcleo de la investigación es el agente de triaje de alertas, que corre sobre un modelo del porte de Claude Opus. Recibe como contexto la conversación completa del hilo de Slack donde se reportó la alerta, más su propia memoria de orientación, y opera con un conjunto de herramientas con el mismo alcance que usaría un ingeniero de guardia. Por debajo corre sobre AWS Bedrock Knowledge Bases, Amazon Kendra, Tines y una capa de consulta sobre Snowflake para buscar alertas históricas y profundizar en los datos del Panther.

Los autores del reporte, Matthew Sullivan (ex-Figma, hoy en Nition) y Brad Girardeau (gerente de ingeniería de seguridad del Figma), explican que ese recorte (dar al agente exactamente las herramientas que usaría un humano) es la palanca que mantiene el sistema dentro de los carriles esperados.

Por qué la memoria separada importa más que el modelo

El detalle más transferible para quien construye productos con IA no es el stack ni el modelo, sino cómo se segmenta la memoria. Según los autores, la memoria fue el factor que más impacto tuvo en la utilidad del sistema con el paso del tiempo, y mantener tipos de memoria separados fue decisivo.

Tres tipos conviven en paralelo:

  • Alertas pasadas: para reconocer patrones ya vistos.
  • Orientación conductual: lo que el equipo aprendió sobre cómo llevar adelante la triaje.
  • Estructuras de base de datos aprendidas: para no redescubrir esquemas en cada investigación.

La lección para producto de IA: la memoria no es un balde único. Segmentar lo que el agente recuerda por finalidad cambia la calidad de la respuesta y reduce errores de contexto. Es una decisión de arquitectura de experiencia, no de prompt.

Los frenos: controles en las herramientas, no en el prompt

Los controles de seguridad no se dejaron al criterio del modelo: están embebidos en las propias herramientas que el agente puede invocar. Dos ejemplos concretos citados en el reporte:

  • Los PRs generados por el agente entran como borrador por defecto y necesitan revisión humana antes de cualquier merge.
  • Los prompts están diseñados para bloquear el filtrado de datos sensibles en canales públicos de Slack.

Es el tipo de guarda que separa una demo vistosa de un sistema en producción: el agente puede actuar, pero su radio de acción peligrosa está bloqueado por diseño.

El tema no es menor. En los últimos meses, el reporte "GhostApproval: A Trust Boundary Gap in AI Coding Assistants" de Wiz mostró que al menos seis asistentes de código podían ser engañados por repositorios maliciosos para mostrar al usuario un prompt de aprobación con apariencia inofensiva, según recogió InfoQ. Confiar el control únicamente en lo que el modelo "decide" ya no es defendible.

El otro frente: cazar vulnerabilidades con agentes

En un segundo texto, "How Figma stays ahead of vulnerabilities with agents", el equipo reportó que sus agentes detectaron más de 100 vulnerabilidades desconocidas, incluyendo dos críticas que las herramientas tradicionales habían dejado pasar. El revisor de código automatizado alcanzó un 80% de precisión en un mes, la detección de bugs conocidos mejoró cerca de un 30% con una segunda pasada de revisión, y hubo una caída de aproximadamente un 50% en algunos errores de código tras agregar orientación automatizada.

La recomendación práctica del equipo es contraintuitiva y aplica a cualquier equipo que monte evaluación de IA: mejorar la precisión antes que el recall. Los bugs históricos con los que ya contás solo miden recall y casi no ayudan con la precisión, que es el problema que hay que resolver primero.

Qué significa esto para tu startup

El caso de Figma no es una receta para replicar tal cual, pero deja tres decisiones concretas que cualquier equipo puede tomar hoy, sin importar el tamaño:

  1. Segmentar la memoria del agente por finalidad. No acumules todo el contexto en un solo bloque. Alertas pasadas, guías de comportamiento y estructuras de datos aprendidas deben vivir en memorias separadas. Es la palanca que más impactó la utilidad del sistema en el tiempo, según los propios autores.
  2. Mover los controles al borde de las herramientas, no al prompt. PRs como borrador por defecto, scopes de API con el mínimo privilegio, redacción de datos sensibles en canales públicos. Estas guardas viven en el código que el agente invoca, no en lo que el modelo "entiende".
  3. Evaluar precisión antes que recall. Antes de preguntar cuántos bugs encuentra el agente, preguntá cuántos de los que reporta son reales. El equipo de Figma explícitamente dice que su sistema no es perfecto, y esa imperfección se gestiona con mejor evaluación, no con más automatización ciega.

El contexto sectorial ayuda a dimensionar la urgencia: según un reporte de Reco recogido por TechNewsWorld, las empresas pequeñas y medianas cargan 414 herramientas de IA no sancionadas por cada 1.000 empleados, y cuatro de cada cinco corren sin supervisión de TI. En paralelo, el reporte cita 525 vulnerabilidades divulgadas en tooling de agentes y LLMs en los últimos 18 meses, con al menos 111 calificadas como críticas (CVSS 9.0 o superior). Esto refuerza la lectura de que los agentes son ya parte del campo de batalla, y operar sin políticas claras de gobernanza deja una superficie de ataque enorme.

Para founders hispanohablantes, el caso sirve como mapa de referencia: la próxima vez que un proveedor de IA prometa automatizar tu seguridad, podés preguntarle cómo segmenta la memoria, dónde están los controles de blast radius y cómo mide precisión sobre recall. Si no tiene respuesta, es una demo.

Fuentes

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...