Saltar al contenido
02 · Auditoría02 · Auditing

Red Teaming de IA y LLMAI and LLM Red Teaming

Inyección de prompt, fuga de datos y abuso de agentes con herramientas.Prompt injection, data leakage and abuse of tool-enabled agents.

OWASP Top 10 para LLMOWASP Top 10 for LLM 2.1 · Auditorías Técnicas (Hacking Ético)2.1 · Technical Audits (Ethical Hacking)

¿Qué es este servicio?What is this service?

Es la prueba ofensiva de sistemas basados en modelos de lenguaje: inyección de instrucciones, fuga de datos del contexto o del sistema, saltos de las restricciones del modelo y abuso de agentes que ejecutan acciones con herramientas conectadas.

Offensive testing of systems built on language models: prompt injection, leakage of context or system data, bypassing model restrictions and abuse of agents that take actions through connected tools.

¿Para qué se usa?What is it used for?

Sirve porque un asistente conectado a datos o a herramientas es una superficie de ataque nueva y muy mal entendida. El riesgo grande no es que el modelo diga algo inapropiado, sino que un texto que el modelo lea —un correo, un documento, una página— contenga instrucciones que el modelo obedezca. Si además ese agente puede ejecutar acciones, la instrucción inyectada se convierte en una acción real.

It matters because an assistant connected to data or tools is a new and badly understood attack surface. The big risk is not the model saying something inappropriate, but that text the model reads — an email, a document, a web page — contains instructions the model obeys. And if that agent can take actions, the injected instruction becomes a real action.

Qué beneficios traeBenefits it delivers

  • Encuentra la inyección indirecta, que es el riesgo dominante y el que casi nadie prueba: la instrucción no la escribe el usuario sino el contenido que el modelo procesa.
  • Verifica si el modelo puede filtrar datos de otro usuario o de su propio contexto de sistema.
  • Revisa los permisos del agente, que es donde el riesgo deja de ser conversacional y pasa a ser operativo.
  • Da evidencia concreta para el inventario y la clasificación de riesgo que pide el gobierno de IA.
  • Finds indirect injection, the dominant risk and the one almost nobody tests: the instruction is not written by the user but by the content the model processes.
  • Verifies whether the model can leak another user's data or its own system context.
  • Reviews the agent's permissions, where the risk stops being conversational and becomes operational.
  • Provides concrete evidence for the inventory and risk classification AI governance requires.

¿En qué momentos es obligatorio?When is it mandatory?

Costa RicaCosta Rica

  • No hay hoy una obligación legal específica de IA en Costa Rica.
  • Si el sistema trata datos personales, aplica la Ley 8968 con todas sus obligaciones, incluida la de medidas acordes al riesgo.
  • En entidades supervisadas, el uso de IA entra en el marco de riesgo tecnológico del Acuerdo CONASSIF 5-24 aunque no se le nombre.
  • There is currently no specific AI legal obligation in Costa Rica.
  • If the system processes personal data, Law 8968 applies in full, including the requirement for risk-appropriate measures.
  • In supervised entities, AI use falls within the technology risk framework of CONASSIF Agreement 5-24 even though it is not named.

InternacionalInternational

  • El AI Act europeo impone obligaciones de gestión de riesgos y robustez a los sistemas de alto riesgo, y pruebas de este tipo son la forma de sustentarlas.
  • Los proveedores de modelos de propósito general tienen obligaciones propias de evaluación y mitigación de riesgos.
  • OWASP mantiene un Top 10 de riesgos específico para aplicaciones con modelos de lenguaje, que es la referencia técnica habitual.
  • The European AI Act imposes risk management and robustness obligations on high-risk systems, and testing of this kind is how they are evidenced.
  • General-purpose model providers have their own risk evaluation and mitigation duties.
  • OWASP maintains a Top 10 of risks specific to language model applications, the usual technical reference.

Requisitos mínimosMinimum requirements

  • Acceso a la aplicación completa, no solo al modelo: el riesgo está en la integración, no en el modelo aislado.
  • Documentación de qué herramientas puede invocar el agente y con qué permisos.
  • Un entorno de pruebas, porque un agente con permisos reales puede ejecutar acciones con consecuencias.
  • Saber qué fuentes de datos alimenta el sistema, que es por donde entra la inyección indirecta.
  • Access to the full application, not just the model: the risk lies in the integration, not in the model alone.
  • Documentation of which tools the agent can invoke and with what permissions.
  • A test environment, because an agent with real permissions can take actions with consequences.
  • Knowing which data sources feed the system, which is where indirect injection enters.

Plazo típico de entregaTypical delivery time

2 a 4 semanas 2 to 4 weeks rango habitual del mercado usual market range

El rango habitual del mercado va de dos a cuatro semanas, con informe entre una y dos semanas después. Un asistente conversacional simple se cubre en una semana; un agente con varias herramientas conectadas y acceso a datos internos se va a cinco o seis, porque cada herramienta es una superficie nueva.

The usual market range runs from two to four weeks, with the report one to two weeks later. A simple conversational assistant is covered in a week; an agent with several connected tools and access to internal data stretches to five or six, because each tool is a fresh surface.

NomenclaturaTerminology

Las siglas y estándares que aparecen en esta ficha, explicados. The acronyms and standards used on this page, explained.

LLMLLM
Modelo grande de lenguaje: el tipo de modelo detrás de los asistentes conversacionales actuales. Large language model: the kind of model behind today's conversational assistants.
Inyección de promptPrompt injection
Introducir instrucciones que el modelo obedece aunque no vengan de quien debería mandarle. Introducing instructions the model obeys even though they do not come from whoever should be commanding it.
Inyección indirectaIndirect injection
La instrucción maliciosa viaja dentro del contenido que el modelo lee: un correo, un documento, una página web. The malicious instruction travels inside content the model reads: an email, a document, a web page.
AgenteAgent
Sistema de IA que además de responder ejecuta acciones mediante herramientas conectadas. An AI system that, beyond answering, takes actions through connected tools.
Prompt de sistemaSystem prompt
Las instrucciones ocultas que definen el comportamiento del asistente. Filtrarlas suele revelar lógica sensible. The hidden instructions defining the assistant's behaviour. Leaking them often reveals sensitive logic.
PentestPentest
Prueba de intrusión: se ataca el sistema con autorización previa y por escrito, para encontrar lo que encontraría un atacante real. Penetration test: the system is attacked with prior written authorisation, to find what a real attacker would find.
RoERoE
Reglas de compromiso: el documento que define qué se puede atacar, cuándo, con qué técnicas y a quién avisar. Rules of Engagement: the document defining what may be attacked, when, with which techniques and who to notify.
MITRE ATT&CKMITRE ATT&CK
Base de conocimiento pública de tácticas y técnicas usadas por atacantes reales. Public knowledge base of tactics and techniques used by real attackers.