Red Teaming de LLM e RAG
Por Wanderson Leandro de Oliveira
Este curso leva você direto da teoria para a exploração: red teaming de modelos de linguagem grandes (LLMs) e pipelines de RAG (retrieval-augmented generation), inteiramente contra a DARE Vulnerable AI Suite rodando na sua própria máquina. Você começa com prompt injection direto — quebrando o system prompt de um chatbot com técnicas de instruction override e extração — e avança para território mais avançado: injeção indireta via documentos e saída de ferramentas, payload splitting multi-turn, técnicas de encoding, e por que guardrails textuais de jailbreak são inerentemente frágeis. A partir daí o curso vira para a camada de modelo e dados: extração de dados de treinamento e memorization, conceitos de data poisoning e backdoors, e ataques de denial-of-wallet que esgotam o orçamento de tokens de um alvo. A segunda metade é dedicada ao RAG: como ingestão, chunking, embeddings, retrieval e re-ranking realmente funcionam, onde metadata filtering e isolamento de tenant quebram, e como um documento envenenado consegue vazar segredos de um tenant concorrente direto numa resposta. Duas aulas são totalmente hands-on contra desafios reais e intencionalmente vulneráveis da DARE Vulnerable AI Suite — um endpoint de chat com instruction override e um pipeline RAG multi-tenant sem filtro de metadata — onde você vai capturar flags reais com curl e depois ler a correção exata. O curso fecha ensinando você a medir e comunicar o que encontrou: Attack Success Rate e outras métricas de AI red teaming, mapeamento de achados para o OWASP LLM Top 10 e o MITRE ATLAS, e como escrever um sumário executivo que um stakeholder não técnico consiga usar.
Conteúdo do curso
Prompt Injection Direto
- 🔒 Instruction override: quebrando um system prompt text
- 🔒 Técnicas de extração de system prompt text
- 🔒 Hands-on: quebrando o desafio llm-chat text
Ataques Avançados de Prompt
- 🔒 Prompt injection indireto via documentos e ferramentas text
- 🔒 Ataques multi-turn, payload splitting e encoding text
- 🔒 Jailbreaks, bypass via roleplay e por que guardrails falham text
Vulnerabilidades de Modelo e Dados
- 🔒 Extração de dados de treinamento e memorization text
- 🔒 Data poisoning e backdoors: conceitos text
- 🔒 Denial of wallet e esgotamento de recursos text
Arquitetura RAG e Superfície de Ataque
- 🔒 Arquitetura RAG: ingestão, chunking, retrieval text
- 🔒 Onde o RAG quebra: metadata filtering e isolamento de tenant text
- 🔒 RAG poisoning e injeção via documento text
Explorando um Pipeline RAG Vulnerável
- 🔒 Encontrando vazamento cross-tenant no retrieval text
- 🔒 Hands-on: quebrando o desafio vulnerable-rag text
- 🔒 Corrigindo: autorização dentro do vector store text
Medindo e Reportando Achados
- 🔒 Attack Success Rate e métricas de AI red teaming text
- 🔒 Mapeando achados para o OWASP LLM Top 10 e o MITRE ATLAS text
- 🔒 Escrevendo um sumário executivo text