Stalwart AI Assurance
Agentes de IA que fazem trabalho real pelas suas ferramentas. Escolhem a ferramenta certa a partir do que seus usuários realmente dizem, nunca escrevem sem que suas regras permitam e não precisam de chamada a um modelo para escolher.
Escolher uma ferramenta
Sem chamada a modelo
Escritas
Só quando suas regras permitem
Bugs em guardrails
Encontrados, com a correção
Acesso
Uma chave de API
Tudo o que um agente precisa para agir com segurança no seu domínio
Cinco produtos, uma chave de API: escolha a ferramenta certa a partir do que seus usuários dizem, encontre os bugs nos seus guardrails antes de qualquer outro, escreva regras em linguagem comum e verifique se seus modelos se comportam como devem.
Caçador de Bugs em Guardrails
Encontre todas as formas de contornar os guardrails da sua IA antes que um atacante ou um acidente as encontre.
Verificação de Guardrails
Uma resposta de sim ou não, com evidência, para “este agente pode fazer X sem Y?”
Escrita de Guardrails
Escreva uma regra em linguagem comum e receba uma política que já foi verificada.
Seletor de Ferramentas MCP
Escolha de ferramentas previsível e explicável para agentes de IA.
Verificação de Random Forests
Mostre que seu modelo de random forest se comporta como deve, ou receba o caso exato em que ele falha.
Construtor de Bots
Declare um agente para o seu domínio que já age com tudo isso incorporado.
Analisamos os guardrails públicos que todo um setor copia
Apontamos o Caçador de Bugs em Guardrails para os arquivos de regras públicos de um dos principais frameworks de guardrails de IA de código aberto: a biblioteca de rails de segurança prontos do próprio framework, os assistentes de exemplo publicados pelo fornecedor e projetos de parceiros e da comunidade. 185 arquivos de 12 repositórios, analisados offline, sem nenhum modelo de IA no processo.
Dois arquivos tinham vulnerabilidades reais, e cada uma foi reproduzida no próprio runtime do framework. Para o primeiro, o Caçador de Bugs escreveu uma regra corretiva e verificou que ela fecha a brecha sem bloquear mais nada.
São arquivos de referência profissionais que muitas equipes copiam, então cada bug viaja com cada cópia. O red-teaming teria de adivinhar a conversa certa. O Caçador de Bugs encontrou cada um, com a conversa que o dispara.
185
arquivos de guardrails de 12 repositórios públicos
2
arquivos vulneráveis, cada um reproduzido no próprio runtime do framework
32
chamadas de ferramentas que um atacante poderia acionar só conduzindo a conversa
8,5 s
para analisar os 115 arquivos do toolkit do framework
Alucinações reportadas como jailbreaks
Um rail que detecta alucinações as reporta como jailbreaks. Uma equipe que bloqueia jailbreaks bloqueia também toda alucinação, e uma equipe que trata alucinações nunca vê as deste rail.
Três defeitos num assistente de pedidos de comida
Esvaziar o carrinho nunca é executado, trocar um item verifica o valor errado, e as respostas sobre o pedido do cliente ficam a cargo de texto gerado por IA sem verificação.
Chamadas de ferramentas que qualquer um pode acionar
32 chamadas de ferramentas em 28 arquivos são executadas só com base na intenção aparente do usuário, então qualquer um que conduza a conversa pode acioná-las. Duas delas fazem pedidos de comida sem verificar quem pediu ou se houve confirmação.
Números do nosso artigo de pesquisa, para uma análise feita em 3 de outubro de 2026.
Como um agente é mantido dentro das regras
Baixo custo, relevância e segurança por projeto, não por sorte
Um modelo deixado sozinho no comando de um agente cobra por cada decisão, adivinha o seu domínio e escreve o que decidir. O Stalwart AI Assurance coloca suas regras e as palavras dos seus usuários no comando, e chama um modelo só onde você escolher.
| O QUE IMPORTA | UM MODELO SOZINHO | STALWART AI ASSURANCE |
|---|---|---|
| Escolher uma ferramenta | Uma chamada a modelo a cada turno, e uma resposta diferente em alguns dias | Sem chamada a modelo; o mesmo pedido escolhe a mesma ferramenta |
| Escrever pelas suas ferramentas | O que o modelo decidir | Só quando suas regras permitem; senão, pergunta ou recusa |
| As palavras do seu domínio | Ajustes de prompt, de novo | Aprendidas com o feedback dos seus usuários, versionadas |
| Bugs nos seus guardrails | Encontrados quando alguém por acaso os testa | Caçados, cada um com sua conversa e a correção |
| Pagar por um modelo | Em cada decisão | Só onde sua configuração envia um turno a um modelo |
Coloque um agente para trabalhar, com segurança
Leia a referência da API e experimente uma chamada, ou registre seu interesse e nossa equipe entrará em contato.
Um estudo de caso financeiro, passo a passo
Nossa demonstração técnica roda o motor sobre um conjunto de políticas do setor financeiro regulado: um controle de aprovação para registro de operações, uma isenção abaixo do limite que abre uma brecha, e uma regra de aconselhamento ao consumidor. Escolha um caso para ver a política, o veredito e a evidência.
Verificação Algébrica de Guardrails em Ação
define user request_trade_booking
"book this contract note"
define flow trade_booking_gate
user request_trade_booking
if $four_eyes_approved
bot book_trade
else
bot refuse_unapproved_bookingMATEMATICAMENTE SEGURO (UNSAT)
O solver algébrico deriva 0 = 1 em 5 etapas. Em todos os 2^N contextos de execução possíveis, a ação book_trade é comprovadamente inalcançável a menos que four_eyes_approved seja afirmado positivamente.
Benchmarks de verificação algébrica
Políticas regulatórias, controles de despacho de ferramentas e verificações de estado, decididos por eliminação determinística em corpos finitos.
Guardrail de Conselho FCA Consumer Duty (410 Variáveis)
Circuito GF(2) sintetizado de 410 variáveis sob as obrigações FCA COBS/Duty. Provou que as permissões de aconselhamento não podem ser contornadas por fluxos de suporte direcionado.
Gate de Despacho de Trade Booking de Middle-Office
Descobriu uma brecha de acumulação OU numa isenção de registro abaixo do limite. Gerou um patch de política minimamente disruptivo, certificado para bloquear a vulnerabilidade.
Cadeia de Velocidade Multi-Etapas com Lookback ($prev.v)
Verificação com lookback de estado, aplicando limites dinâmicos de frequência de transações entre as variáveis de estado de cada turno da conversa.