Guardrails no servidor: bloquear antes de a mensagem ir ao modelo

Por equipe PowerVizion · · 6 min de leitura · Engenharia · Disponível

Resumo: Guardrails são regras que limitam o que um agente de IA pode receber e fazer. Na PowerVizion, a política do workspace é aplicada no servidor, a cada mensagem e antes de o modelo ser chamado: termos bloqueados, limite diário por usuário, instruções do admin e ferramentas desligadas. Só owner e admin alteram, e cada bloqueio fica na auditoria.

O que são guardrails e por que no servidor?

Guardrails, ou barreiras de proteção, são regras que definem o que um sistema de IA aceita e produz. Uma regra que só existe na tela é uma sugestão: quem usa outro cliente, como uma extensão ou uma chamada direta, a contornaria.

Por isso a PowerVizion aplica a política no servidor, no mesmo ponto de entrada de todos os agentes. Quando a mensagem é bloqueada, o modelo nem chega a ser chamado, o que também evita custo de processamento com algo que não deveria ser tratado.

Os guardrails não substituem a aprovação humana. Eles definem o espaço em que os agentes podem atuar, e dentro dele as ações continuam dependendo de uma pessoa.

O que o administrador controla

A política é do workspace e fica sob Administração. O que ela cobre hoje:

Instruções e listas têm tamanhos máximos: até 8 mil caracteres de instruções, 100 termos bloqueados e 50 ferramentas desligadas.

  • Instruções customizadas: texto colocado no topo das instruções do agente, com reforço no fim.
  • Termos bloqueados: mensagens que contêm um deles não são processadas.
  • Limite diário de mensagens por usuário, com contador que zera a cada dia.
  • Ferramentas desligadas: removidas do que o agente pode usar.
  • Nível de confirmação humana antes de ações: nenhum, só escrita (o padrão) ou todas.
  • Moderação da resposta por um classificador, ligada por padrão.

A ordem das checagens em cada mensagem

Primeiro, o servidor lê a política do workspace e verifica os termos bloqueados. Depois, conta a mensagem no limite diário do usuário. Só então entram os safeguards de finalidade e o restante do processamento. Se qualquer etapa barra a mensagem, o usuário recebe uma explicação e o evento é gravado.

A resposta de bloqueio é clara: informa que a política do workspace impediu o processamento e orienta a falar com o administrador, sem expor o termo que disparou a regra.

Essa ordem é intencional. As checagens baratas e determinísticas vêm primeiro, e as que dependem de um classificador só rodam quando a mensagem toca dados sensíveis, para não somar latência a pedidos comuns.

Safeguards: a camada fixa de finalidade

Além da política ajustável, há uma camada que o admin não desliga: os safeguards. Eles tratam de dados comportamentais do MAP e perguntam para que a pessoa quer o dado. Seleção, desenvolvimento, alocação e retenção são finalidades permitidas. Punição, remuneração, precificação e exposição a terceiros são bloqueadas.

Um pré-filtro determinístico identifica pedidos que tocam esse tipo de dado, e um classificador avalia a intenção. Casos ambíguos vão para aprovação humana. Essa camada apoia boas práticas da Lei 13.709/2018 (LGPD), como a limitação de finalidade, mas não substitui a avaliação jurídica da sua empresa.

A alteração de uma política também passa pela mesma checagem de papel: um membro comum nem consegue ler os termos bloqueados e as instruções, porque a consulta é recusada no servidor. Pedidos sem relação com dado comportamental, como consultas operacionais, passam direto, sem custo extra de classificação.

Como a PowerVizion aborda a auditoria

Cada disparo vira um evento: quem, qual agente, qual regra e qual ação. A própria alteração da política também é auditada, com um resumo do que mudou. A leitura do histórico é restrita a owner e admin.

O evento guarda um trecho da mensagem para facilitar a revisão de falsos positivos. Esse trecho é limitado a 200 caracteres, e o acesso restrito evita que dados de pessoas fiquem à vista de todo o time.

Os eventos ficam ordenados do mais recente para o mais antigo, com um teto de 200 registros por consulta. A auditoria inclui também a moderação de saída, com a categoria e um trecho de até 160 caracteres da resposta retida.

Exemplo ilustrativo: um termo bloqueado

Um workspace bloqueia o termo "folha de pagamento" em um agente voltado ao atendimento. Um usuário pergunta algo que contém o termo, a mensagem é barrada antes do modelo, e o administrador vê o evento na auditoria, com a regra e o trecho.

Se o bloqueio foi um falso positivo, ele ajusta a lista de termos. A mudança também fica registrada, com o autor e o horário. É um exemplo ilustrativo do funcionamento, não um caso real.

Os dois tipos de evento, termo e limite, usam o mesmo formato, o que facilita filtrar a auditoria por regra.

Limites atuais

A correspondência de termos é por trecho de texto, sem diferenciar maiúsculas de minúsculas. Termos curtos podem gerar falsos positivos, e variações de escrita não são reconhecidas como o mesmo termo.

Se o banco de política ou o classificador de saída estiver indisponível, o sistema segue em modo permissivo e registra o erro no servidor, para não derrubar o chat. A moderação de saída depende de um classificador, que também pode errar. Guardrails reduzem risco; não o eliminam.

Outro limite: a política vale para os agentes que passam pelo ponto de entrada de conversa do servidor. Por isso a revisão periódica da auditoria continua sendo parte do processo, e não algo que o sistema faça sozinho. Por isso, o processo recomendado combina política, auditoria e revisão humana.

Perguntas frequentes

O que são guardrails de IA?

São regras que limitam o que um agente pode receber, fazer e responder. Na PowerVizion incluem termos bloqueados, limite diário, instruções do admin, ferramentas desligadas e moderação de resposta.

Quem pode alterar os guardrails?

Somente owner e admin do workspace. A verificação é feita no servidor, e cada mudança de política fica registrada na auditoria.

O modelo vê a mensagem bloqueada?

Não. Termos bloqueados e limite diário são aplicados antes da chamada ao modelo, e a resposta de bloqueio é gerada pelo servidor.

Os guardrails garantem conformidade com a LGPD?

Não garantem. Eles apoiam boas práticas, como a limitação de finalidade nos dados do MAP, mas a conformidade depende também dos processos da sua empresa.

#GuardrailsDeIA #GovernancaDeIA #SegurancaDeIA #AuditoriaDeIA #EngenhariaDeIA

Guardrails e custos · Segurança na PowerVizion · IA para TI

Quer configurar guardrails no seu workspace? Comece o teste grátis de 7 dias, sem cartão de crédito, ou fale com contato@powervizion.com. contato@powervizion.com