SecureProxySecureProxy

Compressão de contexto para agentes de IA

Reduza o custo dos seus agentes de IA.

Reduza tokens e custos com compressão que considera relevância, formato e repetição. O SecureProxy compacta resultados de ferramentas no histórico, mantendo instruções e mensagens recentes intactas.

Ver como a compressão funciona

Compressão e custos

Reduza tokens de entrada, reutilize respostas e controle o consumo.

Compressão nativa de contexto

Menos tokens reenviados. Menor custo de entrada.

Ao reutilizar o histórico, seu agente reenvia resultados de ferramentas ao modelo. O SecureProxy combina compactação por formato, redução de repetições e seleção por relevância para diminuir esse volume antes da próxima chamada.

A economia começa antes da chamada ao modelo.

Quando a entrada é cobrada por token, reduzir os tokens enviados reduz essa parcela do custo. O efeito no gasto total depende do conteúdo, do modelo e do fluxo do seu agente.

Como os resultados são reduzidos

As técnicas são combinadas conforme o conteúdo.

  • Relevância para a tarefa

    Em formatos compatíveis, usa termos do pedido e referências da ferramenta para priorizar trechos relacionados à tarefa.

  • Técnicas por formato

    Aplica tratamentos próprios para texto, JSON, logs, buscas, código, diffs, HTML e configurações.

  • Menos repetição

    Compacta conteúdo repetido, inclusive blocos que voltam em diferentes resultados de ferramentas.

O que permanece intacto

A compressão atua apenas em resultados de ferramentas fora da janela recente da conversa. Estes conteúdos ficam protegidos:

  • Instruções de sistema e do desenvolvedor
  • Mensagens do usuário e do assistente
  • Resultados de ferramentas na janela recente

Cache e controle de consumo

Reutilize respostas e defina limites.

O cache evita repetir chamadas elegíveis. Os orçamentos e limites de uso controlam quanto cada gateway pode consumir.

Cache de respostas

Reaproveite uma resposta já obtida.

Ative cache exato para requisições iguais ou semântico para requisições semelhantes, com validade configurável e isolamento por organização e gateway.

  • Ativação explícita por gateway e por requisição.
  • Configure a validade e a similaridade conforme o caso.
  • Em Responses, disponível apenas para chamadas sem estado.

Orçamentos e limites

Controle gasto e volume de chamadas.

Defina orçamentos diários e mensais em USD por gateway, além de limites de chamadas por segundo e tokens por minuto.

  • Bloqueio de novas chamadas quando o gasto registrado atinge o teto.
  • Alertas por percentual do orçamento consumido.
  • Visibilidade de custos por equipe, modelo e provedor.

Os orçamentos usam o gasto registrado em janelas diárias e mensais UTC. Chamadas simultâneas já admitidas podem ultrapassar ligeiramente o limite.

Proteção de dados

Defina o que pode chegar ao modelo e como tratar conteúdo sensível.

Aplique as regras de dados antes de chamar o modelo.

O SecureProxy pode substituir dados detectados por marcadores ou bloquear a chamada conforme a política. Nas respostas sem streaming, o mascaramento reversível permite restaurar esses marcadores para que a aplicação trabalhe com os dados originais.

Seu sistema envia

Cliente João, CPF 123.456.789-00

A IA recebe

Cliente {{nome_1}}, CPF {{cpf_1}}

Seu sistema recebe

Resposta com os marcadores restaurados

Mascaramento reversível em uma chamada sem streamingExemplo sem streaming: uma regra mascara ana@acme.com antes de enviar a chamada ao provedor. Se o marcador aparece na resposta, o SecureProxy restaura o e-mail para a aplicação.Exemplo sem streamingAplicaçãoNo seu domínioProvedor de IAModelo externoSecureProxyProteção antes e depoisOcultar dadosPreparar resposta(valor original restaurado)(provedor recebeu o marcador)Requisição → Respostaana@acme.com{{email_1}}Olá {{email_1}}Olá ana@acme.comana@acme.com{{email_1}}Olá {{email_1}}Olá ana@acme.com

O exemplo mostra uma resposta sem streaming. Em Chat Completions e Anthropic Messages com streaming, os dados são mascarados no envio, mas os marcadores não são restaurados na resposta.

Detectores de dados

Identifique CPF, CNPJ, email, telefone e cartão com detectores estruturados. Acrescente padrões próprios quando o seu conteúdo exigir.

Regras contextuais

Use regras em linguagem natural para avaliar contratos, patentes e informações que dependem do contexto da mensagem.

Ações por política

Escolha mascarar os dados detectados, bloquear a chamada ou registrar a ocorrência conforme o risco do seu caso.

Roteamento e APIs

Conecte provedores, autorize modelos e configure alternativas.

Provedores

  • OpenAI
  • Anthropic
  • Gemini
  • Azure OpenAI
  • OpenRouter
  • Mistral
  • xAI
  • Groq
  • DeepSeek
  • Ollama
  • APIs compatíveis com OpenAI

Ollama e endpoints internos ou personalizados estão disponíveis na instalação on-premises. A compatibilidade depende do protocolo e do modelo escolhido.

Protocolos e integração

Um gateway para aplicações e agentes.

Escolha a interface usada pela sua aplicação e confira os recursos compatíveis com o provedor e o modelo.

OpenAI Chat Completions

/v1/chat/completions

Conecte aplicações que usam o formato Chat Completions a diferentes provedores autorizados.

Recursos como ferramentas e streaming dependem do modelo e do provedor.

OpenAI Responses

/v1/responses

Use a interface Responses para integrações com modelos OpenAI.

Disponível apenas para OpenAI, sem fallback entre modelos. Cache opcional apenas em chamadas sem estado.

Anthropic Messages e Claude Code

/v1/messages

Conecte Claude Code e clientes que usam Messages a provedores de chat compatíveis.

A compatibilidade se refere a Messages; não inclui todas as APIs de recursos da Anthropic.

Três pontos de configuração

  1. Endereço: aponte o cliente para a URL do gateway.
  2. Chave: use a credencial de acesso emitida pelo SecureProxy.
  3. Modelo: informe provedor/modelo e confira a compatibilidade do protocolo.

Distribuição e alternativas definidas pela sua equipe.

Configure como as chamadas usam credenciais, repetem tentativas e seguem para modelos alternativos permitidos.

Roteamento entre provedores com tolerância a falhasUma chamada com uma lista explícita de modelos alternativos chega ao SecureProxy. Em uma falha elegível, ele tenta o próximo modelo autorizado da lista. O exemplo mostra OpenAI, Anthropic e Gemini; depois do primeiro trecho de uma resposta em streaming, não há troca de modelo.Roteamento e fallbackAplicaçãoChamada de IASecureProxyLista de alternativasGeminiPRÓXIMO NA LISTAOpenAIOpenAIPRINCIPAL · FALHOUAnthropicRespostaentregue à aplicaçãoAnthropicATIVO · FALLBACKRespostaentregue à aplicaçãoFallback usa alternativas explícitas da chamada, respeitando os modelos autorizados.

Defina provedores e modelos permitidos ou bloqueados por gateway. Essas regras também se aplicam aos modelos alternativos da chamada.

Chaves com pesos

Distribua chamadas entre várias chaves do mesmo provedor, com pesos configuráveis.

Novas tentativas

Configure tentativas adicionais para falhas elegíveis antes de recorrer a outra opção.

Fallback explícito

Defina quais modelos podem substituir o principal, inclusive de outros provedores compatíveis.

Em streaming, o fallback só pode ocorrer antes do primeiro trecho da resposta. A API Responses não oferece fallback entre modelos.

Equipes e acesso

Defina quem pode entrar, quais recursos pode usar e o que pode alterar.

Equipes e governança

Identidade corporativa e acesso por equipe.

Conecte a identidade da empresa por SSO com OIDC ou SAML, incluindo Microsoft Entra ID. Uma pessoa pode ter permissões diferentes em cada equipe, conforme os recursos que precisa consultar ou administrar.

Acesso por equipe

Exemplo ilustrativo de membros, permissões e recursos.

Acesso por equipe
PessoaEquipePermissãoRecurso autorizado
Ana CostaEngenhariaEdiçãoGateway engenharia-prod
Ana CostaPesquisaVisualizaçãoGateway pesquisa-dev
Bruno LimaAtendimentoVisualizaçãoGateway suporte-prod
Carla MeloJurídicoGestãoGateway juridico-prod

A permissão vale para a pessoa naquela equipe. A mesma pessoa pode editar em uma equipe e apenas consultar em outra.

Permissões por pessoa e equipe

Visualização

Consulte os recursos e informações disponíveis para a equipe.

Edição

Trabalhe nas configurações e recursos que a equipe pode editar.

Gestão

Edite recursos e gerencie permissões de membros existentes da equipe.

Credenciais e isolamento.

Controle o acesso dos sistemas com chaves de gateway e mantenha as credenciais dos provedores centralizadas. Cada organização tem seus próprios recursos.

Isolamento entre organizações

As organizações têm seus próprios recursos e registros, com isolamento reforçado no banco de dados. Dentro delas, as permissões determinam o acesso dos membros.

Rotação de chaves e expiração de acesso

Mantenha credenciais dos provedores fora do código da aplicação, faça a rotação de chaves e configure a expiração do acesso ao gateway. Expirar o acesso não apaga o histórico de auditoria.

Auditoria e integrações

Consulte o que aconteceu e envie os eventos para sua operação.

Eventos duráveis para auditoria e operação.

Um fluxo durável de eventos alimenta o histórico consultável e processa integrações e notificações de forma independente. Conteúdo, decisões, custo e latência ficam disponíveis para investigação; entregas podem ser repetidas em caso de nova tentativa.

Auditoria, integrações e alertas com processamento independenteUma chamada gera eventos duráveis. A auditoria grava o histórico consultável, integrações entregam webhooks assinados e notificações enviam alertas de custo ou DLP por e-mail. Cada fluxo tem processamento e tratamento de falhas próprios.Eventos com destinos independentesChamada de IAConteúdo e decisãoEventos duráveisRegistro e entrega assíncronaAuditoriaHistórico consultável no HubIntegraçõesWebhooks assinados por organizaçãoAlertas por e-mailCusto e políticas de dados

Um webhook indisponível não interrompe a gravação da auditoria. Integrações e notificações têm novas tentativas e filas de falhas próprias.

Webhooks assinados

Encaminhe eventos para seus sistemas com assinatura HMAC. O payload pode conter dados confidenciais de auditoria e deve ser tratado de acordo com sua política de acesso.

Alertas por email

Receba alertas de custo e DLP com informações operacionais e links para o Hub autenticado. O conteúdo de prompts e respostas não é incluído nesses emails.

OpenTelemetry e métricas

Integre a telemetria por meio de um Collector OpenTelemetry e acompanhe métricas operacionais com Prometheus.

Painel de auditoria

Decisões e custos à vista.

Consulte o histórico por período, equipe, modelo, política e status. Acompanhe consumo e latência e abra os registros para investigar decisões. Os dados abaixo ilustram a experiência do painel.

Painel de auditoria · exemplo ilustrativo

Cada chamada com sua equipe, modelo, política e custo

Chamadas

24.871

12%vs mês anterior

Custo total

USD 487,32

8%vs mês anterior

Bloqueios

142

18%vs mês anterior

Latência média

412 ms

4%vs mês anterior

Chamadas por dia

30d

  • Horário

    14:32:08

    Equipe

    Atendimento

    Modelo

    openai/gpt-4o-mini

    Política

    Padrão

    Status

    ENVIADO

    Custo (USD)

    0,004
  • Horário

    14:31:47

    Equipe

    Jurídico

    Modelo

    azure/deployment-aprovado

    Política

    Crítica

    Status

    MASCARADO

    Custo (USD)

    0,012
  • Horário

    14:31:22

    Equipe

    Engenharia

    Modelo

    anthropic/claude-sonnet-4-6

    Política

    Engenharia

    Status

    BLOQUEADO

    Custo (USD)

    0,000
  • Horário

    14:30:55

    Equipe

    Pesquisa

    Modelo

    gemini/gemini-2.5-pro

    Política

    Pesquisa

    Status

    ENVIADO

    Custo (USD)

    0,008
  • Horário

    14:30:31

    Equipe

    Atendimento

    Modelo

    anthropic/claude-haiku-4-5

    Política

    Padrão

    Status

    MASCARADO

    Custo (USD)

    0,002
  • Horário

    14:30:04

    Equipe

    Engenharia

    Modelo

    openai/gpt-4o

    Política

    Engenharia

    Status

    ENVIADO

    Custo (USD)

    0,015

Filtrável por equipe, política, status ou intervalo. Cada linha aponta para a chamada original no histórico auditável.

Implantação

Escolha onde o gateway, a administração e os registros ficam.

Escolha um ambiente dedicado operado por nós ou uma instalação na sua infraestrutura. O destino dos dados depende dos provedores e endpoints que você autoriza.

Modelos de implantação: gerenciado isolado e na sua infraestruturaNo modelo gerenciado, o SecureProxy roda em um tenant dedicado operado por nós. No modelo on-premise, gateway, auditoria e cofre ficam todos dentro do perímetro do cliente. Em ambos os casos, somente as chamadas autorizadas saem para os provedores externos.Gerenciado isoladoTenant dedicado · operado pela SecureProxyRECOMENDADOSua organizaçãoAplicações clienteTenant isolado · SecureProxyGatewayAuditoriaPolíticas e chavesOperadas pela SecureProxyAtualizações e backups gerenciadosProvedores externosNa sua infraestruturaTudo dentro do perímetro que você controlaSeu perímetroAplicações clienteGatewayAuditoriaVault · cofre de segredosHistórico e administração ficamno seu controleCompatível com Docker e ambientes restritosProvedores externos

Gerenciado isolado

Nós operamos. O ambiente é só seu.

Recomendado
  • ✓Ambiente dedicado para sua organização
  • ✓Sem recursos de execução compartilhados com outros clientes
  • ✓Configuração assistida de provedores, aplicações e políticas
  • ✓Acordo de tratamento de dados e documentação de segurança
  • ✓Atualizações, backups e operação gerenciados

Na sua infraestrutura

Dentro da rede que sua equipe controla.

  • ✓Implantação em Docker/Compose ou servidores próprios
  • ✓Ollama e endpoints internos ou personalizados disponíveis no on-premises
  • ✓Histórico de chamadas e administração dentro do seu perímetro
  • ✓Traefik e TLS automático no pacote para instalação local
  • ✓Integração com cofre de segredos como HashiCorp Vault ou OpenBao
  • ✓Administração e métricas separadas do tráfego de IA

FAQ

Antes de começar.

O que considerar para validar o SecureProxy no seu ambiente.

Depende do destino autorizado. Para provedores externos, as políticas analisam o conteúdo e podem mascarar ou bloquear dados detectados antes do envio. Ollama e endpoints internos ou personalizados estão disponíveis na instalação on-premises.

Nenhuma ferramenta garante conformidade sozinha. SecureProxy oferece controles técnicos para apoiar seu programa: políticas de dados, isolamento por organização, gestão de acesso e chaves, e histórico consultável para auditoria.

O impacto depende do volume de contexto e das regras ativadas. No piloto, medimos latência, tokens de entrada e custo com seu fluxo real, incluindo o efeito da compressão.

Escolhemos com sua equipe um fluxo real de IA e configuramos provedores, acesso, políticas e orçamento. O ambiente pode ser gerenciado ou on-premises. Medimos latência, consumo e o efeito de cache ou compressão com o tráfego do piloto.

Economia no seu fluxo

Traga o contexto do seu agente. Avalie a redução de tokens.

Avaliamos a compressão com resultados de ferramentas do seu caso e medimos o efeito nos tokens de entrada e no custo. O piloto começa com um fluxo real da sua aplicação.

Ler o FAQ