A IA generativa é muito boa em produzir um estado plausível.

Isso não é o mesmo que um estado que tenha autoridade.

Um modelo pode extrair um prazo de um documento, classificar uma transação, resumir uma política, inferir uma categoria ou propor um registro estruturado. Essas capacidades são úteis. Mas, no momento em que a saída gerada é gravada diretamente nos dados oficiais da aplicação, surge outra pergunta:

O que deu a essa saída o direito de se tornar verdadeira dentro do sistema?

Essa não é, principalmente, uma pergunta sobre alucinações. É uma pergunta sobre autoridade, evidência, procedência e estado do sistema.

Geração e autoridade são operações diferentes

Um sistema determinístico tradicional frequentemente tem fontes explícitas de autoridade.

Um cliente envia um formulário. Uma rede de pagamentos retorna um resultado de liquidação. Uma transação de banco de dados é confirmada. Um documento assinado estabelece uma obrigação. Um motor de regras avalia uma política conhecida.

Modelos generativos operam de outra forma. Produzem saídas com base em inferência probabilística sobre entradas e representações aprendidas.

A saída pode ser altamente precisa. Pode até ser mais útil do que a primeira interpretação de uma pessoa. Mas precisão, por si só, não define autoridade.

Um sistema precisa distinguir:

Evidência de origem
  ↓
Interpretação da IA
  ↓
Estado candidato
  ↓
Validação
  ↓
Decisão de política
  ↓
Estado canônico

O estado candidato é o ponto em que a IA se torna operacionalmente útil sem receber autoridade irrestrita.

Estado canônico é um conceito de produto

“Canônico” significa mais do que “armazenado no banco de dados”.

Estado canônico é a versão da informação que a aplicação trata como referência oficial para uma finalidade específica.

Uma plataforma de competições pode ingerir uma página pública e usar IA para extrair:

  • datas de inscrição;
  • anos escolares elegíveis;
  • categorias;
  • etapas;
  • taxas;
  • datas de resultados.

Os valores extraídos são candidatos úteis.

Mas e se o prazo de inscrição aparecer com datas diferentes em dois documentos? E se o modelo confundir a data de publicação com a data do evento? E se um PDF do ano anterior tiver maior relevância na busca do que a página atual? E se o organizador alterar uma data depois da extração?

O sistema precisa de um modelo sobre o que sabe e como sabe, mesmo que a interface nunca use essa expressão.

Precisa saber o que conhece, de onde veio esse conhecimento, qual foi a confiança do processo e quais evidências podem substituí-lo.

A procedência deve acompanhar os dados

Procedência é a conexão entre uma afirmação e as evidências das quais ela foi derivada.

Sem procedência, dados produzidos com auxílio de IA se tornam difíceis de inspecionar e corrigir.

Um campo extraído útil poderia incluir:

field: registration_deadline
candidate_value: 2027-03-15
source_id: official_rules_pdf_2027
source_location: page 4
extraction_method: model-x
model_version: 2026-09
confidence: 0.93
validation_status: pending

O esquema exato varia. O princípio permanece.

O sistema deve conseguir responder:

  • Qual fonte produziu este valor?
  • Qual modelo ou processo o interpretou?
  • O valor foi extraído diretamente ou inferido?
  • Ele foi validado?
  • Foi substituído posteriormente?
  • Quem ou o que o aprovou?
  • O sistema consegue reconstruir por que o valor canônico existe?

O perfil de IA generativa do NIST amplia o AI Risk Management Framework com orientações para riscos específicos de sistemas generativos. A lição mais ampla é que uma IA confiável é uma propriedade do sistema, não apenas do modelo. Avaliação, governança, contexto e controles ao redor do modelo importam.

Confiança não é permissão

Pontuações de confiança podem ser úteis, mas são fáceis de usar incorretamente.

Uma pontuação de 0,96 não significa que a saída deva se tornar canônica automaticamente. A confiança pode não estar calibrada. Pode descrever a probabilidade de tokens, e não a correção factual. Pode não considerar a qualidade da fonte. Pode não refletir se o modelo respondeu à pergunta certa.

A permissão para promover um candidato deve depender de uma política.

Para uma classificação de baixo risco, a política pode dizer:

confidence >= threshold
AND source_type == trusted
→ auto-accept

Para uma decisão de alto risco, a política pode exigir validação determinística ou aprovação humana, independentemente da confiança.

A escolha de projeto importante é separar a saída do modelo da política de promoção.

Isso permite trocar modelos sem alterar silenciosamente a definição de verdade adotada pela organização.

A qualidade da fonte importa mais do que a fluência

Um modelo pode extrair com confiança informações de uma fonte fraca.

Isso cria uma falha sutil: boa inferência sobre evidências ruins.

Considere um sistema que reúne obrigações regulatórias. Um modelo recupera um blog secundário que resume uma norma. A extração é perfeita. O resumo está desatualizado.

O modelo não alucinou. Mesmo assim, o sistema está errado.

É por isso que a procedência precisa de uma política de fontes.

Atributos úteis das fontes podem incluir:

  • fonte primária ou de terceiros;
  • conteúdo oficial ou comentário;
  • conteúdo atual ou arquivado;
  • jurisdição;
  • data de vigência;
  • data de publicação;
  • revisão;
  • nível de confiança;
  • escopo de acesso.

Sistemas de IA que controlam apenas o modelo e ignoram a camada de fontes têm controles incompletos.

Divergência é informação

Quando duas fontes com autoridade divergem, o sistema nem sempre deve forçar uma resolução imediata.

A divergência pode ser um estado significativo.

Um pipeline robusto pode representar:

Fonte A → Candidato X
Fonte B → Candidato Y
                 ↓
          Conflito detectado
                 ↓
       Revisão ou regra de política
                 ↓
          Valor canônico

Isso é mais honesto do que pedir a um modelo que escolha o valor mais plausível e descarte o conflito.

A divergência não resolvida pode importar operacionalmente. Pode indicar um erro de publicação, uma mudança de política, documentação desatualizada ou uma exceção real.

Preservar a divergência faz parte de preservar as evidências.

Revisão humana não é uma resposta universal

“Adicionar revisão humana” costuma ser a primeira resposta de governança à incerteza da IA.

A revisão humana pode ser apropriada, mas não é gratuita nem automaticamente confiável.

A revisão cria:

  • custo;
  • latência;
  • inconsistência;
  • fadiga de revisores;
  • limites de vazão;
  • novos requisitos de autorização.

A pergunta mais útil é quais decisões merecem quais controles.

Um modelo baseado em risco pode ser:

FluxoExemploControle apropriado
Baixo risco, reversívelAplicação de etiquetas a conteúdoValidação automatizada
Risco médioExtração estruturada para revisão internaLimiares e revisão por amostragem
Alto impactoClassificação financeira que altera o resultado para o clienteVerificações determinísticas e aprovação humana
Segurança ou regulaçãoAção com consequências jurídicas ou de segurançaPolítica sólida, evidências e revisão autorizada

O sistema deve dedicar atenção humana aos pontos em que a incerteza e as consequências justificam esse investimento.

Controles determinísticos continuam importantes

A IA generativa não substitui a validação convencional de software.

Se um campo precisa ser uma data futura, valide-o.

Se uma categoria precisa pertencer a um vocabulário permitido, imponha essa regra.

Se um total precisa ser igual à soma dos itens, calcule-o.

Se uma ação exige permissão, autorize-a fora do prompt.

Se uma transição de registro é proibida, faça valer a máquina de estados.

O modelo pode propor. A aplicação continua governando.

Essa distinção é especialmente importante porque prompts não são sistemas de controle de acesso. Um prompt que diz “não mostre informações confidenciais” não substitui uma busca que respeite permissões nem a aplicação efetiva dessas permissões.

Mudanças de modelo são mudanças de produção

Um time pode trocar um modelo de IA sem alterar o código da aplicação e, ainda assim, mudar substancialmente o comportamento do sistema.

Isso significa que a versão do modelo, a versão do prompt, a configuração de recuperação de informações e a política de validação fazem parte da gestão de mudanças em produção.

As perguntas incluem:

  • A precisão da extração mudou?
  • A distribuição das classificações mudou?
  • A latência ou o custo mudaram?
  • O comportamento em falhas mudou?
  • Um novo modelo passou a inferir valores ausentes com mais frequência?
  • As avaliações anteriores continuam representativas?

O versionamento permite responder a essas perguntas.

Sem ele, um time pode saber que “a IA piorou” sem conseguir reproduzir quando ou por quê.

A avaliação precisa refletir a semântica de produção

Benchmarks genéricos de modelos raramente respondem à pergunta do produto.

Um sistema de extração de documentos precisa de avaliação baseada em seus próprios campos, fontes e custos de erro.

Falsos positivos e falsos negativos podem ter impactos diferentes. Deixar de identificar um prazo de inscrição pode ser inconveniente. Inventar um prazo pode induzir usuários ativamente ao erro.

A avaliação deve, portanto, conectar o comportamento do modelo às consequências no fluxo.

Um conjunto útil de avaliação inclui:

  • documentos de origem representativos;
  • casos difíceis conhecidos;
  • fontes conflitantes;
  • campos ausentes;
  • versões históricas;
  • entradas maliciosas ou malformadas;
  • fronteiras de permissão;
  • comportamento esperado de abstenção.

O objetivo não é simplesmente “precisão”. É ter confiança de que o sistema se comporta de forma aceitável nos estados que importam.

A IA é um componente de um sistema maior de conhecimento

A arquitetura mais útil frequentemente trata o modelo como uma etapa, em vez de colocá-lo no centro do produto.

Fonte
  ↓
Aquisição
  ↓
Normalização
  ↓
Extração por IA
  ↓
Candidato
  ↓
Validação
  ↓
Revisão / Política
  ↓
Estado canônico
  ↓
Uso posterior

Essa estrutura cria pontos em que é possível observar, testar e melhorar o sistema.

Também permite que os componentes evoluam de maneira independente. Um novo modelo pode melhorar a extração sem mudar a política canônica. Uma nova fonte pode entrar no pipeline sem contornar a validação. Uma correção humana pode alimentar a avaliação sem reescrever o histórico.

É também por isso que Por que decisões de produto precisam de memória importa no trabalho assistido por IA. Contexto, evidências e procedência precisam sobreviver a uma única interação com o modelo.

A verdade canônica é uma decisão de governança

O erro prático não é usar IA generativa em fluxos que lidam com informações oficiais.

O erro é não projetar o caminho de promoção entre um candidato gerado e um estado com autoridade.

Um sistema sólido torna essa fronteira visível:

  • A saída da IA é uma proposta.
  • As evidências sustentam ou enfraquecem a proposta.
  • A validação verifica a estrutura e as invariantes.
  • A política decide quais controles se aplicam.
  • Pessoas intervêm quando as consequências e a incerteza justificam.
  • O estado canônico registra o resultado aceito e sua procedência.
  • O versionamento preserva como a decisão foi tomada.

O modelo é poderoso justamente porque consegue operar em espaços nos quais o software determinístico tem limitações: linguagem ambígua, documentos desorganizados, classificação e inferência.

Esse poder se torna mais seguro e útil quando o sistema não confunde plausibilidade com autoridade.

A saída da IA pode ser conhecimento valioso.

Ela deve conquistar o direito de se tornar verdade canônica.

Referências

  1. NIST. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. 2024. https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence
  2. NIST. Artificial Intelligence Risk Management Framework (AI RMF 1.0). 2023. https://www.nist.gov/itl/ai-risk-management-framework
← Todos os Insights