A AWS detalha um detector configurável de informações pessoais identificáveis (PII) que roda em qualquer modelo de linguagem grande gerenciado no Amazon Bedrock. A ideia é colocar as regras no prompt, em vez de codificar os tipos de entidade no modelo, o que permite trocar ou adicionar categorias sem retreinamento.

No post, a empresa diz que a abordagem foi avaliada em cinco bases públicas de PII, reunindo 49.365 registros e 222.114 anotações de referência em oito idiomas: alemão, inglês, espanhol, francês, hindi, italiano, holandês e telugo. A comparação usa uma correspondência exata de span, com precisão, recall e F1.
No recorte principal, que considera doze categorias comuns entre as bases e os detectores, o F1 span-level vai de 74,9% no Nova Lite 2 a 83,1% no Mistral Large 3. O OpenAI PrivacyFilter aparece com 80,7%. A AWS também cita que a latência varia mais com o modelo escolhido do que com o tamanho em parâmetros: o OSS-GPT 20B levou cerca de 1,2 segundo em Amazon EC2, enquanto o Qwen3.6-27B ficou em cerca de 12,8 segundos.
O código foi publicado como o pacote pii-detector, no repositório sample-llm-pii-detection. O texto também mostra como executar o exemplo com Amazon Bedrock e observa que a mesma configuração pode apontar para modelos diferentes com uma simples troca do identificador do modelo.