Os 6 frameworks sobre os quais todo comprador corporativo de IA de voz precisa perguntar
A maioria das páginas de segurança dos fornecedores se gaba de um único selo — normalmente SOC 2 — e para por aí. Times de compras que fazem análises de verdade precisam de seis controles esclarecidos logo no primeiro dia:
- HIPAA — entidades cobertas e parceiros de negócio que lidam com PHI durante as chamadas.
- SOC 2 Type II — o relatório de eficácia operacional (não o Type I, nem o PDF autodeclarado).
- PCI DSS v4.0.1 — em qualquer ponto em que o cliente fale ou digite por DTMF um número de cartão.
- GDPR + UK GDPR — pessoas que ligam da UE e do Reino Unido, suboperadores na UE, DPAs do Article 28.
- Residência de dados — região de armazenamento físico de transcrições, gravações e embeddings.
- Riscos específicos de voz — impressões vocais, retenção de gravações, vazamento de dados de treinamento.
Se o fornecedor não consegue responder aos seis pontos em uma única chamada, essa já é a resposta. Pule a demo e siga em frente.
HIPAA: BAAs, PHI nas transcrições e opt-out de treinamento de modelos
Uma transcrição de voz vira PHI no instante em que a pessoa diz o próprio nome junto de uma condição, um medicamento ou uma consulta. Trate o repositório de transcrições, o repositório de embeddings e o data warehouse de analytics todos como sistemas com PHI.
Exigência mínima de HIPAA para um fornecedor de IA de voz:
- BAA assinado com suboperadores nomeados (provedor de LLM, provedor de ASR, provedor de TTS, operadora de telefonia, fornecedor de observabilidade). Um BAA que exclui o LLM não é um BAA.
- Criptografia em trânsito (TLS 1.2+, SRTP para mídia) e em repouso (AES-256).
- Logs de auditoria de todo acesso a PHI por 6 anos.
- Modo de retenção zero de dados (ZDR) na chamada ao LLM. OpenAI ZDR, Anthropic ZDR e o modo sem registro do Google Vertex são todos configuráveis — confirme qual deles está ligado para o seu tenant, e não o padrão do marketing.
- Opt-out de treinamento de modelos por escrito. O fornecedor precisa se comprometer contratualmente a que o áudio das suas chamadas, as transcrições e os payloads de chamadas de ferramenta nunca sejam usados para treinar modelo nenhum, dele ou de um suboperador.
Exemplo de cláusula de BAA para colar no RFP:
"O Fornecedor não utilizará, e assegurará que nenhum Subcontratado utilize, Informações de Saúde Protegidas transmitidas por meio do Serviço de IA de Voz para treinar, ajustar ou avaliar qualquer modelo de aprendizado de máquina, incluindo, entre outros, grandes modelos de linguagem, modelos de reconhecimento automático de fala e modelos de texto para fala. O Fornecedor configurará todos os provedores de modelos de terceiros em modo de retenção zero de dados ou sem registro para o tenant do Cliente e fornecerá atestado escrito dessa configuração mediante solicitação."
Se o fornecedor resistir a essa cláusula, é porque está guardando seu PHI no corpus de treinamento de alguém.
SOC 2 Type II: o que verificar além do selo
O selo de SOC 2 no rodapé não significa nada. Exija o relatório em si sob NDA e leia justamente as partes que os fornecedores torcem para você pular.
Checklist do relatório:
- Type II, não Type I. O Type I é uma avaliação de desenho em um ponto no tempo. O Type II cobre de 6 a 12 meses de eficácia operacional. Qualquer coisa menos que isso é teatro.
- Trust Service Criteria cobertos. Security é obrigatório. Availability, Confidentiality e Processing Integrity deveriam todos estar no escopo de uma plataforma de IA de voz que atende chamadas reais de clientes.
- Auditor. Uma Big-4 de verdade ou uma firma de contabilidade reconhecida. Não um auditor de linha de montagem de US$ 5 mil que emite relatórios limpos como se fosse um recurso do produto.
- Seção de exceções. Pule a carta de apresentação. Vá direto às exceções. Zero exceções em um Type II de verdade normalmente significa que o escopo foi desenhado em volta de nada. Uma ou duas exceções bem documentadas, com plano de correção, é o normal e o saudável.
- Organizações de subserviço. Procure AWS, GCP e Azure listadas como carve-outs com seus próprios SOC 2. Se o provedor de LLM ou a operadora de telefonia for uma organização de subserviço, o SOC 2 dela também deve estar referenciado.
- Descrição do escopo. Confirme que o produto de IA de voz que você está comprando aparece nomeado no escopo. Às vezes os fornecedores colocam no escopo só o site institucional ou o painel, não o caminho de inferência.
PCI DSS: como a IA de voz muda (ou amplia) o seu escopo em chamadas de pagamento
É aqui que a maioria das implantações de IA de voz explode silenciosamente o escopo de PCI do comprador. No instante em que alguém fala 16 dígitos, todo o caminho — operadora de telefonia, ASR, janela de contexto do LLM, repositório de transcrições, fornecedor de observabilidade — passa a estar dentro do Ambiente de Dados do Portador do Cartão.
Duas arquiteturas, duas auditorias muito diferentes:
| Padrão | O que acontece com o número do cartão | Seu escopo de PCI |
|---|---|---|
| IA de voz ingênua | O ASR transcreve "4111 1111 1111 1111" no contexto do LLM e nos seus logs | CDE completo: ASR, LLM, banco de transcrições, pipeline de logs, data warehouse de BI |
| Supressão de DTMF / pausar e retomar | Quem liga é passado para um teclado IVR PCI DSS Level 1, agente e ASR ficam mudos e só volta um token | O escopo de PCI do fornecedor, não o seu |
O padrão de pausar e retomar com mascaramento de DTMF (às vezes chamado de "supressão de assistência ao agente") reduz o seu escopo de "auditar o universo" para "auditar a integração".
Perguntas do comprador:
- O mascaramento de DTMF é no nível do SBC ou no nível da aplicação? No nível do SBC os tons nem chegam a entrar no fluxo de mídia.
- O ASR recebe áudio mudo durante a janela de captura, ou apenas tem a transcrição censurada depois do fato? Censura posterior não é conforme a PCI — o dado já passou pelo sistema.
- O fornecedor possui um AOC vigente de PCI DSS v4.0.1 para o componente de captura de pagamento? Peça o AOC, não um comunicado à imprensa.
- As gravações do trecho de pagamento são armazenadas, mesmo criptografadas? PCI exige que não sejam retidas de forma alguma se contiverem SAD após a autorização.
GDPR + residência na UE: localização dos dados, suboperadores e sinais de alerta no DPA
Se alguém ligar da UE ou do Reino Unido, GDPR se aplica independentemente de onde fica a sua sede. O fornecedor de IA de voz é operador (Article 28); a sua empresa é o controlador.
O DPA precisa especificar:
- Suboperadores nomeados com localização. "AWS" não basta — "AWS eu-central-1" basta.
- Standard Contractual Clauses (módulos de 2021) se algum suboperador estiver nos EUA, mais um Transfer Impact Assessment.
- Garantia de residência de dados por escrito. "UE na medida do possível" não é residência. Procure uma fixação de região no nível do tenant: áudio, transcrições, embeddings e índices vetoriais permanecem todos em eu-west-1 / eu-central-1 / eu-north-1.
- SLA de exclusão. Exclusão sob o Article 17 do GDPR em até 30 dias, propagada aos backups dentro da janela documentada de rotação de backups.
- Notificação de troca de suboperador com direito real de objeção — 30 dias no mínimo, e não um "vamos atualizar a página".
Sinais de alerta nos DPAs dos fornecedores:
- "Dados agregados e anonimizados podem ser usados para melhorar nossos serviços." Dados de voz raramente são de fato anonimizáveis — impressões vocais são identificadores biométricos sob o Article 9 do GDPR. Risque essa cláusula.
- Data center apenas nos EUA com um "cumprimos GDPR", mas sem SCCs e sem TIA.
- Lista de suboperadores escondida atrás de login ou de NDA. O Article 28 exige que ela esteja disponível para você.
Riscos específicos de voz: retenção de gravações, impressões vocais biométricas e vazamento de dados de treinamento
Os frameworks acima foram escritos para SaaS e pagamentos. A IA de voz acrescenta três modos de falha que nenhum deles cobre por completo:
1. Retenção de gravações. A retenção padrão na maioria das plataformas é de 30 a 90 dias, às vezes indefinida. Insista em uma retenção configurável por tenant até 0 dia (só transcrição, sem áudio) e confirme que é exclusão definitiva, não flags de exclusão lógica.
2. Impressões vocais biométricas. Algumas plataformas calculam embeddings de locutor (um vetor de 192 dimensões que identifica uma voz de forma única) para diarização ou detecção de fraude. Sob o Article 9 do GDPR, a BIPA (Illinois) e a Texas CUBI, esse vetor é dado biométrico com exigências de consentimento que vão além das aplicáveis a PII comum. Pergunte: impressões vocais são geradas, onde ficam armazenadas, podem ser desativadas por tenant?
3. Vazamento de dados de treinamento. Mesmo com opt-out de treinamento de modelos, às vezes os fornecedores usam transcrições censuradas para avaliar o desempenho do modelo ou montar conjuntos de avaliação. "Avaliação" pode virar brecha. Faça a cláusula cobrir qualquer uso posterior em modelos, inclusive avaliações e conjuntos de dados de otimização de prompt.
O questionário de RFP para baixar (15 perguntas)
Cole estas perguntas no seu questionário de fornecedores. Respostas de sim ou não obrigam o fornecedor a se comprometer no papel.
- Vocês assinam um BAA de HIPAA cobrindo todos os suboperadores, incluindo os provedores de LLM, ASR e TTS?
- Vocês operam o LLM em modo de retenção zero de dados / sem registro para o nosso tenant por padrão?
- Vocês se comprometem contratualmente a que nosso áudio, nossas transcrições e os payloads de chamadas de ferramenta nunca sejam usados para treinamento, ajuste fino ou avaliação de modelos?
- Forneçam o relatório SOC 2 Type II mais recente sob NDA. Quais Trust Service Criteria estão no escopo?
- O caminho de inferência da IA de voz está explicitamente nomeado na descrição de escopo do SOC 2?
- Listem todas as exceções do SOC 2 Type II mais recente e o status de correção de cada uma.
- Forneçam o AOC vigente de PCI DSS v4.0.1. Qual componente está certificado?
- Como os dados de cartão de pagamento são capturados — supressão de DTMF no nível do SBC, mascaramento no nível da aplicação ou censura posterior?
- Gravações de chamadas dos trechos de pagamento são retidas de alguma forma? Se sim, onde e por quanto tempo?
- Forneçam uma lista de suboperadores com as regiões físicas de data center de cada um.
- Áudio, transcrições, embeddings e índices vetoriais podem ser fixados em uma região da UE no nível do tenant?
- Qual é o SLA de exclusão de vocês sob o Article 17 do GDPR, incluindo a propagação para backups?
- Vocês geram embeddings de locutor / impressões vocais? Podem ser desativados por tenant?
- Qual é o período mínimo configurável de retenção de gravações de chamada? Pode ser zerado?
- Forneçam o resumo de um teste de intrusão recente feito por terceiros (dos últimos 12 meses) cobrindo o caminho de inferência de voz.
Se um fornecedor não consegue responder às 15 por escrito em uma semana, é porque ainda não fez o dever de casa — e você está pagando para ser o projeto de P&D de conformidade dele.
Perguntas frequentes
HIPAA é suficiente para uma implantação de IA de voz na área da saúde? Não. HIPAA é necessário, mas não suficiente. Você também precisa de SOC 2 Type II para os controles da plataforma, de um teste de intrusão atual para o caminho de inferência e de cobertura biométrica estadual (BIPA, CUBI, Washington My Health My Data) se gerar impressões vocais.
Um relatório SOC 2 Type II significa que o fornecedor está em conformidade com GDPR? Não. O SOC 2 cobre a eficácia operacional dos controles internos. GDPR é um regime jurídico que exige um DPA, suboperadores nomeados, SCCs para transferências e direitos dos titulares de dados. Um fornecedor precisa dos dois, e os dois relatórios cobrem superfícies diferentes.
Um fornecedor de IA de voz pode reduzir meu escopo de PCI a zero? Quase, mas não exatamente a zero. Um fornecedor com supressão de DTMF no nível do SBC e um AOC de PCI Level 1 para o componente de captura de pagamento coloca você no território do SAQ A ou do SAQ A-EP na maioria das implantações de pagamento por telefone. A integração e a decisão de roteamento de chamadas continuam sendo suas.
O que é o modo de retenção zero de dados (ZDR) e por que ele importa? ZDR é uma configuração no nível do tenant no provedor do LLM que desliga o registro de prompts e respostas. Sem ele, as transcrições das suas chamadas ficam nos logs do provedor de LLM por no mínimo 30 dias, o que quebra tanto os compromissos do BAA quanto os do DPA lá na frente.
FAQ JSON-LD: render this section as Question + Answer schema.org entities for the FAQPage type so the SERP gets the rich result. Standard Next.js MDX FAQ component on the blog already handles this — wrap the section in <FAQ> and the layout emits the JSON-LD.
Avaliando um fornecedor de IA de voz e cansado de páginas de segurança feitas pelo marketing? O Finn vem com BAA assinado, SOC 2 Type II com o caminho de inferência no escopo, supressão de DTMF no nível do SBC para PCI e residência na UE no nível do tenant desde o primeiro dia. Mande para nós o questionário de 15 perguntas acima — respondemos em 48 horas, por escrito e com os comprovantes. Agende uma revisão de segurança no padrão de compras →
Revisor: Conselho humano / responsável de conteúdo da AGNB. Não publicar antes da revisão — a etapa de publicação hoje é manual.
Relacionado: Segurança em IA de voz: o modelo de ameaças da camada de áudio




