De 6 ramverk som varje företagsköpare av röst-AI måste fråga om
De flesta leverantörers säkerhetssidor skryter om en enda stämpel — oftast SOC 2 — och nöjer sig med det. Inköpsteam som gör riktiga granskningar behöver sex kontroller klarlagda redan dag ett:
- HIPAA — covered entities och business associates som hanterar PHI under samtal.
- SOC 2 Type II — rapporten om operativ ändamålsenlighet (inte Type I, inte den självintygade PDF:en).
- PCI DSS v4.0.1 — överallt där någon som ringer säger eller knappar in ett kortnummer via DTMF.
- GDPR + UK GDPR — de som ringer från EU och Storbritannien, underbiträden inom EU, DPA enligt Article 28.
- Dataresidens — den fysiska lagringsregionen för transkript, inspelningar och embeddingar.
- Röstspecifika risker — röstavtryck, lagringstid för inspelningar, läckage av träningsdata.
Om leverantören inte kan besvara alla sex under ett enda samtal är det svaret. Hoppa över demon och gå vidare.
HIPAA: BAA, PHI i transkript och opt-out från modellträning
Rösttranskript blir PHI i samma stund som den som ringer säger sitt namn tillsammans med ett tillstånd, ett läkemedel eller en bokad tid. Behandla transkriptlagret, embeddinglagret och analysdatalagret som PHI-system, allihop.
Lägstanivån enligt HIPAA för en röst-AI-leverantör:
- Undertecknat BAA med namngivna underbiträden (LLM-leverantör, ASR-leverantör, TTS-leverantör, teleoperatör, observabilitetsleverantör). Ett BAA som utesluter LLM:en är inget BAA.
- Kryptering under överföring (TLS 1.2+, SRTP för media) och i vila (AES-256).
- Revisionsloggar över varje PHI-åtkomst i 6 år.
- Läge med noll datalagring (ZDR) på LLM-anropet. OpenAI ZDR, Anthropic ZDR och Google Vertex utan loggning går alla att konfigurera — bekräfta vilket som faktiskt är inkopplat för er tenant, inte marknadsföringens standardläge.
- Skriftlig opt-out från modellträning. Leverantören måste avtalsmässigt förbinda sig att ert samtalsljud, era transkript och nyttolaster från verktygsanrop aldrig används för att träna någon modell, varken deras egen eller ett underbiträdes.
Exempel på BAA-klausul att klistra in i upphandlingsunderlaget:
"Leverantören ska inte, och ska säkerställa att ingen Underleverantör, använda skyddad hälsoinformation som överförs via Röst-AI-tjänsten för att träna, finjustera eller utvärdera någon maskininlärningsmodell, inklusive men inte begränsat till stora språkmodeller, modeller för automatisk taligenkänning och text-till-tal-modeller. Leverantören ska konfigurera samtliga tredjepartsleverantörer av modeller i ett läge med noll datalagring eller utan loggning för Kundens tenant och ska på begäran tillhandahålla ett skriftligt intyg om denna konfiguration."
Om leverantören ryggar för den klausulen ligger era PHI i någons träningskorpus.
SOC 2 Type II: vad ni ska kontrollera bortom stämpeln
SOC 2-stämpeln i sidfoten betyder ingenting. Kräv själva rapporten under NDA och läs de delar leverantörerna hoppas att ni hoppar över.
Checklista för rapporten:
- Type II, inte Type I. Type I är en granskning av utformningen vid en tidpunkt. Type II täcker 6–12 månaders operativ ändamålsenlighet. Allt mindre är teater.
- Vilka Trust Service Criteria som omfattas. Security är obligatoriskt. Availability, Confidentiality och Processing Integrity bör alla ingå i omfattningen för en röst-AI-plattform som hanterar riktiga kundsamtal.
- Revisor. En riktig Big-4-byrå eller en erkänd revisionsbyrå. Inte en löpande-band-revisor för 5 000 dollar som utfärdar anmärkningsfria rapporter som en produktfunktion.
- Avsnittet om avvikelser. Hoppa över följebrevet. Gå till avvikelserna. Noll avvikelser i en riktig Type II betyder oftast att omfattningen ritades runt ingenting. En eller två väldokumenterade avvikelser med åtgärdsplan är normalt och sunt.
- Underleverantörsorganisationer. Leta efter AWS, GCP och Azure listade som carve-outs med egna SOC 2. Om LLM-leverantören eller teleoperatören är en underleverantörsorganisation bör även deras SOC 2 refereras.
- Beskrivning av omfattningen. Bekräfta att den röst-AI-produkt ni köper är namngiven i omfattningen. Ibland omfattar leverantörer bara marknadsföringssajten eller instrumentpanelen, inte inferensvägen.
PCI DSS: hur röst-AI förändrar (eller utvidgar) er omfattning vid betalsamtal
Det är här de flesta röst-AI-införanden tyst spränger köparens PCI-omfattning. I samma sekund som någon säger 16 siffror ligger hela kedjan — teleoperatör, ASR, LLM:ens kontextfönster, transkriptlager, observabilitetsleverantör — inuti Cardholder Data Environment.
Två arkitekturer, två mycket olika revisioner:
| Mönster | Vad som händer med kortnumret | Er PCI-omfattning |
|---|---|---|
| Naiv röst-AI | ASR transkriberar "4111 1111 1111 1111" in i LLM-kontexten och era loggar | Hela CDE: ASR, LLM, transkriptdatabas, loggpipeline, BI-datalager |
| DTMF-undertryckning / paus-och-återuppta | Den som ringer lämnas över till en knappsats i en PCI DSS Level 1-IVR, agent och ASR tystas, bara en token kommer tillbaka | Leverantörens PCI-omfattning, inte er |
Mönstret paus-och-återuppta med DTMF-maskering (ibland kallat "agent assist-undertryckning") krymper er omfattning från "granska universum" till "granska integrationen".
Frågor från köparen:
- Sker DTMF-maskeringen på SBC-nivå eller på applikationsnivå? På SBC-nivå kommer tonerna aldrig in i mediaströmmen alls.
- Får ASR tystat ljud under inmatningsfönstret, eller maskeras bara transkriptet i efterhand? Maskering i efterhand är inte PCI-förenlig — datan har redan passerat systemet.
- Har leverantören ett giltigt AOC enligt PCI DSS v4.0.1 för betalningsinsamlingskomponenten? Be om AOC:et, inte ett pressmeddelande.
- Lagras samtalsinspelningar av betalningsavsnittet, om än krypterade? PCI kräver att de inte sparas alls om de innehåller SAD efter auktorisation.
GDPR + EU-residens: datalokalisering, underbiträden och varningssignaler i DPA:t
Om någon ringer från EU eller Storbritannien gäller GDPR oavsett var ert huvudkontor ligger. Röst-AI-leverantören är personuppgiftsbiträde (Article 28); ert företag är personuppgiftsansvarig.
DPA:t måste ange:
- Namngivna underbiträden med platser. "AWS" räcker inte — "AWS eu-central-1" gör det.
- Standard Contractual Clauses (2021 års moduler) om något underbiträde finns i USA, plus en Transfer Impact Assessment.
- Skriftlig garanti om dataresidens. "EU så långt det går" är ingen residens. Leta efter en regionslåsning på tenant-nivå: ljud, transkript, embeddingar och vektorindex stannar alla i eu-west-1 / eu-central-1 / eu-north-1.
- SLA för radering. Radering enligt Article 17 i GDPR inom 30 dagar, spridd till säkerhetskopior inom det dokumenterade rotationsfönstret för säkerhetskopior.
- Avisering om byte av underbiträde med en verklig rätt att invända — minst 30 dagar, inte "vi uppdaterar sidan".
Varningssignaler i leverantörers DPA:
- "Aggregerade och anonymiserade data kan användas för att förbättra våra tjänster." Röstdata går sällan att verkligt anonymisera — röstavtryck är biometriska identifierare enligt Article 9 i GDPR. Stryk den klausulen.
- Datacenter enbart i USA med ett "vi följer GDPR" men utan SCC och utan TIA.
- Listan över underbiträden gömd bakom inloggning eller NDA. Article 28 kräver att den är tillgänglig för er.
Röstspecifika risker: lagring av inspelningar, biometriska röstavtryck och läckage av träningsdata
Ramverken ovan skrevs för SaaS och betalningar. Röst-AI lägger till tre felmoder som inget av dem täcker fullt ut:
1. Lagring av inspelningar. Standardlagringstiden på de flesta plattformar är 30–90 dagar, ibland obegränsad. Driv igenom en lagringstid som kan konfigureras per tenant ned till 0 dagar (bara transkript, inget ljud) och bekräfta att det är hård radering, inte flaggor för mjuk borttagning.
2. Biometriska röstavtryck. Vissa plattformar beräknar talarembeddingar (en 192-dimensionell vektor som unikt identifierar en röst) för diarisering eller bedrägeridetektering. Enligt Article 9 i GDPR, BIPA (Illinois) och Texas CUBI är den vektorn biometriska data med samtyckeskrav som går längre än för vanlig PII. Fråga: genereras röstavtryck, var lagras de, går de att stänga av per tenant?
3. Läckage av träningsdata. Även med en opt-out från modellträning använder leverantörer ibland maskerade transkript för att utvärdera modellprestanda eller bygga utvärderingsmängder. "Utvärdering" kan bli ett kryphål. Se till att klausulen täcker all efterföljande modellanvändning, inklusive utvärderingar och datamängder för promptoptimering.
Det nedladdningsbara upphandlingsformuläret (15 frågor)
Klistra in de här i ert leverantörsformulär. Ja/nej-svar tvingar leverantören att binda sig på papper.
- Skriver ni under ett BAA enligt HIPAA som täcker alla underbiträden, inklusive LLM-, ASR- och TTS-leverantörerna?
- Kör ni LLM:en i ett läge med noll datalagring / utan loggning för vår tenant som standard?
- Förbinder ni er avtalsmässigt att vårt ljud, våra transkript och nyttolaster från verktygsanrop aldrig används för modellträning, finjustering eller utvärdering?
- Tillhandahåll er senaste SOC 2 Type II-rapport under NDA. Vilka Trust Service Criteria ingår i omfattningen?
- Är röst-AI:ns inferensväg uttryckligen namngiven i beskrivningen av SOC 2-omfattningen?
- Räkna upp alla avvikelser i den senaste SOC 2 Type II och åtgärdsstatus för var och en.
- Tillhandahåll ert nuvarande AOC enligt PCI DSS v4.0.1. Vilken komponent är certifierad?
- Hur fångas betalkortsdata in — DTMF-undertryckning på SBC-nivå, maskering på applikationsnivå eller maskering i efterhand?
- Sparas samtalsinspelningar av betalningsavsnitt i någon form? I så fall var och hur länge?
- Tillhandahåll en lista över underbiträden med fysisk datacenterregion för vart och ett.
- Går ljud, transkript, embeddingar och vektorindex att låsa till en EU-region på tenant-nivå?
- Vilket SLA för radering enligt Article 17 i GDPR har ni, inklusive spridning till säkerhetskopior?
- Genererar ni talarembeddingar eller röstavtryck? Går de att stänga av per tenant?
- Vilken är den kortaste konfigurerbara lagringstiden för samtalsinspelningar? Går den att sätta till noll?
- Tillhandahåll en sammanfattning av ett färskt penetrationstest utfört av tredje part (inom de senaste 12 månaderna) som täcker röstinferensvägen.
Om en leverantör inte kan besvara alla 15 skriftligen inom en vecka har de inte gjort jobbet ännu — och ni betalar för att vara deras forsknings- och utvecklingsprojekt inom regelefterlevnad.
Vanliga frågor
Räcker HIPAA för ett röst-AI-införande inom vården? Nej. HIPAA är nödvändigt men inte tillräckligt. Ni behöver även SOC 2 Type II för plattformskontrollerna, ett aktuellt penetrationstest för inferensvägen och delstatlig biometritäckning (BIPA, CUBI, Washington My Health My Data) om ni genererar röstavtryck.
Innebär en SOC 2 Type II-rapport att leverantören följer GDPR? Nej. SOC 2 täcker den operativa ändamålsenligheten i interna kontroller. GDPR är ett rättsligt regelverk som kräver ett DPA, namngivna underbiträden, SCC för överföringar och rättigheter för registrerade. En leverantör behöver bådadera, och de två rapporterna täcker olika ytor.
Kan en röst-AI-leverantör minska min PCI-omfattning till noll? Nästan, men inte exakt noll. En leverantör med DTMF-undertryckning på SBC-nivå och ett Level 1 PCI AOC för betalningsinsamlingskomponenten för er ned till SAQ A- eller SAQ A-EP-territorium i de flesta införanden av korttagning per telefon. Ni äger fortfarande integrationen och beslutet om samtalsdirigering.
Vad är läget med noll datalagring (ZDR) och varför spelar det roll? ZDR är en konfiguration på tenant-nivå hos LLM-leverantören som stänger av loggning av prompter och svar. Utan den ligger era samtalstranskript i LLM-leverantörens loggar i minst 30 dagar, vilket bryter både BAA- och DPA-åtagandena längre ned i kedjan.
FAQ JSON-LD: render this section as Question + Answer schema.org entities for the FAQPage type so the SERP gets the rich result. Standard Next.js MDX FAQ component on the blog already handles this — wrap the section in <FAQ> and the layout emits the JSON-LD.
Granskar ni en röst-AI-leverantör och är trötta på säkerhetssidor skrivna av marknadsavdelningen? Finn levereras med ett undertecknat BAA, SOC 2 Type II med inferensvägen i omfattningen, DTMF-undertryckning på SBC-nivå för PCI och EU-residens på tenant-nivå från dag ett. Skicka oss formuläret med de 15 frågorna ovan — vi svarar inom 48 timmar, skriftligen och med underlagen. Boka en säkerhetsgranskning i upphandlingsklass →
Granskare: Mänsklig styrgrupp / innehållsansvarig på AGNB. Publicera inte innan granskning — publiceringssteget är manuellt just nu.




