Direct naar de inhoud
Beveiligingsnieuws

Deepfake-detectie met audio AI: Modulate in 2026

deepfake-detectie met audio AI

Deepfake-detectie met audio AI krijgt een extra impuls. Het bedrijf Modulate haalde $25 miljoen aan nieuwe financiering op, met deelname van Future Ventures en onder meer Hyperplane en Lakestar. Daarmee komt de totale funding uit op $60 miljoen. De focus ligt op audio-native AI: systemen die niet alleen woorden verwerken, maar ook de subtiliteiten van menselijke spraak.

Modulate positioneert zijn technologie vooral als verdedigingslaag. Denk aan het vroegtijdig herkennen van synthetische spraak, het tegenwerken van misbruik en het ondersteunen van applicaties die in realtime met voice kunnen omgaan.

Waarom audio AI anders is dan tekst-AI

Veel AI-systemen werken vanuit een transcript: ze analyseren wat er is gezegd, op basis van tekst. Modulate stelt dat dat niet genoeg is wanneer het om deepfakes en spraakmisbruik gaat. In audio zitten nuances die verloren gaan zodra je alleen naar de woorden kijkt.

Volgens Modulate kan audio-native AI signalen beter interpreteren, omdat het systeem rekening houdt met kenmerken van de conversatie zoals emotie, toon, intentie en synthetische spraak. Daarmee wil het platform niet alleen “begrijpen”, maar ook detecteren of iets verdacht is.

Velma: meerdere modellen die samen spraaksignalen beoordelen

De kern van Modulates aanpak is een eigen architectuur: het Ensemble Listening Model (ELM). Daarmee maakt het bedrijf verschillende AI-modellen die elk zijn gespecialiseerd in een deel van de audio-intelligentie.

Die modellen komen samen in het Velma-platform. Modulate beschrijft Velma als een omgeving die samen meer dan 100 gespecialiseerde modellen gebruikt om signalen te duiden, waaronder aspecten als emotionele dynamiek, toonvariaties, intentie en conversatiegedrag.

In de praktijk betekent dit dat Velma verschillende detectie- en transcriptiecomponenten kan combineren, in plaats van op één model of één analysemethode te leunen. Het bedrijf geeft aan dat het platform zowel transcriptie als deepfake-detectie inzet.

Opschaling in data: miljoenen uren audio per maand

Modulate claimt dat het momenteel meer dan 10 miljoen uur audio per maand analyseert. In totaal zou de teller ondertussen boven de 600 miljoen uur uitkomen.

Het bedrijf koppelt die schaal aan prestatiebenchmarks. Volgens Modulate staan zowel de transcriptie- als deepfake-detectiemodellen op publieke benchmarks, waaronder Hugging Face, op de eerste plek.

Realtime beveiliging: niet alleen detecteren, maar ook ingrijpen

Een belangrijk punt in de positionering is dat Velma naar eigen zeggen in realtime werkt. Daardoor zouden applicaties niet alleen achteraf rapporteren dat er mogelijk misbruik is, maar kunnen reageren terwijl de conversatie nog loopt.

Modulate zegt ook dat Velma in vergelijking met traditionele LLM-aanpak:

  • twee keer zo nauwkeurig zou zijn,
  • zeven keer minder false positives zou genereren.

Die prestatieclaims zijn gericht op situaties waarin de kans op onterechte meldingen (false positives) een groot praktisch probleem vormt. Wanneer beveiligingssystemen te vaak onveiligheid signaleren, verdwijnt draagvlak en ontstaat “alarmmoeheid”.

Waar Modulate zijn audio AI voor inzet

Modulate noemt meerdere use cases waarin deepfake-detectie met audio AI van pas kan komen. Voorbeelden die het bedrijf zelf aanhaalt:

  • Beveiliging van zorginstellingen tegen deepfake-hackers.
  • Verbetering van voice AI-agenten op het gebied van emotie en empathie.
  • Het verminderen van extremisme en harassment op sociale platforms via detectie van gevaarlijk gedrag in conversaties.
  • Monitoring van voice agent performance, zodat je kunt beoordelen of een voice-agent doet wat verwacht wordt.
  • Herkenning en stopzetting van child grooming-gesprekken op basis van voice-dynamiek.
  • Bescherming in risicovolle scenario’s waar aanvallers proberen herkenning te omzeilen via geavanceerde voice masking.

De rode draad: het gaat niet alleen om het herkennen van “fake spraak”, maar om het detecteren van misbruik en gevaarlijk gedrag in de context van een gesprek.

De belofte voor ontwikkelaars: audio-intelligentie als bouwsteen

Modulate zet in op een praktische ontwikkelstrategie. De financiering wordt volgens het bedrijf gebruikt om het team en de infrastructuur verder uit te bouwen, en om het aanbod voor partners en developers te vergroten: modellen, API’s, SDK’s, integraties en deployment-opties.

Daarbij benadrukt het management dat ontwikkelaars volgens Modulate niet telkens opnieuw de hele audio-intelligentie-laag hoeven te bouwen voor een nieuwe voice-ervaring. Het doel is dat teams zich sneller kunnen richten op de applicatie, terwijl Modulate de “audio-native” detectie-infrastructuur levert.

Die insteek sluit aan op een bredere trend: voice interfaces worden steeds normaler, en daarmee groeit ook de behoefte aan beveiliging die niet uitgaat van uitsluitend tekst.

Risico’s van AI-misbruik maken detectie noodzakelijk

Volgens Modulate is adversarial gebruik van AI bij het maken van frauduleuze deepfakes inmiddels realiteit. Ook misbruik van taal—bijvoorbeeld voor belediging, intimidatie of andere vormen van online schade—wordt door het bedrijf gezien als een structureel probleem.

De kern van de redenering: deepfakes en audio-misbruik tijdig herkennen is lastig zonder AI. Bovendien is het moeilijk om toepassingen te bouwen die voice-misbruik effectief kunnen detecteren en stoppen. Modulate positioneert zijn technologie als hulp om dat lastige deel te versnellen.

Voor organisaties betekent dit dat audio niet langer alleen een “interface” is, maar ook een mogelijke aanvalsvector. Als een gesprek kan worden gemanipuleerd, moet beveiliging die manipulatie kunnen onderscheiden.

Wat dit betekent voor cybersecurity in voice-toepassingen

Voice en audio worden steeds vaker gebruikt in klantsystemen, assistenten en agent-automatisering. Dat maakt deepfake-detectie met audio AI relevant voor meer dan één sector. Zeker wanneer een stem niet alleen informatie doorgeeft, maar ook autorisatie, begeleiding of beslissingen kan beïnvloeden.

De boodschap van Modulate is dat je beveiliging idealiter niet baseert op één simpele drempel, maar op een gelaagde beoordeling van spraaksignalen. Met realtime verwerking kun je bovendien sneller ingrijpen—wat bij incidenten het verschil kan maken tussen schade beperken of schade escaleren.

Wil je bredere context over incidentafhandeling met AI en het belang van zichtbaarheid? Lees dan ook Focus: stateful SOC en AI in incidentafhandeling.

Praktische vervolgstappen voor organisaties

Als je voice-toepassingen aanbiedt of intern inzet, kun je de volgende vragen gebruiken om je aanpak te toetsen:

  • Kun je audio-signalen beoordelen buiten een transcript om?
  • Werk je realtime, zodat je tijdens het gesprek kunt reageren?
  • Hoe voorkom je false positives die je gebruikerservaring verstoren?
  • Is er een route naar integratie (API/SDK) zodat beveiliging meegroeit met je voice-product?

Hoewel financiering en claims iets zeggen over ambitie, is het uiteindelijk de implementatie die bepaalt of deepfake-detectie echt werkt in jouw omgeving. Test daarom met relevante scenario’s, inclusief varianten van synthetic speech en gesimuleerd misbruik.

Meer lezen over actuele voice- en cyberontwikkelingen? Je kunt daarnaast gerelateerde signalen volgen via Cyberdreigingen deze week: AI en sleutels.

Conclusie

Modulates extra financiering onderstreept dat deepfake-detectie met audio AI snel volwassen wordt als productcategorie. Met Velma en de ensemble-architectuur richt het bedrijf zich op het analyseren van spraaksignalen zoals emotie, toon, intentie en conversatiegedrag—met een focus op realtime interventie.

Voor organisaties die voice gebruiken in kritieke of gevoelige processen betekent dit: beveiliging kan verder gaan dan “wat er is gezegd”. Audio-native detectie opent de deur naar snellere detectie, minder onterechte meldingen en gerichtere mitigatie wanneer misbruik op spraak binnenkomt.

Bron: https://www.securityweek.com/modulate-raises-25-million-to-advance-deepfake-detection/