Definition

Ein Deepfake ist ein mithilfe künstlicher neuronaler Netze erzeugter oder manipulierter Bild-, Audio- oder Videoinhalt, der reale Personen oder Ereignisse täuschend echt, aber wahrheitswidrig darstellt und sich gezielt für Social-Engineering-Angriffe nutzen lässt.

Auf einen Blick

Der Begriff ist ein Kofferwort aus Deep Learning und Fake und bezeichnet damit primär die zugrunde liegende KI-Technik, nicht ein bestimmtes Zielformat wie Video oder Audio.

Einfache Erkennungsmerkmale wie unnatürliches Blinzeln oder fehlerhaft dargestellte Finger werden mit neueren Modellgenerationen unzuverlässiger.

Verlässlicher als das bloße Betrachten oder Anhören ist die Rückfrage über einen zweiten, unabhängigen Kanal vor der angewiesenen Zahlung.

Was ist ein Deepfake?

Deepfakes entstehen durch generative neuronale Netze, die aus vorhandenem Bild- oder Tonmaterial einer Zielperson ein Modell ihrer Mimik, Stimme oder Sprechweise lernen und dieses Modell anschließend auf neues Material übertragen. Je mehr Trainingsmaterial öffentlich verfügbar ist – etwa aus Interviews, Konferenzvideos oder Social-Media-Auftritten –, desto überzeugender wirkt die Fälschung; Personen des öffentlichen Lebens und Führungskräfte mit hoher medialer Präsenz sind dadurch besonders exponiert. Die KI-Verordnung (EU) 2024/1689 erfasst solche Inhalte rechtlich als KI-erzeugte oder KI-manipulierte Bild-, Ton- oder Videoinhalte und verpflichtet Betreiber nach Art. 50(4) unter bestimmten Voraussetzungen zur Offenlegung.

Für Versicherer verschärft die Technik das Risiko beim CEO-Fraud: Eine gefälschte Sprachnachricht oder ein kurzer Videoanruf einer vermeintlichen Führungskraft kann eine Überweisung im Schadenfall oder eine Änderung hinterlegter Auszahlungsdaten glaubwürdiger wirken lassen als eine reine Text-E-Mail. Mitarbeiter der Finanzabteilung, der Schadenregulierung oder des Kundenservice mit Zugang zu Policen- und Zahlungsdaten geraten dadurch stärker in den Fokus, weil das gesprochene oder gefilmte Wort traditionell als schwerer fälschbar galt. Frei verfügbare Anwendungen senken zugleich die Angriffskosten, weil die Erstellung solcher Fälschungen nicht mehr auf spezialisierte Angreifer beschränkt bleibt.

Wie funktioniert ein Deepfake?

Ein Deepfake entsteht in drei Schritten: Sammeln von Material der Zielperson, Training eines Modells auf deren Merkmale und Übertragung dieses Modells auf neues Bild- oder Tonmaterial. Das Material stammt aus öffentlich zugänglichen Quellen, etwa Interviews, Konferenzmitschnitten oder Sprachnachrichten; für eine Stimme genügt weniger Ausgangsmaterial als für ein Gesicht in Bewegung.

Für den Angriff zählt danach nicht die Perfektion der Fälschung, sondern der Kanal, über den sie ankommt. Eine Sprachnachricht in einem Messenger wird selten technisch geprüft, ein kurzer Videoanruf mit schlechter Verbindung erst recht nicht. Die Fälschung muss deshalb nur so lange tragen, wie die angewiesene Handlung dauert. Bei der Abwehr setzt das dort an, wo die Handlung ausgelöst wird: bei der Freigabe, nicht bei der Erkennung des Videos. Für Versicherer verschiebt sich die Prüfung damit von der Aufnahme zum Ablauf: Eine Auszahlung, die eine zweite Bestätigung über einen bekannten Kanal verlangt, hält auch dann, wenn Stimme und Bild überzeugen.

Deepfake vs. KI-generierte Bilder

Merkmal Deepfake KI-generierte Bilder
Bezug zur realen Person bildet eine bestimmte reale Person nach kann eine Person zeigen, die es nicht gibt
Ausgangsmaterial Aufnahmen der Zielperson Text-Prompt, Referenzbild oder beides
Typisches Format Video und Audio, auch in Echtzeit Standbild
Angriffsnutzen Anweisung im Namen einer bekannten Person Glaubwürdigkeit für ein erfundenes Profil

Woran erkenne ich einen Deepfake?

Signal Was sich prüfen lässt
Anweisung kommt über einen ungewohnten Kanal Den Vorgang über den etablierten Weg bestätigen lassen, unabhängig davon, wie echt die Stimme klingt
Zeitdruck und Bitte um Vertraulichkeit Beides sind Merkmale des Angriffs, nicht der Führungskommunikation
Gespräch bleibt kurz und einseitig Eine Rückfrage zu einem gemeinsamen Detail stellen, das nicht öffentlich dokumentiert ist
Bild- und Tonspur passen nicht exakt zusammen Auf Lippenbewegung, Atempausen und Betonung achten, sofern die Verbindung stabil ist
Kein Rückruf auf der bekannten Nummer möglich Auflegen und selbst zurückrufen; die Nummer aus dem internen Verzeichnis nehmen

Schutz im Ernstfall

Vorbeugen

  • Potenziell betroffene Mitarbeitende gezielt zu Deepfake-Angriffsmethoden schulen, um die Einschätzung von Bild- und Tonmaterial zu verbessern
  • Für unternehmenskritische Kommunikation den Einsatz kryptographischer Verfahren prüfen, die Aufnahmen nachweisbar an ihre Quelle binden
  • Zahlungsanweisungen aus Videokonferenzen über eine bekannte, offizielle Nummer rückbestätigen, auch wenn Bild und Stimme echt wirken

Was tun im Ernstfall

  • Nach einer ausgelösten Zahlung die Bank informieren, die Überweisung stoppen lassen und intern melden
  • Den Kommunikationsweg der Fälschung sichern, also Anrufliste, Nachricht oder Konferenzeinladung samt Zeitstempel aufbewahren
  • Betroffene Freigabeprozesse auf eine zweite, unabhängige Bestätigung umstellen, bevor die nächste Auszahlung ansteht
  • Die Fälschung selbst nicht löschen, da sie für Anzeige und Nachvollzug gebraucht wird

Beispiele aus der Praxis

  • Bei einem 2019 bekannt gewordenen Betrugsfall glaubte der CEO eines britischen Energieunternehmens, mit dem CEO der deutschen Muttergesellschaft zu telefonieren; eine nachgeahmte Stimme veranlasste ihn zu einer Überweisung von 220.000 Euro.
  • Im März 2022 verbreitete sich ein manipuliertes Video, das den ukrainischen Präsidenten Wolodymyr Selenskyj scheinbar zur Kapitulation aufforderte; die genaue Urheberschaft blieb öffentlich unbestätigt.
  • Kriminelle Gruppen setzen Deepfake-Videoanrufe ein, bei denen sie sich als CFO eines Unternehmens ausgeben, um Finanzabteilungen zur Freigabe großer Geldbeträge zu bewegen – ein Szenario, das 2024 in Hongkong mit einem Schaden von rund 25 Millionen US-Dollar bekannt wurde.
  • Ein täuschend echt wirkender, kurzer Videoanruf mit nachgeahmter Stimme und Mimik einer Vorstandsvorsitzenden fordert einen Mitarbeiter der Kapitalanlageabteilung eines Lebensversicherers auf, eine dringende Überweisung an ein neues Konto freizugeben; die Zahlung wird gestoppt, weil der Mitarbeiter über eine intern hinterlegte Telefonnummer zurückruft.

Die Varianten im Detail (1)

Face Reenactment Face Reenactment überträgt Mimik und Kopfbewegungen einer Person auf das Videobild einer anderen Person.

Face Reenactment bezeichnet eine KI-gestützte Technik, bei der ein Modell Mimik, Kopf- und Lippenbewegungen einer Zielperson in Echtzeit oder nachträglich durch die Bewegungen einer anderen Person steuert, sodass sie Aussagen zu treffen scheint, die es real nie gab.