Zum Inhalt springen
Alle Insights KI gegen Betrug & Finanzkriminalität

Finanz-Workflows gegen Deepfakes und KI-Agenten-Missbrauch verteidigen

Angreifer setzen inzwischen generierte Stimmen, Dokumente und eigene Agenten gegen Onboarding und Zahlungsverkehr ein. Hier sind die Fehlermuster und die Guardrails, die wir einbauen.

5 Min. Lesezeit #Sicherheit#Betrug#Onboarding
Fachleute aus dem Finanzsektor bei der Arbeit an einer KI-Initiative

Deepfakes und feindselige KI-Agenten brechen selten Ihre Modelle. Sie nutzen den Moment aus, in dem Ihr Workflow beschließt, etwas zu vertrauen. Die Verteidigung behandelt jede eingereichte Stimme, jedes Gesicht und jedes Dokument als unbestätigtes Beweismaterial, bewertet es gegen unabhängige Signale wie Geräte-Historie und Verhalten und behält bei den strittigen Fällen einen Menschen in der Schleife. Billige Generierung verschiebt Ihr Budget für False Positives, also muss der gesamte Scoring-Stack sich mitbewegen.

Zuerst hat sich die Ökonomie verändert. Ein überzeugendes synthetisches Gesicht oder eine geklonte Stimme erforderten früher einen versierten Akteur und Zeit. Heute braucht es ein Abo und einen Referenzclip. Das macht nicht jeden Angreifer raffiniert, aber es bedeutet, dass die Untergrenze gestiegen ist: Der mittelmäßige Betrugsversuch sieht heute so aus, wie ein guter vor zwei Jahren aussah. Wenn Ihre Kontrollen gegen die alte Untergrenze kalibriert waren, sind sie bereits fehljustiert.

Die Fehlermuster, die man beim Namen nennen sollte

Generierte Medien greifen den Enrolment-Schritt an, in dem Sie eine echte Person oder ein echtes Unternehmen an ein Konto binden wollen. Die zwei Varianten, die wir am häufigsten sehen:

  • Eingeschleuste Liveness-Feeds. Der Angreifer hält kein Telefon vor einen Bildschirm. Er schleust einen gerenderten Videostream direkt über eine virtuelle Kamera oder ein gepatchtes SDK in die Capture-Pipeline ein, sodass das “Selfie”, das Ihre Liveness-Prüfung bewertet, nie vor einer Linse war. Presentation-Attack-Detection, die auf Ausdrucke und abgespielte Bildschirme abgestimmt ist, fängt einen eingeschleusten Feed nicht ab, weil es keine Präsentation gibt.
  • Voice Cloning gegen Callback und Zahlungsautorisierung. Eine geklonte Stimme hebelt ein telefonbasiertes Step-up aus oder autorisiert eine Zahlungsänderung in einem Treasury-Workflow, in dem die Stimme der zweite Faktor war. Der Klon muss nicht perfekt sein. Er muss gut genug sein für einen Prüfer, der zum Quartalsende unter Zeitdruck steht.

Dokumentenfälschung hat sich parallel weiterentwickelt. Generierte Ausweisdokumente und fabrizierte Finanzunterlagen tragen nicht mehr die Verräter, auf die sich Template-Matching-Detektoren verließen. Ein synthetischer Kontoauszug kann in sich konsistent sein, mit Salden, die aufgehen, und einer plausiblen Transaktionshistorie, weil das Modell, das ihn erzeugt hat, genau darauf optimiert. Pixelbasierte Fälschungserkennung hilft weiterhin, aber ein Dokument, das im Ganzen generiert statt bearbeitet wurde, zeigt keine Splicing-Artefakte.

Dann gibt es die neuere Klasse: Ihre eigenen Agenten und die des Angreifers. Agentischer Missbrauch nimmt zwei Formen an. In der einen richtet ein Angreifer einen skriptgesteuerten Agenten auf Ihren Onboarding- oder Dispute-Flow und lässt ihn in Maschinengeschwindigkeit und -umfang laufen, auf der Suche nach der Eingabe, die eine Freigabe erwirkt. In der anderen platziert der Angreifer Anweisungen in Inhalten, die Ihr Agent lesen wird, sodass Ihr Agent gegen Sie handelt. Diese zweite Form überschneidet sich stark mit Prompt Injection und sollte als dasselbe Problem mit anderem Hut behandelt werden.

Guardrails, die wir tatsächlich bauen

Es gibt keinen einzelnen Detektor, der den Kontakt mit einem motivierten Angreifer übersteht, deshalb bauen wir die Prüfung als Scoring-Problem mit unabhängigen Signalen und machen die Tools stromabwärts einer Entscheidung standardmäßig least-privilege.

Bei Medien zählt Injektionsresistenz mehr als reine Deepfake-Klassifikationsgenauigkeit. Das heißt: Capture auf einer Ebene, die der Angreifer nicht sauber ersetzen kann, Hardware-Attestation prüfen, wo die Plattform es zulässt, und die Aufnahme an ein Gerät und eine Sitzung binden, die Sie über die Zeit als normal erlebt haben. Ein Liveness-Score, der von einem Gerät ohne Historie kommt, in einem Netzwerk, das mit früheren Versuchen assoziiert ist, ist kein Liveness-Score, den Sie gleich gewichten wie einen von einem gealterten Gerät. Die Gesichtsprüfung und das Umfeld drumherum sind getrennte Beweise, und Entity Resolution über diese Signale hinweg ist die Quelle der meisten echten Detektionen.

Bei Dokumenten setzen wir auf Provenienz und Querabgleich statt auf das Dokument allein. Ein Auszug wird gegen das ausstellende Institut geprüft, wo eine Open-Banking- oder Verifizierungs-API existiert, sodass Sie kein PDF benoten, sondern eine Tatsache bestätigen. Wo das nicht möglich ist, wird das Dokument auf interne Konsistenz bewertet und gegen alles andere abgeglichen, was der Antragsteller eingereicht hat, und Diskrepanzen fließen in den Fall ein, statt automatisch abzulehnen. Die Disziplin der Point-in-Time-Korrektheit zählt auch hier: Ein Dokument mit einem Datum innerhalb eines Fensters, das diese Zahlen nicht hätte hervorbringen können, ist ein Signal, und Sie erwischen es nur, wenn Ihre Pipeline bei der Datumsvalidierung keinen Lookahead hat.

Bei agentischem Missbrauch teilen sich die Kontrollen sauber auf:

  • Gegen Angreifer-Agenten behandeln Sie Velocity und Sitzungsverlauf als erstklassige Betrugssignale. Ein Flow, der von einem Skript getrieben wird, hat einen Rhythmus, den ein Mensch nicht hat, und Rate Limiting, Behavioral Analytics und Step-ups, die auf das strittige Mittelfeld zielen, erhöhen die Kosten, den Angriff im großen Maßstab zu fahren, ohne gewöhnliche Nutzer zu bestrafen.
  • Gegen unterwanderte eigene Agenten halten Sie die Tools des Agenten so eng gefasst, dass das Lesen unvertrauter Inhalte und das Auslösen einer folgenreichen Aktion nie dieselbe Berechtigung sind. Ein Agent, der eine Dispute-E-Mail liest, sollte nicht auch eine Rückerstattung freigeben können. Structured Output mit Schema-Validierung bei jedem Tool-Call, dazu ein Audit-Trail dessen, was der Agent gesehen und was er ausgelöst hat, ist das, was Ihnen erlaubt, einen Vorfall zu rekonstruieren und zu belegen, dass die Grenze gehalten hat.

Die verbindende Haltung lautet: Sie lassen die Konfidenz eines einzelnen Modells nie zur Entscheidung werden. Medien, Dokument, Gerät, Netzwerk und Verhalten sind getrennte Sichten auf dieselbe Behauptung, und die Betrugsentscheidung ist die Zusammenführung dieser Sichten, mit einem False-Positive-Budget, das Sie bewusst setzen, statt es vom Standard-Schwellenwert eines Anbieters zu erben.

Das System ehrlich halten, während Angriffe abdriften

Detektion, die gegen die heutigen Generatoren gebaut wurde, verfällt, weil die Generatoren sich in einem schnelleren Zyklus verbessern, als die meisten Betrugsmodelle neu trainiert werden. Also ist das Eval-Set das Produkt. Wir pflegen ein gelabeltes Set aus bekannten synthetischen und bekannten echten Fällen, frischen es mit neuen Angriffs-Samples auf, sobald sie auftauchen, und messen Drift in beide Richtungen: nachlassende Detektionen und schleichend steigende False Positives, wenn legitime Nutzer dieselben Werkzeuge übernehmen wie Angreifer. Ein Liveness-Modell, das im Januar noch in Ordnung war, kann bis März still aufhören, die aktuelle Injektionstechnik zu erwischen, und Sie sehen es nur, wenn Sie gegen frische adversariale Beispiele scoren statt gegen die Trainingsverteilung.

Zwei operative Gewohnheiten verhindern, dass das verrottet. Loggen Sie die vollständige Lineage jeder Entscheidung, damit ein Prüfer oder Auditor sehen kann, welche Signale ausgelöst haben und wie sie sich kombiniert haben, nicht nur den finalen Score. Und setzen Sie die menschliche Prüfung dort an, wo das Geld ist: bei den strittigen Fällen, die der Stack nicht trennen kann, mit allem, was er weiß, vor sich, während die klaren Freigaben und klaren Ablehnungen durchlaufen. Das Ziel ist nicht, synthetische Medien aus der Pipeline zu eliminieren. Es ist sicherzustellen, dass, wenn eine gute Fälschung die erste Prüfung passiert, vier andere Dinge, die sie nicht fälschen konnte, ihr bereits widersprechen.

Häufige Fragen

Kann Liveness-Erkennung allein Deepfake-Betrug beim Onboarding stoppen?

Nein. Ein entschlossener Angreifer, der eine einzelne Presentation-Attack-Prüfung aushebelt, muss den eingeschleusten Feed immer noch mit einem Dokument, einem Gerät und einer Netzwerk-Historie in Einklang bringen. Liveness ist ein Signal in einem Scoring-Stack, kein Tor, das man einfach besteht oder nicht.

Wie unterscheiden wir einen KI-Agenten von einem menschlichen Kunden, ohne echte Nutzer mit zusätzlicher Reibung zu belasten?

Man versucht meist gar nicht, Menschlichkeit direkt zu klassifizieren. Man betrachtet Tempo, Sitzungsverlauf, Gerätekonsistenz und ob die Entität Out-of-Band-Artefakte liefern kann, die ein skriptgesteuerter Agent nicht billig fälschen kann. Die meisten legitimen Nutzer bekommen den zusätzlichen Schritt nie zu sehen.

Wo sollte die menschliche Prüfung ansetzen, wenn Fälschungen derart gut werden?

Bei den Fällen, die der Scoring-Stack als strittig markiert, nicht bei jedem Antrag. Leiten Sie das mehrdeutige Mittelfeld an Prüfer weiter, die die vollständige Lineage vor sich haben, und behalten Sie Straight-Through-Processing für die klaren Ränder bei.

Arbeiten Sie an etwas Ähnlichem?

Erzählen Sie uns von Ihren Daten und dem Workflow drumherum, und Sie bekommen eine ehrliche Einschätzung.

30-minütiges Erstgespräch buchen