Wann hat euch das letzte Mal jemand einfach so angerufen? Bei den meisten von uns klingelt das Telefon heute vor allem, wenn etwas los ist. Die Schule, die Bank, der Chef mit einer dringenden Frage. Das Telefon ist für Dringendes da. Genau das macht es für Betrüger wertvoll. Seit sich Stimmen mit KI nachbauen lassen, wackelt auch das Erkennungszeichen, auf das wir uns am Telefon am meisten verlassen: die vertraute Stimme.
Für einen Millionenbetrug reicht offenbar eine Stimme. Das Drehbuch des Betruges an sich am Telefon hat sich wenig verändert. Neu ist, wer am anderen Ende spricht.
In diesem Artikel werden folgende Fragen behandelt:
Was ist Voice-Cloning-Vishing?
Welche Fälle zeigen, wie es funktioniert?
Warum glauben wir der Stimme?
Was zeigt die Forschung?
Was hilft?
Was ist Voice-Cloning-Vishing?
Vishing steht für Voice Phishing, also Betrug per Telefon oder Sprachnachricht. Beim Voice Cloning stellt eine KI die Stimme einer bestimmten Person nach. Ein kurzer Ausschnitt der Stimme, etwa aus Inhalten, die online stehen, plus ein Programm zum Klonen reichen. Ein Informatikprofessor der Arizona State University sprach 2023 von Aufnahmen ab drei Sekunden. knowbe4azfamily
Das Muster dahinter kennen wir seit Jahrzehnten. Jetzt können die Täter mit der Stimme einer Person anrufen, die wir kennen.
Drei Typische Fälle mit Stimmen-Betrug
CEO-Betrug
Paolo Molesini ist Präsident der italienischen Privatbank Fideuram. Er bekommt im Februar 2026 eine WhatsApp-Nachricht, scheinbar von Carlo Messina, CEO des Mutterhauses. Ein Auslandsgeschäft drohe zu platzen! Paolo müsse die Zahlungen übernehmen.
Kurz darauf ruft ein Wirtschaftsanwalt an, den Paolo kennt, und er erkennt die Stimme. Der echte Anwalt weiss von nichts, seine Stimme wurde mit KI geklont. Danach kommen E-Mails mit Kontoangaben, scheinbar aus der Kanzlei. 36 Millionen Euro Schaden entsteht durch diesen Betrug.
Im Mai 2026 trifft es ebenfalls eine italienische Bank; die Banca Ifis. Eine Managerin löst Zahlungen von rund 24 Millionen Euro aus. 20 Millionen kommen zurück. Laut italienischen Medien untersucht die Mailänder Staatsanwaltschaft weitere Fälle, in denen geklonte Stimmen, gefälschte Nachrichten und E-Mails Bankkader zu Auslandsüberweisungen brachten.
Auch in der Schweiz verlor Mitte Januar 2026 ein Firmeninhaber im Kanton Schwyz mehrere Millionen. Die Täter riefen ihn an und gaben sich mit einer KI-Stimme als bekannter Geschäftspartner aus. Es ging um ein angeblich vertrauliches internationales Geschäft.
Das Muster: Eine vertraute Person, ein vertrauliches Geschäft und Zeitdruck. Betroffen sind erfahrene Leute: ein Bankpräsident, eine Managerin, ein Unternehmer. Das Drehbuch ist gut genug für Profis.
Anruf aus der Familie
Anfang 2023 klingelt das Telefon von Jennifer DeStefano in Scottsdale, Arizona. Sie ist im Tanzstudio ihrer anderen Tochter. Am Apparat scheint ihre 15-jährige Tochter zu sein. Dann übernimmt ein Mann, behauptet eine Entführung und verlangt eine Million Dollar Lösegeld. Was sie hört, klingt nach der Stimme ihrer Tochter, inklusive Weinen und Schluchzen.
Quelle: Beispiel eines Schockanrufes, Landeskriminalamt Niedersachsen, 2026
Das Muster: Das Muster ist bekannt als Schockanruf. Im Mai 2026 forderte etwa eine angebliche Staatsanwältin von einer 68-jährigen Frau in der Schweiz eine Kaution von mehreren zehntausend Franken, weil ihre Tochter einen Unfall verursacht habe. Die Frau rief die Polizei, ein mutmasslicher Geldabholer wurde verhaftet. Bei solchen Anrufen fehlte den Tätern bisher meistens die echte Stimme der Tochter. KI kann diese Lücke schliessen.
Die eigene Stimme als Schlüssel
Die britische Behörde National Trading Standards warnte im Februar 2026 vor einer Masche, die mit einem scheinbar harmlosen Anruf für eine sogenannte Lifestyle-Umfrage beginnt. Dabei sammeln die Täter persönliche, gesundheitliche und finanzielle Angaben.
Muster: Aus der Aufnahme erstellen die Betrüger mit KI einen Klon der Stimme. Danach rufen sie bei Banken oder Anbietern an und geben sich mit diesem Klon als die betroffene Person aus. So richten sie Lastschriften ein, die scheinbar mündlich bewilligt wurden. Ab dann wird regelmässig Geld abgebucht, oft ohne dass die Person es merkt.
Warum glauben wir der Stimme?
Wir glauben grundsätzlich und geben den Menschen einen Vertrauensvorschuss. Der Kommunikationswissenschaftler Timothy Levine nennt das den Truth-Default, die Wahrheits-Voreinstellung. Seine zentrale Annahme: Menschen glauben anderen in der Regel, und das ist evolutionär sinnvoll. Ohne diesen Vertrauensvorschuss würde kaum ein Gespräch funktionieren. Misstrauisch werden wir erst, wenn uns etwas aufschreckt.
Täuschung erkennen wir laut Levine am ehesten über den Inhalt im Kontext, weniger über nervöse Körpersignale. Passt das, was gesagt wird, zu dem, was ich über die Person weiss? 2024 meldete ein Schweizer Unternehmen dem Bundesamt für Cybersicherheit den ersten Deepfake-Fall des Landes. Der Finanzchef sass in einer Videokonferenz mit seinem angeblichen Chef. Der trug Hemd und Krawatte, was nicht zu ihm passte, und die Stimme klang seltsam. Kleidung und Stimme verrieten den Deepfake.
Weitere Effekte:
Die vertraute Stimme ist eine Denk-Abkürzung. Wer die Stimme der Tochter oder des Geschäftspartners hört, muss nicht mehr überlegen, wer anruft. Das Gehirn hat die Frage schon beantwortet.
Druck schaltet das Prüfen ab. Eine Studie hat Gespräche von Telefonbetrügern in China analysiert. Die Täter arbeiten mit vorbereiteten Skripten und setzen Wiederholungen, Unterbrechungen sowie eine lautere und höhere Stimme gezielt ein, um Panik auszulösen. In diesem Zustand übernimmt vermutlich das schnelle, intuitive Denken, das Daniel Kahneman System 1 nennt. Prüfen braucht Zeit, und das spielen Betrüger bewusst aus.
Autorität wirkt: Staatsanwältin, Wirtschaftsanwalt, CEO: Die Täter wählen Rollen, denen wir selten widersprechen. Die Technik hilft nach, denn die angezeigte Nummer lässt sich fälschen. In einem Feldexperiment mit 3'000 Angehörigen einer Universität hatte eine gefälschte Anruferkennung einen deutlichen Effekt darauf, ob die Angerufenen ihre Sozialversicherungsnummer preisgaben.
Vertraulichkeit: In Schwyz ging es um ein vertrauliches Geschäft. Beim Schockanruf heisst es oft, niemand solle informiert werden. Wenn auf Vertraulichkeit gepocht wird, isoliert uns das und trennt uns von den Menschen, die uns sonst zurückhalten würden.
Was zeigt die Forschung?
Eine Forschungsgruppe hat 2026 untersucht, wie gut KI-Stimmen Menschen zum Mitmachen bringen. 4’100 Erwachsene in den USA hörten eine Aufnahme oder lasen eine Abschrift aus einem von fünf Betrugsszenarien.
Über alle Szenarien gaben 16,5 % an, sie würden der Aufforderung folgen oder seien unsicher. Persönliche, emotionale Szenarien wirkten deutlich stärker als der angebliche Karten- oder Gmail-Support.
Die Forschenden empfehlen, in der Sensibilisierung auf das Erkennen manipulativer Gesprächsmuster zu setzen. Und sie empfehlen, das Stigma für Betroffene zu senken, damit mehr Fälle gemeldet werden. Beides passt zu einer Überzeugung, die mich in meiner Arbeit begleitet: Scham ist eine der grössten Hürden in der Cybersicherheit.
Was hilft?
Privat: Selbst zurückrufen, über eine Nummer, die ihr selbst kennt und selbst wählt.
Geschäftlich: Rückfragen von oben erlauben, CEO sagt dann beispielsweise: „Falls ich je anrufe und eine dringende Zahlung will, ruft mich bitte zurück. Ich werde mich darüber freuen.“
Am wichtigsten finde ich: Auflegen ist erlaubt. Ein echter Notfall übersteht in aller Regel die fünf Minuten für einen Rückruf.
Die Stimmen werden besser und KI wird sich in nächster Zeit stets verbessern. Beim Verhalten haben wir es selbst in der Hand: auflegen, zurückrufen, nachfragen. Rachel Tobac nennt diese Haltung „politely paranoid“. Auf Deutsch sage ich gerne höflich paranoid. Freundlich bleiben und trotzdem prüfen.
Habt ihr selbst schon mal einen Anruf erlebt, bei dem ihr kurz gezögert habt?
Bis bald!
Quellen:
BACS warnt vor neuer Version des CEO-Betrugs. (2024, 10. April). Netzwoche. https://www.netzwoche.ch/news/2024-04-10/bacs-warnt-vor-neuer-version-des-ceo-betrugs
Bolzern, T. (2026, 28. September). Mit KI-Stimme 95 Millionen Euro von Bank geklaut. Blick. https://www.blick.ch/digital/95-millionen-euro-mit-ceo-masche-von-privatbank-geklaut/zbbqv12
Chen, J. (2021). “You are in Trouble!”: A Discursive Psychological Analysis of Threatening Language in Chinese Cellphone Fraud Interactions. International Journal for the Semiotics of Law, 34(4), 1065-1092. https://doi.org/10.1007/s11196-020-09765-y
Gemeinde Reinach. (2023, 19. September). 76-Jährige fällt auf Schockanruf herein. https://www.reinach-bl.ch/de/verwaltung/dokumente/Medienmitteilungen-der-Alterskommission/MM_230919_Schockanrufe.pdf
Heiding, F., Mayrink Verdun, C., Lermen, S., Kao, A., Albiero, V., Deason, L., Veliche, I.-E. & Lehane, C. (2026). Evaluating AI Models’ Capability to Automate Voice Phishing Attacks. Expert Systems with Applications. https://www.sciencedirect.com/science/article/pii/S0957417426025285 (Preprint: https://arxiv.org/abs/2607.09970)
Heiding, F. & Lermen, S. (2026, 20. Juli). AI Voice Phishing Performs on Par With Human Scammers at a Fraction of the Cost. LessWrong. https://www.lesswrong.com/posts/AZ4tHHsGPC2jnen8a/ai-voice-phishing-performs-on-par-with-human-scammers-at-a
Kahneman, D. (2011). Schnelles Denken, langsames Denken. Siedler.
Kantonspolizei Schwyz. (2026). Kanton Schwyz: Unbekannte erlangen mit CEO-Fraud-Masche Millionen-Betrag. https://www.sz.ch/verwaltung/sicherheitsdepartement/kantonspolizei/medienmitteilungen/detailseite.html/8756-8758-8802-9496-9613-10011-12161/news/24495
Kantonspolizei Zürich. (2026, 21. Mai). Hinwil: Verhaftung nach Schockanruf. https://www.zh.ch/de/news-uebersicht/medienmitteilungen/2026/05/260521f_hinwil_schockanruf.html
KI-Stimme-Betrug: Schwyzer Unternehmer verliert Millionen. (2026). SRF. https://www.srf.ch/news/schweiz/mittels-ki-zu-millionenbetrug-ki-stimme-betrug-schwyzer-unternehmer-verliert-millionen
Levine, T. R. (2014). Truth-Default Theory (TDT): A Theory of Human Deception and Deception Detection. Journal of Language and Social Psychology, 33(4), 378-392. https://doi.org/10.1177/0261927X14535916
National Trading Standards. (2026, 5. Februar). Phone scams take sinister twist as victims’ voices cloned. https://www.nationaltradingstandards.uk/news/phone-scams-take-sinister-twist-as-victims-voices-cloned
Puig, A. (2023, März). Scammers use AI to enhance their family emergency schemes. Federal Trade Commission. https://consumer.ftc.gov/consumer-alerts/2023/03/scammers-use-ai-enhance-their-family-emergency-schemes
Scottsdale mom set to testify in congressional hearing about AI voice scams. (2023, 13. Juni). Arizona’s Family. https://www.azfamily.com/2023/06/13/scottsdale-mom-set-testify-congressional-hearing-about-ai-voice-scams/
Scottsdale mom’s encounter and congressional testimony on AI kidnapping scammers. (2024, 1. Januar). Arizona’s Family. https://www.azfamily.com/2024/01/01/scottsdale-moms-encounter-congression-testimony-ai-kidnapping-scammers/
Truffa da 39,5 milioni all’ex capo di Fideuram con messaggi falsi: c’è un indagato. (2026). La Sicilia. https://www.lasicilia.it/news/italia-mondo/3076691/truffa-da-39-5-milioni-all-ex-capo-di-fideuram-con-messaggi-falsi-c-e-un-indagato.html
Tu, H., Doupé, A., Zhao, Z. & Ahn, G.-J. (2019). Users Really Do Answer Telephone Scams. Proceedings of the 28th USENIX Security Symposium. https://www.usenix.org/conference/usenixsecurity19/presentation/tu
UK multinational Arup confirmed as victim of HK$200 million deepfake scam. (2024, Mai). South China Morning Post. https://scmp.com/news/hong-kong/law-and-crime/article/3263151/uk-multinational-arup-confirmed-victim-hk200-million-deepfake-scam-used-digital-version-cfo-dupe

