Das Telefon klingelt, am Apparat ist angeblich eine Cybersicherheitsbehörde. Die Stimme klingt ruhig, kompetent und dringend: Ihr Rechner sei womöglich von einer bekannten Schadsoftware betroffen, Sie sollen bitte sofort ein Diagnose-Tool installieren. Was früher ein aufwendig vorbereiteter Betrugsanruf war, kann heute ein KI-Agent erledigen - selbstständig, überzeugend und hundertfach gleichzeitig.
Deepfake-Stimmen sind kein neues Thema. Neu ist, dass die KI nicht mehr nur eine Stimme liefert, sondern das ganze Gespräch führt: Sie reagiert auf Rückfragen, erkennt Zögern, beruhigt, drängt und passt ihre Argumente an. Damit verändert sich Social Engineering grundlegend - im Unternehmen und genauso am privaten Telefon.
Der August-Cyber-Snack macht genau das erlebbar: Er zeigt, wie ein Angriff mit KI-Agenten ablaufen kann, warum er so gut skaliert und mit welchen einfachen Regeln sich Mitarbeitende und Familien schützen.
Echt oder KI? Am Telefon kaum noch zu unterscheiden
Im Cyber Snack hören Sie vier Stimmen und sollen entscheiden, welche davon KI-generiert ist. Die Auflösung: alle vier. Genau das ist der Punkt. Aktuelle Sprachmodelle erzeugen Stimmen mit natürlicher Betonung, kleinen Pausen und passender Emotion. Am Telefon, mit leichter Verzerrung durch die Leitung, fällt der Unterschied noch weniger auf.
Wie wirkungsvoll gefälschte Stimmen und Gesichter sein können, haben wir bereits im Impuls Web-Meetings beschrieben - unter anderem am Fall Arup, bei dem ein Mitarbeiter in Hongkong nach einer Videokonferenz mit gefälschten Kollegen rund 25 Millionen US-Dollar überwies. Damals steckte hinter dem Angriff noch viel menschliche Vorbereitung. Mit KI-Agenten fällt genau dieser Aufwand weg.
So kann ein solcher Angriff ablaufen
Ein offiziell wirkender Anruf, eine dringende Bitte, ein Download - mehr braucht der Angriff nicht.
Der Hintergrund ist real: Im September 2025 berichteten Mandiant und die Google Threat Intelligence Group über BRICKSTORM, eine Backdoor, mit der mutmaßlich China-nahe Angreifer unter anderem Anwaltskanzleien, SaaS-Anbieter und Technologieunternehmen ausspionierten. Sie nistete sich vor allem auf Netzwerkgeräten und VMware-Servern ein, auf denen klassische Endpoint-Sicherheit kaum greift, und blieb im Schnitt mehr als ein Jahr unentdeckt. Im Dezember 2025 legten die US-Behörde CISA, die NSA und das kanadische Cyber Centre mit einer gemeinsamen Analyse nach.
Genau solche Schlagzeilen sind der perfekte Aufhänger für Betrüger. Der Cyber Snack spielt das an einem realistischen Szenario durch: Ein Mitarbeiter in einem Büro in New York beginnt seinen Tag ganz normal. Dann klingelt das Telefon. Ein angeblicher CISA-Mitarbeiter meldet sich, ruhig und glaubwürdig: "Wir haben Hinweise, dass Ihr Rechner von BRICKSTORM betroffen sein könnte. Bleiben Sie bitte dran, wir müssen verhindern, dass sich die Schadsoftware ausbreitet."
Der Mitarbeiter kennt die Meldungen. Der Anruf klingt nach Hilfe, nicht nach Angriff - und genau so beginnt die Manipulation. Er soll ein "Diagnose-Tool" herunterladen. Er tut es. Installiert ist damit keine Hilfe einer Behörde, sondern Schadsoftware. Das Besondere: Am anderen Ende der Leitung saß kein Mensch, sondern ein KI-Agent.
Die entscheidende Frage ist nicht mehr: "Klingt diese Stimme echt?" Sondern: "Halte ich mich an den Prozess - egal, wie echt sie klingt?"
Was an KI-Agenten wirklich neu ist
Ein KI-Agent kann viele Gespräche gleichzeitig führen. Ziel ist, wer gerade abhebt.
Früher waren Deepfake-Anrufe meist vorbereitete Audioclips oder Stimmen, die ein Mensch live steuerte. Das war aufwendig. Deshalb richteten sich solche Angriffe vor allem gegen ausgewählte Personen: Menschen mit Budgetverantwortung, mit Zugriff auf vertrauliche Daten oder mit Einfluss auf Zahlungen.
Ein KI-Agent arbeitet anders. Der Angreifer gibt nur noch ein Ziel vor, etwa: "Bring die Person dazu, ein Diagnose-Tool herunterzuladen." Den Weg dorthin findet die KI selbst. Sie erkennt Skepsis, erklärt geduldig, setzt im richtigen Moment Druck, schmeichelt oder droht - je nachdem, was beim Gegenüber wirkt. Das ist agentische KI: Sie verfolgt ein Ziel und handelt dabei eigenständig.
Der entscheidende Unterschied ist die Skalierung. Früher führte ein Social Engineer jeden Anruf selbst, einen nach dem anderen. Heute kann ein KI-Agent Hunderte Gespräche parallel führen. Das Ziel ist dann nicht mehr eine bestimmte Person, sondern irgendjemand, der gerade abhebt, gestresst ist und klickt. Social Engineering wird schneller, günstiger und skalierbar.
Das ist keine Zukunftsmusik. Forschende der University of Illinois zeigten bereits im Oktober 2024, dass sprachfähige KI-Agenten gängige Telefonbetrugsmaschen eigenständig durchführen können - zu Kosten von im Schnitt unter einem US-Dollar pro Versuch. Im April 2026 beschrieb Abnormal Security mit ATHR eine im Untergrund angebotene Plattform, bei der ein KI-Sprachagent Vishing-Anrufe automatisch führt und ein einzelner Betreiber viele Gespräche gleichzeitig steuert. Und das FBI warnte im Mai 2025 vor einer Kampagne, in der Kriminelle mit KI-generierten Sprachnachrichten hochrangige US-Regierungsvertreter imitierten.
Auch die echte CISA warnt vor falschen CISA-Anrufen
Das Szenario aus dem Cyber Snack ist erfunden, die Masche dahinter nicht. Bereits im Juni 2024 warnte die US-Behörde CISA öffentlich vor Betrügern, die sich am Telefon als ihre Mitarbeitenden ausgeben. Ihr Hinweis: Echte CISA-Mitarbeitende verlangen niemals Überweisungen, Bargeld, Kryptowährung oder Geschenkkarten - und fordern nie dazu auf, das Gespräch geheim zu halten.
Nicht nur Unternehmen: Familien und Kinder im Visier
Vielleicht denken Sie: Das betrifft Unternehmen, aber nicht mich als Privatperson. Leider doch. KI-Agenten können Behörden, Schulen, Vereine oder bekannte Personen imitieren - auch am privaten Telefon. Und sie rufen nicht nur Erwachsene an.
Stellen Sie sich vor, Ihr Kind bekommt einen Anruf, angeblich von der Polizei: "Deine Eltern hatten einen Unfall. Ist jemand zu Hause? Wie erreichen wir deine Familie?" Oder der Agent gibt sich als Lehrkraft, Trainerin oder Bekannter der Familie aus und fragt nach Adresse, Tagesablauf, Namen, Urlaubsplänen oder danach, ob das Kind gerade allein ist. Kinder und Jugendliche sind besonders verwundbar, wenn eine Stimme erwachsen, offiziell und dringend klingt.
Je echter und dringender ein Anruf klingt, desto schwerer fällt es, ruhig zu bleiben. Genau das nutzen Betrüger. Ein KI-Agent wird nicht ungeduldig. Er wiederholt, beruhigt, droht oder schmeichelt, so lange, bis etwas wirkt.
Fünf Regeln für verdächtige Anrufe
Die gute Nachricht: Der beste Schutz ist nicht technisch, sondern menschlich und informiert. Wer die folgenden Regeln kennt, muss nicht erkennen, ob eine Stimme echt ist. Er muss nur dem Prozess folgen.
1. Behörden rufen nicht überraschend mit Druck an
Echte Behörden nutzen offizielle Kanäle und bekannte Kontaktwege. Ein unerwarteter, dringender Anruf mit der Aufforderung, sofort zu handeln, ist ein Warnsignal.
2. Kein Fernzugriff, keine Software, keine Zugangsdaten
Seriöse Stellen verlangen am Telefon niemals Fernzugriff, Software-Installationen oder vertrauliche Zugangsdaten. Nichts klicken, nichts installieren, keinen Zugriff geben.
3. Nicht diskutieren, sondern auflegen
Ein KI-Agent hat auf jeden Einwand eine Antwort. Lassen Sie sich nicht auf eine Diskussion ein. Beenden Sie das Gespräch freundlich, aber bestimmt.
4. Selbst über eine offizielle Nummer zurückrufen
Suchen Sie die Nummer selbst heraus, etwa über die offizielle Website oder das Intranet. Wählen Sie nie die Nummer, die der Anrufer nennt - sie kann genauso gefälscht sein wie seine Geschichte.
5. Melden, auch wenn nichts passiert ist
Im Unternehmen gehört jeder solche Anruf an die IT-Security - auch wenn Sie nichts geklickt haben. So können Kolleginnen und Kollegen rechtzeitig gewarnt werden.
Familien-Code und Rollenspiele: So schützen Sie Ihre Kinder
Ein vereinbarter Familien-Code schützt dort, wo die Stimme allein nicht mehr verlässlich ist.
Für Familien gibt es ein einfaches, aber sehr wirksames Werkzeug: einen Familien-Code. Das ist ein geheimes Wort oder ein kurzer Satz, den nur die Familie und ausgewählte Vertrauenspersonen kennen - etwa "Blauer Panda" oder "Operation Kiwi". Wer im Namen der Familie anruft und dringend etwas will, muss den Code nennen können. Kann er es nicht, wird das Gespräch beendet.
Wichtig ist, dass Kinder wissen, wie sie reagieren, wenn jemand nach Adresse, Schule, Passwörtern fragt oder wissen will, ob sie allein sind:
Stopp sagen und nicht in Panik geraten.
Nach dem Codewort fragen.
Das Gespräch beenden.
Selbst die Eltern oder eine bekannte Vertrauensperson anrufen.
Niemals sofort handeln - auch nicht, wenn die Stimme offiziell klingt.
Üben lässt sich das am besten in kleinen Rollenspielen. Ein Elternteil spielt den Betrüger, das Kind übt: ruhig bleiben, nach dem Codewort fragen, auflegen und selbst die Eltern anrufen. Es geht nicht um Perfektion, sondern darum, kurz zu stoppen und nicht automatisch zu antworten.
Was Awareness-Teams daraus mitnehmen sollten
Für CISOs und Awareness-Verantwortliche ist die wichtigste Lehre: Die Frage "Ist diese Stimme echt?" lässt sich am Telefon nicht mehr zuverlässig beantworten. Schulungen, die auf das Erkennen von Deepfakes setzen, greifen deshalb zu kurz. Wirksamer sind klare, einfache Abläufe, die unabhängig davon funktionieren, wie überzeugend ein Anrufer klingt.
Dazu gehört: Mitarbeitende brauchen eine leicht auffindbare, offizielle Rufnummer für Rückfragen, die Erlaubnis, auch vermeintlich hochrangige Anrufer abzuweisen, und einen niedrigschwelligen Meldeweg - ausdrücklich auch für Anrufe, bei denen nichts passiert ist. Jede Meldung hilft, eine laufende Welle früh zu erkennen und Kolleginnen und Kollegen zu warnen.
Wie schnell aus einem einzigen installierten „Tool“ ein ernster Sicherheitsvorfall werden kann, zeigt unser Impuls Ransomware. Und die Grundfrage aus Online-Dienste und KI-Tools gilt auch hier: Welche Informationen gebe ich heraus - und an wen eigentlich?
Fazit
KI-Agenten sind nicht automatisch gefährlich. In den Händen von Betrügern machen sie Social Engineering aber schneller, glaubwürdiger und skalierbarer. Eine Stimme, eine Behörde, ein dringender Download - mehr braucht es nicht, wenn niemand innehält.
Vertrauen Sie nicht blind der Stimme. Vertrauen Sie dem Prozess: nicht diskutieren, nichts klicken, auflegen, offiziell zurückrufen und im Unternehmen melden.
Quellen
Google Threat Intelligence Group / Mandiant, 24. September 2025: "Another BRICKSTORM: Stealthy Backdoor Enabling Espionage into Tech and Legal Sectors"; CISA, NSA und Canadian Centre for Cyber Security, 4. Dezember 2025: Malware Analysis Report "BRICKSTORM Backdoor" (AR25-338A).
CISA, 12. Juni 2024: Warnung vor Betrügern, die sich telefonisch als CISA-Mitarbeitende ausgeben.
FBI / IC3, 15. Mai 2025: Public Service Announcement "Senior US Officials Impersonated in Malicious Messaging Campaign" (I-051525-PSA).
Fang, Bowman, Kang u. a. (University of Illinois Urbana-Champaign), Oktober 2024: "Voice-Enabled AI Agents can Perform Common Scams", arXiv:2410.15650; Abnormal Security, 16. April 2026: "AI Meets Voice Phishing: How ATHR Automates the Full TOAD Attack Chain".