KI als Sicherheitsrisiko - Wie sich Chatbots mit "Jailbreaks" entfesseln lassen
Jul 2, 2026 · 40m
Summary
In dieser Folge von „KI Verstehen“ diskutiert Moderator Moritz Metz mit der Tech-Journalistin Eva Wolfangel das Phänomen des Jailbreakings, bei dem KI-Systeme durch manipulative Prompts zu unerlaubten Handlungen überredet werden. Anhand von Beispielen wie dem DPD-Supportbot und dem umstrittenen Modell Claude Fable 5 wird gezeigt, dass diese Methode nicht nur eine Spielerei ist, sondern ernste Sicherheitsrisiken für KI-Agenten und Unternehmen darstellt. Die Expertin erklärt die technischen Schwachstellen der sprachbasierten Modelle und beleuchtet die ethischen Debatten um Zensur, freie Rede …
Topics discussed
Intro: Frust mit Chatbots und Vorstellung der Gäste
Was ist Jailbreaking? Definition und erste Beispiele
Wie KI-Modelle trainiert und zensiert werden (Clickworker)
Journalistische Recherche: Geheimnisse von Chatbots aufdecken
Techniken zum Knacken: Emotionen, Geschichte und Übersetzung
Fallstudie Claude: Sicherheitslücken und Exportbeschränkungen
Der mysteriöse Hacker Pliny und seine Motivation
Gefahren von KI-Agenten im Alltag und im Unternehmen
Prompt-Injection: Wie Angreifer KI-Agenten manipulieren
Praktische Tipps: Schutz vor KI-Manipulation und Spionage
Fazit, Ausblick und Teaser zur nächsten Folge
Listen ad-free on Castria