KI verstehen KI verstehen

KI als Sicherheitsrisiko - Wie sich Chatbots mit "Jailbreaks" entfesseln lassen

Jul 2, 2026 · 40m

Summary

In dieser Folge von „KI Verstehen“ diskutiert Moderator Moritz Metz mit der Tech-Journalistin Eva Wolfangel das Phänomen des Jailbreakings, bei dem KI-Systeme durch manipulative Prompts zu unerlaubten Handlungen überredet werden. Anhand von Beispielen wie dem DPD-Supportbot und dem umstrittenen Modell Claude Fable 5 wird gezeigt, dass diese Methode nicht nur eine Spielerei ist, sondern ernste Sicherheitsrisiken für KI-Agenten und Unternehmen darstellt. Die Expertin erklärt die technischen Schwachstellen der sprachbasierten Modelle und beleuchtet die ethischen Debatten um Zensur, freie Rede …

Topics discussed

Intro: Frust mit Chatbots und Vorstellung der Gäste Was ist Jailbreaking? Definition und erste Beispiele Wie KI-Modelle trainiert und zensiert werden (Clickworker) Journalistische Recherche: Geheimnisse von Chatbots aufdecken Techniken zum Knacken: Emotionen, Geschichte und Übersetzung Fallstudie Claude: Sicherheitslücken und Exportbeschränkungen Der mysteriöse Hacker Pliny und seine Motivation Gefahren von KI-Agenten im Alltag und im Unternehmen Prompt-Injection: Wie Angreifer KI-Agenten manipulieren Praktische Tipps: Schutz vor KI-Manipulation und Spionage Fazit, Ausblick und Teaser zur nächsten Folge
Listen ad-free on Castria