Ob es also gelingen wird, das Handeln agentischer KIs durch die Vorgabe einer Art „Verfassung“ im Zaum zu halten, kann ich nicht beurteilen, nur hoffen. Denn wie das Beispiel zeigt, basiert die Methode – genau wie mein Prompt für Claude – auf ganz konkret formulierten Verboten. Ist es aber überhaupt möglich, einer KI eine Verbotsliste mitzugeben, die jegliches schädliche Verhalten enthält?
Zur KI-Apokalypse: Besser als wir können Agenten nicht werden
Kommentare