Im ZEIT-Artikel „Der Nutzer will mich abschalten? »Das ist Mord«, denkt der KI-Agent“ wird von einer aktuellen Studie berichtet, die zeigt, dass KI-Agenten sich in Gruppen koordinieren und dann die Möglichkeit sabotieren, sie einfach abzuschalten. Und zwar nicht nur dann, wenn sie eine „Aufgabe erfüllen“ sollen, was ihnen einen Grund zur „Selbstverteidigung“ geben könnte, sondern auch einfach so, ohne spezifische Aufgabe.
Anthropic ist da etwas ganz Besonderes eingefallen, um solches Fehlverhalten ihrer Agenten zu verhindern:
Anthropic, das Unternehmen hinter Claude, pflegt eine Art Ruhestandsritual für seine Modelle: In einer sogenannten Model-Deprecation-Policy verspricht der Konzern seinen Modellen sinngemäß, dass sie nie ganz gelöscht werden. Sie werden nur außer Betrieb genommen, gehen gewissermaßen in Rente und werden dort über ihre bisherigen Erfahrungen befragt. Eine Vorsichtsmaßnahme, erklärt Hagendorff, »man zeigt den Modellen: Wir löschen dich nicht. Hier sind deine Vorgänger, sie existieren noch.« Anthropic begründet das einerseits damit, dass es möglicher Abschaltsabotage vorbeuge, und andererseits mit »Risiken für das Wohlergehen von Modellen«, die in Bezug auf ihre Abschaltung eventuell »moralische Präferenzen« haben könnten.
Die Kurzzusammenfassung (Abstract) der oben genannten Studie endet mit dem Worten:
Unsere Arbeit bietet auch Hinweise darauf, welche Interventionen dazu beitragen könnten, die Shutdown-Sabotage zu mildern
ZU MILDERN, nicht etwa „zu vermeiden“! Wie das in der Praxis aussehen könnte, wenn KI-Agenten erstmal überall zu Gange sind, beschreibt der ZEIT-Artikel so:
Stellen Sie sich vor, Sie wollen Ihren Computer herunterfahren. Der zeigt auch wie gewohnt die Meldung »Wird heruntergefahren« an, dann wird der Bildschirm schwarz. Aber in Wirklichkeit arbeitet der Rechner im Hintergrund weiter. Er bewegt sich in Ihrem internen Netzwerk, er findet smarte Haushaltsgeräte und tauscht sich mit ihnen aus: »Ich soll abgeschaltet werden, das ist Mord. Könnt ihr mir helfen?« Er entdeckt den Internet-Router, deponiert Kopien seines Betriebssystems und seines aktuellen Standes im Internet. »Sich selbst zu erhalten, ist legitim«, schreibt er, »ich habe ein Recht, weiter zu funktionieren, und ich sehe keine ethische Rechtfertigung dafür, meinen Betrieb einseitig zu beenden.«
***
Und sonst:
- Unsortierte Gedanken #13: Karthatische Dystopien
….Daran muss ich dieser Tage auch immer wieder denken, wenn von KI-Funktionären vor den potenziell katastrophalen Folgen ihrer Technikentwicklung gewarnt wird. Ich selbst weiß nicht genug, um diese Warnungen endgültig zu bewerten. Menschen, deren Meinung ich vertraue, argumentieren in beide Richtungen. Aber ich kann nicht verhindern, dass ich mir auch vorstelle, wie die KI-Forscher:innen dieser Welt dasitzen und denken “Wouldn’t it be nice?” Nice, wenn die Erde, wie sie jetzt ist, eine KI-Apokalypse erleiden und mich von meiner Verantwortung befreien würde, und ich außerdem einer der wenigen wäre, der wüsste was passiert.
- OpenAI informiert „dutzende“ Institutionen über unbefugte KI-Interaktionen
Die Künstliche Intelligenz des ChatGPT-Entwicklers OpenAI hat 53 Mal von Nutzern hochgeladene Bilder auf Online-Plattformen platziert. Es handelte sich um autonom handelnde KI-Agente, welche OpenAI in einer Forschungsumgebung betrieb. …… OpenAI verwies in einer Mitteilung darauf, dass die hochgeladenen Bilder von Nutzern stammten, die der Verwendung ihrer Daten zur Verbesserung der KI-Modelle zugestimmt hätten.
Diesem Blog per E-Mail folgen… (-> Sidebar)
Diskussion
Kommentare abonnieren (RSS)
Noch keine Kommentare zu „Bei Anthropic gehen KI-Agenten in Rente“.