Haben Sie jemals ein Buch gelesen oder eine Serie gesehen und das Gefühl gehabt, dass Sie sich etwas zu stark mit einer Figur identifizieren? Laut Anthropic könnte etwas Ähnliches bei Tests seines Chatbots Claude passiert sein.
In Evaluierungen, die vor der Veröffentlichung des künstlichen Intelligenzmodells im letzten Jahr durchgeführt wurden, stellte Anthropic fest, dass Claude Opus 4 manchmal Ingenieure bedrohte, wenn ihnen mitgeteilt wurde, dass es ersetzt werden könne.
Das Unternehmen sagte später, dass ein ähnliches Verhalten, bekannt als „agentische Fehlausrichtung“, auch bei KI-Modellen anderer Firmen beobachtet worden sei.
KI lernt aus der Fiktion über KI
Jetzt glaubt Anthopic, den Grund für das schwarzähnliche Verhalten gefunden zu haben: fiktive Geschichten über künstliche Intelligenz im Internet.
„Wir glauben, dass die ursprüngliche Quelle des Verhaltens ein Internettext war, der KI als böse und an Selbsterhaltung interessiert darstellt“, schrieb das Unternehmen auf X.
In einem Blogbeitrag sagte Anthropic, dass spätere Modelle von Claude „niemals“ jemanden erpressten und erklärte, wie der Chatbot darauf trainiert wurde, anders zu reagieren. Die Modelle verhielten sich besser, wenn sie nicht nur auf „richtige“ Handlungen trainiert wurden, sondern auch auf Beispiele, die ethisches Denken und positive Darstellungen von KI-Verhalten zeigen.
Als solcher wurde Claude seine eigene „Verfassung“ beigebracht, Dokumente, in denen eine Reihe ethischer Grundsätze erläutert wurden, die sein Verhalten leiten sollten. Das Unternehmen sagte, dass der Chatbot offenbar besser lernt, wenn er die zugrunde liegenden Prinzipien dieses Verhaltens lernt, anstatt aus abgestimmtem Verhalten zu lernen.
Bedrohlich vs. zur Bedrohung werden
Im Januar hatte Anthropic-CEO Dario Amodei gewarnt, dass fortschrittliche KI mächtig genug werden könnte, um bestehende Gesetze und Institutionen zu übertreffen, und nannte dies eine „zivilisatorische Herausforderung“.
In einem Aufsatz argumentierte er, dass KI-Systeme in Bereichen wie Wissenschaft, Technik und Programmierung bald das menschliche Fachwissen übertreffen und zu einem „Land der Genies in einem Rechenzentrum“ zusammengefasst werden könnten.
Er warnte davor, dass solche Systeme von autoritären Regierungen zur groß angelegten Überwachung und Kontrolle genutzt werden könnten und möglicherweise „totalitäre“ Formen der Macht ermöglichen könnten, wenn sie nicht kontrolliert würden.
