Newsletter Anmeldung

Bleiben Sie mit dem Newsletter immer up to date.

Anfrage
arrow-to-top

Rahmenkonvention des Europarats über künstliche Intelligenz

Kontext, Regulierungsansatz und Umfang der Verpflichtungen

07/2026

I. Einleitung

Die von Systemen der künstlichen Intelligenz (KI) ausgehenden Risiken haben die Staaten dazu veranlasst, regulatorische Massnahmen zu ergreifen. Die EU hat ihre Verordnung über künstliche Intelligenz (im Folgenden: KI-Gesetz) verabschiedet, die als erster umfassender Rahmen zur Regulierung von KI gepriesen wurde. Das KI-Gesetz ist bereits in Kraft getreten, und obwohl die Auswirkungen vieler seiner Bestimmungen noch besser verstanden werden müssen, war das KI-Gesetz bereits Gegenstand nützlicher Kommentare und Analysen. Ähnlich wie die EU hat auch der Europarat (im Folgenden: CoE) kürzlich das Rahmenübereinkommen über künstliche Intelligenz und Menschenrechte, Demokratie und Rechtsstaatlichkeit (im Folgenden: CoE-KI-Übereinkommen) verabschiedet. Zum Zeitpunkt der Abfassung dieses Artikels ist der Vertrag noch nicht in Kraft getreten. Er wurde von elf Mitgliedstaaten des Europarats sowie von der EU, den Vereinigten Staaten von Amerika, Kanada, Japan, Uruguay und Israel unterzeichnet. Bislang hat noch kein Staat ihn ratifiziert.

Die CoE-KI-Konvention definiert ein KI-System als «maschinenbasiertes System, das für explizite oder implizite Ziele aus den ihm zugeführten Eingaben ableitet, wie es Ausgaben wie Vorhersagen, Inhalte, Empfehlungen oder Entscheidungen generieren kann, die physische oder virtuelle Umgebungen beeinflussen können». Diese Definition stimmt mit der in Artikel 3 Absatz 1 des KI-Gesetzes verankerten Definition überein. Sie gilt als relativ weit gefasst und soll mit künftigen technologischen Entwicklungen Schritt halten. Vor dem Hintergrund dieser Definition liefert dieser Artikel eine erste Analyse der KI-Konvention des Europarats. Dabei werden vier Schritte verfolgt. Der erste betont die Notwendigkeit, die KI-Konvention des Europarats im Kontext ihrer Verabschiedung als internationaler Vertrag zu verstehen, der innerhalb des Europarats ausgehandelt wurde (Abschnitt II). Dieser Kontext hat den persönlichen Geltungsbereich des Vertrags beeinflusst, indem er die Regulierung der Nutzung von KI-Systemen sowohl durch öffentliche Behörden als auch durch private Akteure umfasst. Eine detKIllierte Prüfung der verfügbaren Verhandlungsdokumente zeigt, dass das konkrete Schutzniveau der KI-Konvention des Europarats reduziert wurde, nicht zuletzt durch die endgültige Entscheidung der Verfasser, private Akteure nur indirekt zu regulieren. Abschnitt III erläutert diesen persönlichen Geltungsbereich der Konvention, unter anderem durch die Beschreibung der Verhandlungsgespräche zur Regulierung von Behörden und privaten Akteuren. Diese Regulierung folgt einem risikobasierten Ansatz, der die von den Staaten im Rahmen des Vertrags eingegangenen Verpflichtungen prägt. Abschnitt IV erläutert den risikobasierten Ansatz und stellt ihn dem Ansatz des EU-KI-Gesetzes gegenüber. Es wird argumentiert, dass das Fehlen expliziter Risikokategorien im Vertrag dessen höheres Abstraktionsniveau widerspiegelt, was jedoch keine schwächeren Verpflichtungen nach sich zieht. Abschnitt V erläutert die in der Konvention formulierten Grundsätze, die die von den Staaten eingegangenen Verpflichtungen prägen sollen. Es wird argumentiert, dass diese Grundsätze, nämlich Menschenwürde und individuelle Autonomie, Transparenz und Aufsicht, Rechenschaftspflicht, Nichtdiskriminierung, Datenschutz, Zuverlässigkeit und Risikomanagement, als Auslegungsinstrumente für die Gestaltung der Entwicklung von Menschenrechtsstandards dienen können.

Eine Anmerkung zur Methodik ist angebracht. Als internationaler Vertrag unterliegt das KI-Übereinkommen des Europarats der Vertragsauslegung gemäss den in den Artikeln 31 und 32 des Wiener Übereinkommens über das Recht der Verträge (Wiener Übereinkommen) formulierten Auslegungsregeln. Gemäss Artikel 31 Absatz 1 des Wiener Übereinkommens ist der Vertrag «nach der gewöhnlichen Bedeutung auszulegen, die den Vertragsbegriffen in ihrem Zusammenhang und im Lichte des Vertragsgegenstands und des Vertragszwecks zukommt». Artikel 1 Absatz 1 der KI-Konvention des Europarats definiert den Gegenstand und Zweck des Vertrags als die Gewährleistung, «dass die Aktivitäten im Lebenszyklus von Systemen der künstlichen Intelligenz in vollem Umfang mit den Menschenrechten, der Demokratie und der Rechtsstaatlichkeit im Einklang stehen». Die Menschenrechtsnormen bilden daher einen integralen Bestandteil der Auslegung des Vertrags, was die Bezugnahme auf Menschenrechte in der folgenden Analyse rechtfertigt. Es wird kein Versuch unternommen, eine umfassende Analyse darüber zu liefern, wie die Bestimmungen des Vertrags im Lichte der Menschenrechtsnormen ausgelegt werden könnten. Tatsächlich müssen sich die Menschenrechtsnormen in diesem Bereich erst noch mit einer gewissen Präzision entwickeln. Die in der KI-Konvention des Europarats zum Ausdruck gebrachten Grundsätze können zur Weiterentwicklung der Menschenrechtsnormen beitragen. In diesem Sinne ist eine wechselseitige Wechselwirkung zwischen dem Vertrag und den Menschenrechtsnormen zu erwarten.

Gemäss Artikel 31 Absatz 3 Buchstabe c des Wiener Übereinkommens können bei der Auslegung des Vertrags auch «alle einschlägigen Regeln des Völkerrechts, die in den Beziehungen zwischen den Vertragsparteien anwendbar sind», berücksichtigt werden. Das EU-Recht und insbesondere das EU-KI-Gesetz können als Quelle einschlägiger Regeln angesehen werden. Daher wird ein integrierter Auslegungsansatz verfolgt, bei dem nicht nur die Menschenrechtsnormen relevant sind, sondern das Recht des Europarats und das EU-Recht allgemeiner im Lichte des jeweils anderen verstanden werden müssen. Tatsächlich gibt es eine Vielzahl von Quellen, die auf europäischer Ebene gelten, und diese müssen auf integrierte Weise ausgelegt werden. Auch wenn in diesem Artikel kein Versuch eines umfassenden Vergleichs unternommen wird, bietet das EU-KI-Gesetz doch wichtige Anhaltspunkte für ein besseres Verständnis des KI-Übereinkommens des Europarats. Abschnitt IV bietet einen detKIllierteren Vergleich mit dem EU-KI-Gesetz hinsichtlich der Bedingungen für die Einstufung von Systemen als risikoreich gemäss dem Gesetz. Der Grund dafür ist, dass gerade diese Einstufung auf einer allgemeineren konzeptionellen Ebene als zentraler Kontrastpunkt in Bezug darauf angesehen werden kann, wie KI-Systeme auf europäischer Ebene (d. h. durch den Europarat und durch die EU) reguliert wurden. Dies rechtfertigt eine eingehendere vergleichende Analyse, wie sie in Abschnitt IV angeboten wird.

Wie bei anderen Verträgen des Europarats ist der zusammen mit dem Vertrag veröffentlichte Erläuternde Bericht eine wichtige Quelle für ein besseres Verständnis der möglichen Auslegung dieser Verpflichtungen. Die vom Ad-hoc-Ausschuss des Europarats für KI erstellte Machbarkeitsstudie, in der die Verabschiedung eines neuen Europarat-Vertrags als Option vorgeschlagen wurde, dient als Massstab für die Ermittlung der beabsichtigten Ziele und die Bewertung, inwieweit diese angesichts der im endgültigen Text festgelegten Verpflichtungen erreicht wurden. Die Machbarkeitsstudie kann als Teil des historischen Hintergrunds des Übereinkommens betrachtet werden. Sie kann auch als Teil der Umstände des Vertragsabschlusses angesehen werden, die gemäss Artikel 32 des Wiener Übereinkommens über das Recht der Verträge als ergänzendes Mittel zur Vertragsauslegung herangezogen werden können. Die während der Verhandlungen veröffentlichten Vertragsentwürfe sind ebenfalls in die Analyse einbezogen. Diese Entwürfe sind Teil der Vorarbeiten zum Vertrag, die ebenfalls ein ergänzendes Mittel zur Vertragsauslegung darstellen. Diese Mittel, die auf Schlüsseldokumenten wie der Machbarkeitsstudie, den Entwürfen und dem Erläuternden Bericht basieren, dienen der Auslegung und dem besseren Verständnis der im KI-Übereinkommen des Europarats formulierten Grundsätze, nämlich Menschenwürde und individuelle Autonomie, Transparenz und Aufsicht, Rechenschaftspflicht, Nichtdiskriminierung, Datenschutz, Zuverlässigkeit und Risikomanagement.

II. Der Kontext und der Entstehungsprozess

Ähnlich wie das KI-Gesetz wurde die KI-Rahmenkonvention des Europarats einerseits von den «beispiellosen Möglichkeiten» inspiriert, die KI bieten könnte, unter anderem durch die Verbesserung der Effizienz von Verwaltungsverfahren, und andererseits von den Risiken, die solche Systeme für die Menschenrechte darstellen könnten. Im Gegensatz zum KI-Gesetz ist die KI-Rahmenkonvention des Europarats jedoch kein Produktsicherheitsregime. Die KI-Konvention des Europarats muss vor dem Hintergrund des umfassenderen Mandats der Organisation verstanden werden, in deren Rahmen sie verabschiedet wurde. Das Mandat des Europarats konzentriert sich insbesondere auf den Schutz der Menschenrechte, der Demokratie und der Rechtsstaatlichkeit. Dies spiegelt sich auch deutlich in Artikel 1 Absatz 1 wider, der festlegt, dass der Vertrag darauf abzielt, «sicherzustellen, dass Aktivitäten im Lebenszyklus von KI-Systemen in vollem Umfang mit den Menschenrechten, der Demokratie und der Rechtsstaatlichkeit im Einklang stehen».

Das Mandat des Europarats prägte die Entstehung des Vertrags und ermöglichte die Einbeziehung verschiedener Akteure. Insbesondere lassen sich die Ursprünge des Vertrags bis in den MKI 2019 zurückverfolgen, als das Ministerkomitee des Europarats im Rahmen des « » die Notwendigkeit erkannte, «auf der Grundlage von Konsultationen mit verschiedenen Interessengruppen die Machbarkeit und mögliche Elemente eines Rechtsrahmens für die Entwicklung, Gestaltung und Anwendung künstlicher Intelligenz zu prüfen, der auf den Standards des Europarats zu Menschenrechten, Demokratie und Rechtsstaatlichkeit basiert». Im September 2019 setzte das Ministerkomitee offiziell den Ad-hoc-Ausschuss für künstliche Intelligenz (CAHKI) ein, ein Gremium, das mit der Durchführung einer Machbarkeitsstudie beauftragt wurde, um die Möglichkeit der Verabschiedung eines solchen Rechtsrahmens zu prüfen. Gemäss dem erteilten Mandat sollte diese Prüfung auf breit angelegten Konsultationen mit verschiedenen Interessengruppen basieren, wodurch die Einbeziehung vielfältiger Perspektiven und Anliegen im Zusammenhang mit KI sichergestellt werden könnte. Im Dezember 2020 veröffentlichte das CAHKI seine Machbarkeitsstudie, in der, wie ursprünglich vorgesehen, vielfältige Perspektiven dargestellt und die Grundlagen für einen neuen Vertrag des Europarats geschaffen wurden. Eine in der Studie vorgeschlagene Option war die Verabschiedung eines Rahmenübereinkommens anstelle eines Übereinkommens. Letzteres erlegt konkretere Verpflichtungen auf und gewährt natürlichen oder juristischen Personen Rechte. Ein Rahmenübereinkommen hingegen ist weniger präskriptiv und detKIlliert; es sieht «allgemeine Kernprinzipien und Werte» vor und lässt «den Staaten einen beträchtlichen Ermessensspielraum hinsichtlich der Umsetzung dieser allgemeinen Prinzipien und Werte». Letzteres hatte drei Vorteile: Erstens könnten detKIllierte rechtliche Verpflichtungen für KI-Systeme verfrüht sein; zweitens wären die Staaten eher bereit, sich binden zu lassen; drittens könnte eine starre Regulierung Innovationen behindern. Die Auswirkungen der Entscheidung für ein Rahmenübereinkommen werden in der folgenden Analyse deutlicher werden.

Nach Abschluss des Mandats der CAHKI setzte das Ministerkomitee den Ausschuss für künstliche Intelligenz (CKI) ein mit der Aufgabe, «einen internationalen Verhandlungsprozess einzuleiten und Arbeiten zur Fertigstellung eines geeigneten Rechtsrahmens für die Entwicklung, Gestaltung, Nutzung und Stilllegung künstlicher Intelligenz durchzuführen, basierend auf den Standards des Europarats zu Menschenrechten, Demokratie und Rechtsstaatlichkeit». Es ist wichtig, den Arbeitsprozess des CKI zu verstehen. Diese Arbeit wurde in Plenarsitzungen und Sitzungen der Redaktionsgruppen durchgeführt. Was die Plenarsitzungen betrifft, so fanden zehn solcher Sitzungen statt. Die öffentlich zugänglichen Dokumente aus diesen Sitzungen geben keinen Einblick in die Positionen der verschiedenen beteiligten Staaten. Die Sitzungen der Redaktionsgruppen waren der Geheimhaltung unterworfen. Abgesehen von den vier Entwürfen, die das CKI im Laufe des Prozesses zur Veröffentlichung freigab, «sind die Vorarbeiten [zur KI-Konvention des Europarats], einschliesslich der Positionen der verschiedenen Staaten, nicht öffentlich zugänglich».

Selbst in Bezug auf die während des Prozesses veröffentlichten Entwürfe wurden Vorbehalte hinsichtlich des Wertes dieser Entwürfe geäussert. Es gab zudem starke Kritik seitens der CKI an jeglichen Verstössen gegen die Vertraulichkeit des Prozesses.

Was die während des Entwurfsprozesses zur Verfügung gestellten Entwürfe betrifft, so wurde der Zero Draft am 30. Juni 2022 veröffentlicht. Im Februar 2023 wurde ein überarbeiteter Zero Draft veröffentlicht. Im Juli 2023 wurde ein konsolidierter Arbeitsentwurf der Konvention veröffentlicht. Im Dezember 2023 wurde ein Entwurf vor der Schlusslesung veröffentlicht. Der endgültige Entwurf wurde im März 2024 von der CKI angenommen und später vom Ministerkomitee gebilligt.

Der Zero Draft und der überarbeitete Zero Draft (im Folgenden, soweit relevant, gemeinsam als «Zero Drafts» bezeichnet) waren inhaltlich weitgehend identisch. Wesentliche Änderungen wurden im konsolidierten Arbeitsentwurf eingeführt, der im Juli 2023 veröffentlicht wurde. Diese Änderungen heben die wichtigsten Streitpunkte hervor, auf die in der nachstehenden Analyse im Zusammenhang mit bestimmten Bestimmungen eingegangen wird. Es ist anzumerken, dass zwar am Entwurfsprozess – wie im Mandat des Europarats vorgesehen – eine Vielzahl von Akteuren beteiligt war, darunter auch Akteure der Zivilgesellschaft, die Beiträge zu den Entwürfen leisteten, der Prozess jedoch letztlich von den Staaten geleitet und geprägt wurde. Auch die EU war beteiligt. Entscheidend ist, dass auch Staaten, die nicht Mitglieder des Europarats sind, wie beispielsweise die USA, einbezogen wurden. Ein solch globaler Ansatz wurde ursprünglich von CAHKI empfohlen. Es wurde jedoch festgestellt, dass die Beteiligung von Staaten wie den USA die Schutzvorkehrungen verwässerte und zum Ausschluss der Zivilgesellschaft führte.

Der genaue Einfluss einzelner Staaten – einschliesslich Nicht-Mitgliedstaaten des Europarats – auf den Entwurfsprozess ist schwer zu dokumentieren. Die Positionen der Staaten zur Bedeutung bestimmter Vertragsbestimmungen wurden nicht veröffentlicht, was die Auslegung erschwert. Es ist jedoch wichtig zu betonen, dass diese Merkmale des Entwurfsprozesses – einschliesslich seines vertraulichen Charakters – nicht einzigartig für die KI-Konvention des Europarats sind. Vielmehr spiegeln sie allgemeinere Praktiken im Rahmen der Vertragsgestaltung des Europarats wider. Als solches sollte die KI-Konvention in diesem institutionellen Kontext verstanden werden.

Für dieses Verständnis ist es relevant zu beachten, dass bereits in den 1960er Jahren ein Vorschlag, die «Travaux préparatoires» der Europarat-Konventionen – und damit auch die Verhandlungspositionen der Staaten – zu veröffentlichen, abgelehnt wurde. Gleichzeitig wurde jedoch auch vereinbart, dass «es angebracht wäre, einen Bericht zu veröffentlichen, der, ohne die Haltungen der verschiedenen Experten der Regierungsdelegationen während der Verhandlungen preiszugeben, so beschaffen wäre, dass er die Anwendung der Bestimmungen erleichtert». So wurde beschlossen, dass der Expertenausschuss (im Zusammenhang mit der KI-Konvention des Europarats war dies der CKI), der den Konventionsentwurf ausarbeitete, auch einen erläuternden Bericht vorlegen sollte.

An dieser Stelle stellt sich die Frage nach der Rolle des Erläuternden Berichts bei der Auslegung des Vertrags. Der Bericht stellt keine massgebliche Auslegung des Textes dar. Dies kommt im zweiten Satz des Erläuternden Berichts zur KI-Konvention des Europarates zum Ausdruck: «Der dem Ministerkomitee des Europarates vorgelegte Text des Erläuternden Berichts stellt kein Instrument dar, das eine verbindliche Auslegung des Textes der Rahmenkonvention liefert, auch wenn er das Verständnis ihrer Bestimmungen erleichtern kann.» Da der Vertragstext und der Bericht gleichzeitig ausgehandelt und angenommen werden, kann der Bericht als ergänzendes Mittel zur Vertragsauslegung im Sinne von Artikel 32 des Wiener Übereinkommens über das Recht der Verträge angesehen werden. Der Bericht kann auch als Teil des Kontextes betrachtet werden, in dem die Bedeutung bestimmter Bestimmungen im Sinne von Artikel 31 Absatz 1 des Wiener Übereinkommens zu ermitteln ist. In der folgenden Analyse wird der Erläuternde Bericht zusammen mit den verfügbaren Entwürfen und der Machbarkeitsstudie – die gemeinsam Aufschluss über «die Vorarbeiten zum Vertrag und die Umstände seines Abschlusses» geben – als wichtige Quelle für die Auslegung der Vertragsbestimmungen dienen. Ein entscheidender erster Schritt in diesem Prozess ist die Klärung des persönlichen Geltungsbereichs des Vertrags.

III. Geltungsbereich: öffentliche Behörden und private Akteure

1. Verhandlungen über den Geltungsbereich

Wie die öffentlich zugänglichen Entwürfe zeigen, war der persönliche Geltungsbereich des Übereinkommens Gegenstand erheblicher Änderungen. Insbesondere enthielten die Nullentwürfe die Begriffe «KI-Anbieter», «KI-Nutzer» und «KI-Betroffener». Diese wurden im konsolidierten Arbeitsentwurf gestrichen. Die Verweise auf «KI-Anbieter» und «KI-Nutzer» ermöglichten es den Nullentwürfen, private Akteure direkt zu regeln, was sich auch im vorgeschlagenen persönlichen Geltungsbereich des Übereinkommens widerspiegelte. Insbesondere enthielt der vorgeschlagene Anwendungsbereich die Klarstellung, dass das Übereinkommen gilt, «unabhängig davon, ob diese Tätigkeiten [Entwurf, Entwicklung und Anwendung von KI-Systemen] von öffentlichen oder privaten Akteuren ausgeübt werden». Diese direkte Regulierung privater Akteure wurde mit dem konsolidierten Arbeitsentwurf gestrichen. Diese Streichung wurde in der endgültigen Fassung des Textes beibehalten.

Das Konzept des «KI-Subjekts» ermöglichte es den Zero Drafts, mehrere Verweise auf konkrete Rechte der «KI-Subjekte» zu enthalten. Relevante Beispiele hierfür sind: das Recht auf Zugang zu den entsprechenden Aufzeichnungen des KI-Systems; das Recht auf menschliche Überprüfung; und das Recht zu wissen, dass man mit einem KI- t. Solche konkreten Formulierungen von Rechten wurden mit dem Consolidated Working Draft gestrichen. Diese Streichung wurde in der endgültigen Fassung des Textes beibehalten.

2. Verständnis des Geltungsbereichs

Um den Geltungsbereich des Vertrags besser zu verstehen, wird in den folgenden Abschnitten erläutert, wie die Nutzung von KI-Systemen durch öffentliche Behörden (Abschnitt III.2.a), durch private Akteure, deren Verhalten dem Staat zuzurechnen ist (Abschnitt III.2.b), und durch private Akteure, deren Verhalten dem Staat nicht zuzurechnen ist (Abschnitt III.2.c), geregelt ist.

a. Öffentliche Behörden

Das KI-Übereinkommen des Europarats regelt das Verhalten von Staaten, nicht direkt das von privaten Akteuren, was es vom EU-KI-Gesetz unterscheidet, das sowohl private als auch öffentliche Anbieter und Betreiber von KI-Systemen direkt regelt. Wie andere Übereinkommen des Europarats, bei denen es sich um internationale Verträge handelt, mit denen Staaten sich verpflichten, völkerrechtliche Verpflichtungen zu übernehmen, gilt der Vertrag für seine Vertragsstaaten. Dies bedeutet, dass er für öffentliche Behörden gilt. Artikel 3 Absatz 1 Buchstabe a des Vertrags sieht vor, dass «jede Vertragspartei dieses Übereinkommen auf die Tätigkeiten im Lebenszyklus von KI-Systemen anwendet, die von Behörden durchgeführt werden, […]». Dies folgt den Regeln des allgemeinen Völkerrechts. Insbesondere entspricht es Artikel 4 der Artikel der Völkerrechtskommission (ILC) über die Verantwortlichkeit von Staaten für völkerrechtswidrige Handlungen, der vorsieht, dass «das Verhalten eines jeden staatlichen Organs als Handlung dieses Staates im Sinne des Völkerrechts anzusehen ist, unabhängig davon, ob das Organ legislative, exekutive, justizielle oder sonstige Funktionen ausübt, welche Stellung es in der staatlichen Organisation einnimmt und welchen Charakter es als Organ der Zentralregierung oder einer Gebietseinheit des Staates hat.» Die im Erläuternden Bericht zum KI-Übereinkommen des Europarats enthaltenen Klarstellungen folgen demselben Grundsatz: «Die Verfasser sind sich einig, dass der Begriff ‹öffentliche Behörde› jede öffentlich-rechtliche Einrichtung jeglicher Art und auf jeder Ebene (einschliesslich supranationaler, staatlicher, regionaler, provinzieller, kommunaler und unabhängiger öffentlicher Einrichtungen) […] bezeichnet.»

b. Private Akteure, deren Verhalten dem Staat zuzurechnen ist

Artikel 3 Absatz 1 Buchstabe a des Übereinkommens fügt jedoch hinzu, dass die Vertragsparteien das Übereinkommen auch auf Tätigkeiten anwenden, die von «privaten Akteuren, die in ihrem [der öffentlichen Behörden] Auftrag handeln», ausgeübt werden. Der Erläuternde Bericht stellt klar, dass dies bedeutet, dass das Übereinkommen Verpflichtungen auferlegt «in Bezug auf Tätigkeiten, für die öffentliche Behörden ihre Zuständigkeiten an private Akteure delegieren oder diese anweisen zu handeln, wie beispielsweise Tätigkeiten privater Akteure, die im Rahmen eines Vertrags mit einer öffentlichen Behörde oder einer anderen privaten Erbringung öffentlicher Dienstleistungen tätig sind, sowie im Bereich des öffentlichen Beschaffungswesens und der Auftragsvergabe». Dies folgt auch den Regeln des allgemeinen Völkerrechts. Insbesondere entspricht es den Artikeln 5 und 8 der ILC-Artikel über die Verantwortlichkeit von Staaten für völkerrechtswidrige Handlungen.

Artikel 5 der ILC-Artikel über die Verantwortlichkeit von Staaten für völkerrechtswidrige Handlungen sieht vor, dass die Tätigkeiten von Stellen, die Elemente staatlicher Hoheitsgewalt ausüben, als Tätigkeiten des Staates gelten, sofern diese Stellen durch das Recht dieses Staates zur Ausübung von Elementen staatlicher Hoheitsgewalt ermächtigt sind und sie «in dieser Eigenschaft im konkreten Fall» handeln. Zwar verwenden die ILC-Artikel, Artikel 3 Absatz 1 Buchstabe a des KI-Übereinkommens des Europarats und der Erläuternde Bericht unterschiedliche Terminologie und Konzepte – was zu einer gewissen Unklarheit führt –, doch ist der Kernpunkt klar: Wenn öffentliche Behörden Aufgaben an private Akteure delegieren, die dann KI-Systeme einsetzen, bleibt das Übereinkommen anwendbar. In solchen Fällen tragen die öffentlichen Behörden die letztendliche Verantwortung, da der Einsatz von KI-Systemen dem Staat zugerechnet wird.

Was Artikel 8 der ILC-Artikel über die Verantwortlichkeit von Staaten für völkerrechtswidrige Handlungen betrifft, so sieht dieser vor, dass Tätigkeiten privater Einrichtungen als Tätigkeiten des Staates gelten, wenn diese privaten Einrichtungen bei der Ausübung dieser Tätigkeiten auf Anweisung des Staates oder unter dessen Leitung oder Kontrolle handeln. Dies steht im Einklang mit dem Wortlaut von Artikel 3 Absatz 1 Buchstabe a des KI-Übereinkommens des Europarats, der sich auf private Einrichtungen bezieht, die im Namen des Staates handeln. Es steht auch im Einklang mit der Formulierung im Erläuternden Bericht, der sich auf Situationen bezieht, in denen öffentliche Behörden private Akteure anweisen, Tätigkeiten durchzuführen. Wenn diese Tätigkeiten den Einsatz von KI-Systemen beinhalten, findet das Übereinkommen Anwendung.

Einfach ausgedrückt bedeutet all dies, dass es eine Gruppe privater Einrichtungen gibt, deren Verhalten dem Staat aufgrund einer Befugnisübertragung oder Kontrolle, die die Ausübung öffentlicher Gewalt impliziert, zuzurechnen ist. Alle Tätigkeiten im Lebenszyklus von KI-Systemen, die diese Einrichtungen ausführen, sind daher Tätigkeiten der Vertragsstaaten, und es gelten alle in der KI-Konvention des Europarats formulierten Verpflichtungen. In diesem Sinne gelten die Tätigkeiten dieser privaten Einrichtungen als Tätigkeiten des Staates. Eine mögliche strittige Frage ist hier die Auslegung der Begriffe «im Namen» der staatlichen Behörden handeln, «Befugnisse der öffentlichen Gewalt» und «Übertragung ihrer [der öffentlichen Behörden] Zuständigkeiten auf private Akteure». Die Kontroverse bezieht sich allgemeiner auf die Bedeutung von öffentlicher Gewalt und öffentlichen Befugnissen.

c. Private Akteure, deren Verhalten nicht dem Staat zuzurechnen ist

Artikel 3 Absatz 1 Buchstabe b des KI-Übereinkommens des Europarats befasst sich mit einer zweiten Gruppe privater Einrichtungen. Dabei handelt es sich um Einrichtungen, die nicht unter Artikel 3 Absatz 1 Buchstabe a des Vertrags fallen, und in diesem Sinne sind dies Einrichtungen, deren Verhalten dem Staat nicht zuzurechnen ist, da sie keine hoheitlichen Befugnisse ausüben. Das Verhalten dieser Einrichtungen ist nicht unmittelbar Gegenstand der Regelung durch den Vertrag. Vielmehr sind es die Vertragsstaaten, die «Risiken und Auswirkungen, die sich aus» den Aktivitäten dieser privaten Einrichtungen im Lebenszyklus von KI-Systemen ergeben, «behandeln müssen». Es sind die Staaten, die die Verpflichtung aus dem Vertrag übernehmen, «die Risiken und Auswirkungen zu behandeln».

Die Staaten haben zwei Möglichkeiten, wie sie dieser Verpflichtung nachkommen können. Erstens können Staaten beschliessen, die Grundsätze und Verpflichtungen des KI-Übereinkommens des Europarats auf die Aktivitäten privater Einrichtungen anzuwenden. Dies bedeutet, dass Staaten private Akteure auf nationaler Ebene regulieren können, indem sie diesen Anforderungen auferlegen, die ähnlich formuliert sind wie die Verpflichtungen im Vertrag. Dies könnte die Verabschiedung von Rechtsvorschriften beispielsweise privatrechtlicher Natur beinhalten, die sich auf Konzepte wie Menschenwürde, individuelle Autonomie, Zuverlässigkeit, Menschenrechte usw. beziehen, wie sie im Vertragstext verwendet werden, um private Akteure zu regulieren.

Zweitens können Staaten beschliessen, «andere geeignete Massnahmen zur Erfüllung der Verpflichtung» zu ergreifen, um Risiken und Auswirkungen anzugehen. Diese zweite Option scheint zu implizieren, dass Staaten bei der Regulierung von Risiken und Auswirkungen auf nationaler Ebene über einen grösseren Ermessensspielraum verfügen.

Letztendlich ist der Unterschied zwischen der ersten und der zweiten Option jedoch schwer klar zu unterscheiden. Der Erläuternde Bericht hält allgemein in Bezug auf Artikel 3 Absatz 1 Buchstabe b des KI-Übereinkommens des Europarats fest, dass dieser «die Verabschiedung oder Aufrechterhaltung geeigneter gesetzgeberischer, administrativer oder sonstiger Massnahmen zur Umsetzung dieser Bestimmung» erfordert. Der Erläuternde Bericht fügt zudem hinzu, dass

[…], die Verpflichtung nicht zwangsläufig zusätzliche Rechtsvorschriften erfordert und die Vertragsparteien andere geeignete Massnahmen, einschliesslich administrativer und freiwilliger Massnahmen, ergreifen können. Während die Verpflichtung also verbindlich ist und alle Vertragsparteien sie einhalten sollten, kann die Art der von den Vertragsparteien ergriffenen Massnahmen variieren.

Insgesamt werden private Akteure (die zur zweiten Gruppe gehören) also indirekt «aufgrund der den Staaten im Rahmen des KI-Übereinkommens des Europarats gewährten Rechte und von ihnen übernommenen Verpflichtungen» reguliert. Der Vertrag kann sich somit indirekt an private Akteure richten, was der Art und Weise sehr ähnlich ist, wie die Europäische Menschenrechtskonvention (im Folgenden EMRK) private Akteure indirekt regulieren kann. Es lässt sich daher argumentieren, dass die KI-Konvention des Europarats den Staaten positive Verpflichtungen zur Regulierung privater Akteure auferlegt. Zu diesen positiven Verpflichtungen gehören präventive Massnahmen, die darauf abzielen, Einzelpersonen im Voraus vor Schaden oder der Gefahr von Schaden zu schützen.

IV. Der risikobasierte Ansatz

Die durch den Vertrag auferlegten Verpflichtungen sind von einem risikobasierten Ansatz geprägt. Gemäss Artikel 1 Absatz 2 der KI-Konvention des Europarats müssen die Massnahmen zur Regulierung von KI-Systemen «abgestuft und differenziert sein, soweit dies angesichts der Schwere und der Wahrscheinlichkeit des Eintretens nachteiliger Auswirkungen auf die Menschenrechte, die Demokratie und die Rechtsstaatlichkeit während des gesamten Lebenszyklus von Systemen der künstlichen Intelligenz erforderlich ist». Der Ausdruck «nachteilige Auswirkungen auf die Menschenrechte» ist bemerkenswert und wirft die Frage nach dem Unterschied zwischen Risiken und «nachteiligen Auswirkungen» auf. Um die Sache noch verwirrender zu machen, bezieht sich die Konvention auch auf das «Potenzial, die Menschenrechte zu beeinträchtigen». Das Potenzial scheint dem Begriff des Risikos näher zu kommen. Letztendlich durchzieht eine analytische Verwirrung den Text der Konvention hinsichtlich der Rolle des Risikos bei der Konzeptualisierung von Schaden und den Massnahmen, die Schaden (oder das Risiko von Schaden) verhindern und beheben sollen. Wie Abschnitt V.2. zeigen wird, bestand diese Verwirrung von Beginn des Entwurfsprozesses an und untergräbt die Klarheit der von den Staaten eingegangenen Verpflichtungen.

Entscheidend ist an dieser Stelle, dass das Regulierungsmodell generell als risikobasiert charakterisiert werden kann. Daher verfolgt die KI-Konvention des Europarats, ähnlich wie das EU-KI-Gesetz, einen risikobasierten Ansatz: Die Massnahmen «müssen auf das Risikoniveau zugeschnitten sein, das ein System der künstlichen Intelligenz in den jeweiligen Bereichen, Tätigkeiten und Kontexten darstellt». Den Vertragsstaaten steht es frei, wie sie konkurrierende Interessen in den einzelnen Bereichen, Tätigkeiten oder Kontexten gegeneinander abwägen. Im Erläuternden Bericht wird jedoch angemerkt, dass der öffentliche Sektor möglicherweise einige Besonderheiten aufweist, die berücksichtigt werden müssen. Beispiele für diese Besonderheiten werden nicht genannt; vielmehr nennt der Erläuternde Bericht Beispiele für Bereiche des öffentlichen Sektors (d. h. Strafverfolgung, Migration, Grenzkontrolle, Asyl und Justiz), in denen von solchen Besonderheiten auszugehen ist. Er hebt zudem hervor, dass es in bestimmten Bereichen «Machtasymmetrien» gibt, bei denen bestimmte Gruppen innerhalb der Gesellschaft in einer schwächeren und schutzbedürftigen Position sind, was berücksichtigt werden muss.

Im Gegensatz zum EU-KI-Gesetz schafft die KI-Konvention des Europarats keine unterschiedlichen Risikostufen (z. B. inakzeptable Risiken, hohe Risiken, minimale Risiken). Sie unterscheidet daher KI-Systeme nicht anhand des Risikos, das sie darstellen könnten. Die Nullentwürfe sahen verschiedene Risikostufen und auf diese Stufen zugeschnittene Massnahmen vor. Im Zero Draft waren drei Stufen vorgesehen: erstens «erhebliche Risikostufen»; zweitens «inakzeptable Risikostufen», die erst dann zu einem vollständigen oder teilweisen Verbot führen sollten, wenn die inakzeptablen Risiken identifiziert worden waren und «keine anderen Massnahmen zu ihrer Minderung verfügbar» waren; drittens inakzeptable Risikostufen, die zu einem direkten Verbot solcher Systeme führen sollten. Diese Stufen wurden bereits sehr früh im Entwurfsprozess gestrichen. Aufgrund der Vertraulichkeit des Verhandlungsprozesses können die genauen Gründe nicht dokumentiert werden.

Da die KI-Konvention des Europarats nicht zwischen Risikostufen unterscheidet, sind die durch den Vertrag auferlegten Verpflichtungen nicht auf das Risikoniveau zugeschnitten, das ein System nach allgemeiner Auffassung darstellen darf. Ebenso wenig ist die Regelung durch den Vertrag auf bestimmte Sektoren (wie Asyl, Einwanderung und Grenzkontrolle) zugeschnitten. Vielmehr legt Kapitel II des Übereinkommens allgemeine Verpflichtungen fest, die für alle KI-Systeme gelten, die unter die Definition in Artikel 2 fallen. Wie bereits erläutert, sind die Adressaten dieser Verpflichtungen die Staaten.

Das Fehlen definierter Risikostufen im KI-Übereinkommen des Europarats ist ein wesentlicher Unterschied zum EU-KI-Gesetz und verdient an dieser Stelle eine eingehendere Betrachtung. Zwar würde eine detKIllierte Untersuchung der differenzierten Regulierung von Risikostufen im KI-Gesetz den Rahmen dieser Analyse sprengen, doch ist es wichtig, die Bedeutung dieser Stufen anzuerkennen – insbesondere angesichts ihrer inhärenten Unklarheiten und des Potenzials, das sie für regulatorische Ausnahmen schaffen. Diese Beobachtung bietet wiederum einen nützlichen Vergleichspunkt zur KI-Konvention des Europarats, die ebenfalls einen risikobasierten Regulierungsansatz verfolgt, dies jedoch ohne explizite Kategorisierung von Risikostufen und ohne entsprechende Anpassung der Verpflichtungen tut. Man könnte zunächst annehmen, dass die Konvention ein geringeres Schutzniveau bietet, da sie eine im EU-KI-Gesetz vorhandene Hochrisikokategorie auslässt. Wie die nachfolgende Analyse jedoch zeigen wird, ist diese Annahme angesichts der Möglichkeiten, die Einstufung als Hochrisiko nach dem EU-KI-Gesetz zu vermeiden, zu vereinfachend.

Innerhalb der Logik des KI-Gesetzes spielen Risikostufen eine zentrale Rolle. Das Gesetz wurde so beschrieben, dass es in erster Linie darauf abzielt, jene KI-Systeme zu regulieren, die als mit hohem oder inakzeptablem Risiko behaftet eingestuft werden. Um die Unklarheiten hinsichtlich der Risikoklassifizierungen und die daraus resultierenden regulatorischen Unsicherheiten aufzuzeigen, kann der Einstufung von KI-Systemen als «risikoreich» besondere Aufmerksamkeit gewidmet werden. Das KI-Gesetz definiert «risikoreich» nicht allgemein. Artikel 6 verweist auf Anhang III des Gesetzes und nennt Bereiche, in denen von vornherein davon ausgegangen werden kann, dass der Einsatz von KI-Systemen mit einem hohen Risiko verbunden ist. Dennoch wird ein in Anhang III aufgeführtes System nicht automatisch als risikoreich eingestuft. Konkret gilt beispielsweise ein System, das bei der Prüfung von Asylgesuchen eingesetzt wird, nicht allein deshalb als risikoreich, weil es in einem sensiblen Bereich wie dem Asylwesen von Behörden genutzt wird, die letztlich entscheidende Entscheidungen treffen, die Menschen betreffen. Gemäss Artikel 6 Absatz 3 des KI-Gesetzes muss eine zusätzliche Schwelle überschritten werden, damit ein solches System als «risikoreich» eingestuft wird.

Diese Bestimmung sieht vor, dass ein in Anhang III genanntes KI-System nicht als risikoreich gilt, wenn es kein erhebliches Risiko für die Gesundheit, die Sicherheit oder die Grundrechte natürlicher Personen darstellt, unter anderem dadurch, dass es den Ausgang der Entscheidungsfindung nicht wesentlich beeinflusst (Hervorhebung hinzugefügt).

Umgekehrt wird ein KI-System, das zuständige Behörden beispielsweise bei der Prüfung von Asylgesuchen unterstützt, nur dann als risikoreiches System eingestuft, wenn es «ein erhebliches Risiko für die Gesundheit, die Sicherheit oder die Grundrechte natürlicher Personen» darstellt. An dieser Stelle ist klarzustellen, dass es das System selbst ist, das «ein erhebliches Risiko» darstellen muss, nicht die von der Behörde getroffene endgültige Entscheidung. Die endgültige Entscheidung (z. B. die Ablehnung eines Asylantrags) könnte zwar ein Risiko für die Gesundheit, die Sicherheit oder die Grundrechte darstellen. Doch darauf kommt es nicht an. Entscheidend für die Einstufung des KI-Systems als «risikoreich» ist, dass das System selbst, wenn es zur Unterstützung einer Entscheidung eingesetzt wird, ein solches Risiko birgt.

Dies wirft schwierige Fragen zur Kausalität auf. Genauer gesagt muss es möglich sein, den Kausalzusammenhang zwischen dem KI-System und dem Risiko einer Beeinträchtigung der Gesundheit, der Sicherheit und der Grundrechte von Personen nachzuweisen. Wird der Kausalzusammenhang zwischen dem KI-System und dem Risiko nachgewiesen, kann das System als «risikoreiches» System eingestuft werden. Die Frage nach dem massgeblichen Kausalitätsmassstab wird im KI-Gesetz überhaupt nicht behandelt. Auch die Frage, wie der Grad der Signifikanz des Risikos zu messen ist, bleibt offen. Bemerkenswert ist, dass Artikel 6 Absatz 3 des KI-Gesetzes nicht einfach auf ein Risiko Bezug nimmt, sondern nur auf ein «erhebliches Schadensrisiko».

Die Verwendung des Risikobegriffs ist hier besonders hervorzuheben. Es muss kein Kausalzusammenhang zwischen der Nutzung des KI-Systems und einem Schaden nachgewiesen werden, sondern ein Kausalzusammenhang zwischen der Nutzung des KI-Systems und dem Risiko eines Schadens. Dies erleichtert die Kausalitätsprüfung, da das Risiko eines Schadens nur hypothetisch ist. Daraus folgt, dass die Einstufung eines Systems als «risikoreiches» System einfacher sein könnte, da ein Kausalzusammenhang zum Risiko leichter nachzuweisen ist. Wie oben erwähnt, muss das Risiko jedoch « » sein. Die Schweregrenze, die im Begriff «signifikantes Risiko» impliziert ist, könnte die oben erwähnte relative Leichtigkeit, ein Risiko nachzuweisen, anstatt einen Schaden nachzuweisen, wieder aufheben.

Selbst wenn nur das Risiko eines Schadens (im Gegensatz zum tatsächlichen Schaden) nachgewiesen werden muss, benötigen wir ein gewisses Verständnis des Schadens. Es stellt sich daher folgende Frage: Schaden an was? Artikel 6 Absatz 3 des KI-Gesetzes präzisiert: «Schaden an der Gesundheit, der Sicherheit oder den Grundrechten natürlicher Personen». Es ist vielleicht schwer vorstellbar, dass Gesundheit und Sicherheit geschädigt werden, ohne dass gleichzeitig die Grundrechte beeinträchtigt werden. Dies macht die gleichzeitige Aufzählung dieser drei Begriffe (d. h. Gesundheit, Sicherheit oder Grundrechte) schwer nachvollziehbar.

Sie wird jedoch verständlich, wenn klargestellt wird, dass eine Beeinträchtigung von Sicherheit und Gesundheit, selbst wenn sie wichtige, durch die Menschenrechtsgesetzgebung geschützte Interessen (z. B. Leben, Privat- und Familienleben) verletzt, nicht zwangsläufig eine Verletzung von Grundrechten darstellt. Der Grund dafür ist, dass selbst wenn beispielsweise das Recht auf Privatsphäre verletzt wird, diese Verletzung verhältnismässig sein kann und somit keinen Verstoss gegen die Menschenrechtsgesetzgebung darstellt. Dies impliziert die Einbeziehung einer Verhältnismässigkeitsprüfung bei der Beurteilung, ob das KI-System ein Schadensrisiko darstellt. Eine solche Verhältnismässigkeitsprüfung erfordert eine hochkomplexe und kontextabhängige Argumentation. Letztendlich ist die Einbeziehung der Grundrechte in die Schwelle für die Einstufung von Systemen als risikoreich daher nicht sehr hilfreich.

Die Einbeziehung eines erheblichen Risikos für Grundrechte zusätzlich zu einem erheblichen Risiko für Gesundheit und Sicherheit in Artikel 6 Absatz 3 des KI-Gesetzes kann so ausgelegt werden, dass die Arten möglicher Schäden breiter gefasst sind, da Grundrechte nicht nur Gesundheit und Sicherheit umfassen. Mit anderen Worten: Mögliche Schäden können Schäden an der Privatsphäre, am Familienleben, an religiösen Überzeugungen, an Verfahrensrechten usw. umfassen. Diese Ausweitung kann positiv bewertet werden. Wie oben bereits angemerkt, ist diese Erweiterung jedoch möglicherweise nicht sehr aussagekräftig, da Schäden an Interessen wie der Privatsphäre, dem Familienleben usw. verhältnismässig sein können und somit keine Menschenrechtsverletzung darstellen.

Artikel 6 Absatz 3 des KI-Gesetzes legt fest, dass ein KI-System «kein erhebliches Risiko für die Gesundheit, die Sicherheit oder die Grundrechte natürlicher Personen darstellt, unter anderem dadurch, dass es den Ausgang von Entscheidungsprozessen nicht wesentlich beeinflusst». Die Rolle des hier kursiv wiedergegebenen Zusatzes bedarf einer genaueren Prüfung. Er könnte so ausgelegt werden, dass die Annahme eingeführt wird, dass ein KI-System, wenn es das Ergebnis – wie beispielsweise eine Entscheidung – nicht wesentlich beeinflusst, als nicht mit einem erheblichen Risiko behaftet anzusehen ist und daher nicht unter die Einstufung als «risikoreiches» System fällt.

Wann beeinflusst ein KI-System eine Entscheidung (d. h. das Ergebnis der Entscheidungsfindung) «wesentlich»? Artikel 6 Absatz 3 des KI-Gesetzes führt Annahmen ein, wenn dies nicht der Fall ist. Unter den folgenden vier Bedingungen wird davon ausgegangen, dass ein KI-System das Ergebnis nicht wesentlich beeinflusst und daher kein Hochrisikosystem ist. Dies ist der Fall, wenn das System «dazu bestimmt ist, eine eng gefasste prozedurale Aufgabe auszuführen», «das Ergebnis einer zuvor abgeschlossenen menschlichen Tätigkeit zu verbessern», «Entscheidungsmuster oder Abweichungen von früheren Entscheidungsmustern zu erkennen und nicht dazu bestimmt ist, die zuvor abgeschlossene menschliche Beurteilung ohne angemessene menschliche Überprüfung zu ersetzen oder zu beeinflussen» sowie «eine vorbereitende Aufgabe für eine Beurteilung auszuführen, die für die Zwecke der in Anhang III aufgeführten Anwendungsfälle relevant ist». Diese vier Bedingungen werden als Alternativen angegeben.

Die Formulierung der vier Bedingungen lässt Raum für Interpretationen. Ob ein System eine eng gefasste prozedurale Aufgabe erfüllt, kann eine strittige Frage sein. Die Bedeutung von «eng gefasste prozedurale Aufgabe» ist mehrdeutig. Das Gleiche gilt für die tatsächliche Bedeutung der Begriffe «Verbesserung des Ergebnisses», «keine Beeinflussung» und «nur eine vorbereitende Aufgabe». Diese Auslegungsmehrdeutigkeit kann in Zukunft durch Leitlinien der Kommission geklärt werden. Der Punkt hierbei ist, dass die Schlussfolgerung, dass beispielsweise ein System zur Erkennung von Gesichtsausdrücken eine eng gefasste prozedurale Aufgabe ausführt, möglicherweise nicht so eindeutig ist und vom Kontext abhängen könnte.

Zusammenfassend lässt sich sagen, dass das KI-Gesetz mehrdeutige Ausnahmen bei der Einstufung von Systemen als risikoreich einführt, was letztlich seinen Regulierungsansatz mit der Kategorisierung von Risikostufen und der Anpassung der Verpflichtungen an diese Stufen zu untergraben scheint. Die Verfasser der KI-Konvention des Europarats haben dies vermieden und damit die oben genannten Schwierigkeiten (Kausalität, Verhältnismässigkeitsprüfung, Kontextualisierung usw.) bei der anfänglichen Einstufung von Systemen in Risikostufen umgangen. Dies kann auch mit ihrem Charakter als internationaler Vertrag zusammenhängen, dessen Bestimmungen abstrakter und allgemeiner gehalten sind.

Obwohl sie nicht mit der Einstufung von Risikostufen zusammenhängen, ergeben sich die zuvor erwähnten Schwierigkeiten – hinsichtlich der Rolle der Menschenrechte, der Kausalzusammenhänge zwischen Schäden (oder dem Risiko von Schäden) an wichtigen Interessen und dem Einsatz von KI-Systemen, der Verhältnismässigkeit und der Kontextualisierung – auch bei der Auslegung der durch die KI-Konvention des Europarats auferlegten Verpflichtungen, wie im nächsten Abschnitt untersucht wird.

V. Die den Staaten auferlegten Verpflichtungen

Dieser Abschnitt erläutert die relevanten Verpflichtungen in drei Schritten. Zunächst wird der Ausgangspunkt des Vertrags behandelt: die ausdrückliche Absicht, keine neuen Menschenrechtsverpflichtungen zu schaffen. Zweitens: Während der Schutz der Menschenrechte ursprünglich als eine Lücke identifiziert wurde, die die KI-Konvention des Europarats schliessen sollte, wirft die fehlende Konkretisierung der wohl bestehenden Menschenrechtsverpflichtungen Zweifel daran auf, ob diese Lücke tatsächlich geschlossen wurde. Schliesslich verankert der Vertrag, obwohl er solche Verpflichtungen nicht konkretisiert, eine Reihe von Grundsätzen, die speziell für den Betrieb von KI-Systemen relevant sind. Diese Grundsätze – Menschenwürde und individuelle Autonomie, Transparenz und Aufsicht, Rechenschaftspflicht, Nichtdiskriminierung, Datenschutz, Zuverlässigkeit und Risikomanagement – sind bewusst sehr allgemein gehalten, können aber dennoch als Auslegungshilfe für die künftige Entwicklung konkreterer Menschenrechtsstandards und -verpflichtungen dienen.

1. Ausgangspunkt und zu schliessende Lücken

Um die den Staaten durch das KI-Übereinkommen des Europarats auferlegten Verpflichtungen besser zu verstehen, ist es wichtig, dessen Ausgangspunkt hervorzuheben. Der Vertrag zielt nicht darauf ab, neue menschenrechtliche Verpflichtungen zu begründen. Dies wird in seinem Erläuternden Bericht sehr deutlich gemacht:

Keine Bestimmung dieses Rahmenübereinkommens zielt darauf ab, neue Menschenrechte oder Menschenrechtsverpflichtungen zu schaffen oder den Umfang und Inhalt der bestehenden anwendbaren Schutzmassnahmen zu untergraben, sondern vielmehr darauf, durch die Festlegung verschiedener rechtsverbindlicher Verpflichtungen in den Kapiteln II bis VI die wirksame Umsetzung der anwendbaren Menschenrechtsverpflichtungen jeder Vertragspartei im Kontext der neuen Herausforderungen durch künstliche Intelligenz zu erleichtern.

Der Wortlaut von Artikel 4 des KI-Übereinkommens des Europarats spiegelt diesen Ausgangspunkt wider. Diese Bestimmung verpflichtet jeden Vertragsstaat, «Massnahmen zu erlassen und aufrechtzuerhalten, um sicherzustellen, dass die Aktivitäten im Lebenszyklus von KI-Systemen mit den Verpflichtungen zum Schutz der Menschenrechte im Einklang stehen, wie sie im anwendbaren Völkerrecht und im innerstaatlichen Recht verankert sind». Dieser Text ist nicht sehr konkret. Er trägt nicht wesentlich dazu bei, die Unsicherheit hinsichtlich der Frage zu beseitigen, inwiefern die Menschenrechtsnormen KI-Systeme einschränken und regulieren.

Um die Rolle der KI-Konvention des Europarats und ihren möglichen Mehrwert besser zu verstehen, ist es sinnvoll, auf die vor der Verabschiedung der Konvention erstellte Machbarkeitsstudie zurückzugreifen. Die Studie hebt vier „Rechtslücken“ hervor: (1) Spezifizierung/Konkretisierung von Verpflichtungen; (2) Identifizierung von konkreten Grundsätzen, die speziell für KI-Systeme relevant sind ( ); (3) Reaktion auf systemische Schäden; und (4) Reaktion auf den grenzüberschreitenden/transnationalen Charakter des Schadens. Die folgenden beiden Unterabschnitte konzentrieren sich auf die erste und zweite Lücke, da die meisten der im Vertrag verabschiedeten Bestimmungen diese betreffen.

2. Schutz der Menschenrechte

In Bezug auf die erste Rechtslücke stellt die Machbarkeitsstudie fest, dass «die in bestehenden Rechtsinstrumenten formulierten Rechte und Pflichten tendenziell weit oder allgemein gefasst sind, was an sich nicht problematisch ist, im Zusammenhang mit KI jedoch in einigen Fällen zu Auslegungsschwierigkeiten führen kann». Daher wird eine Konkretisierung der den Rechten entsprechenden Pflichten vorgeschlagen. Die Machbarkeitsstudie schlägt vor, dass dies erreicht werden kann, indem «konkreter festgelegt wird, was unter ein weiter gefasstes Menschenrecht fällt und wie es von denjenigen geltend gemacht werden könnte, die KI-Systemen ausgesetzt sind».

Hier wird argumentiert, dass die KI-Konvention des Europarats eine solche Konkretisierung nicht wirklich erreicht. Artikel 4 des Vertrags verweist lediglich auf die Verpflichtung der Staaten, die Menschenrechte zu schützen. Der Erläuternde Bericht zur Konvention trägt wenig zur Klärung bei – und verschleiert in mancher Hinsicht sogar noch mehr – die Natur von Artikel 4. So heisst es in Absatz 38 des Erläuternden Berichts:

[], den Vertragsparteien steht es frei, die Art und Weise der Umsetzung ihrer völkerrechtlichen Verpflichtungen zu wählen, sofern das Ergebnis mit diesen Verpflichtungen im Einklang steht. Es handelt sich hierbei um eine Ergebnisverpflichtung und nicht um eine Mittelverpflichtung. In dieser Hinsicht ist das Subsidiaritätsprinzip von wesentlicher Bedeutung, da es den Vertragsparteien die Hauptverantwortung auferlegt, die Achtung der Menschenrechte zu gewährleisten und bei Menschenrechtsverletzungen Abhilfe zu schaffen.

Dieser Absatz definiert die durch den Vertrag auferlegten Verpflichtungen als Ergebnisverpflichtungen. Wenn jedoch die Verhinderung von Schaden oder der Gefahr von Schaden das angestrebte Ergebnis ist, können die Verpflichtungen keine Ergebnisverpflichtungen sein. Schaden und die Gefahr von Schaden treten im Zusammenhang mit verschiedenen Aktivitäten ständig auf, und dieser Schaden und diese Gefahr sind für sich genommen niemals die alleinige Grundlage für die Feststellung einer Verletzung von Verpflichtungen nach dem Menschenrechtsrecht. Die Feststellung einer Verletzung erfolgt vielmehr unter Berücksichtigung von Erwägungen der Angemessenheit, der Kausalität und der Kenntnis des Staates über das Risiko. Angemessenheit bedeutet beispielsweise, dass selbst wenn der Schaden oder die Gefahr eines Schadens vorhersehbar war (d. h. der Staat davon wusste oder hätte wissen müssen) und selbst wenn der Staat Massnahmen hätte ergreifen können, die das Risiko ursächlich hätten verhindern oder mindern können, der Staat dennoch nicht gegen seine Verpflichtungen aus den Menschenrechtsnormen verstossen haben könnte. Der Grund dafür ist, dass es unter Umständen nicht angemessen wäre, Massnahmen zu ergreifen, da solche Massnahmen beispielsweise mit anderen legitimen und wichtigen Interessen in Konflikt stehen könnten.

Wenn die Regulierung von Aktivitäten das angestrebte Ergebnis ist, dann kann die Verpflichtung zur Regulierung als solche tatsächlich als Ergebnisverpflichtung konzeptualisiert werden. Dennoch haben die Staaten weiterhin einen Ermessensspielraum hinsichtlich der konkreten Ausgestaltung der Regulierung, was den Verweis auf ein Ergebnis (d. h. das Ergebnis der Regulierung als solche) wenig hilfreich macht. Insgesamt versäumt es Artikel 4 des KI-Übereinkommens des Europarats also nicht nur, eine Konkretisierung vorzunehmen, sondern die durch den Erläuternden Bericht hinzugefügten Klarstellungen sind zudem verwirrend. Wie in Abschnitt II oben erwähnt, soll der Bericht Einblicke in den Entwurfsprozess geben, ohne die Verhandlungspositionen der verschiedenen Staaten preiszugeben. Angesichts der verwirrenden Formulierung des oben zitierten Absatzes aus dem Erläuternden Bericht lässt sich ableiten, dass die Verfasser unsicher waren oder sich nicht einigen konnten, wie anspruchsvoll und eingreifend die Verpflichtungen sein sollten.

Die allgemeine Unklarheit hinsichtlich der Rolle der Menschenrechtsnormen wird auch aus den verschiedenen Entwürfen des Vertrags deutlich. Hier verdient Artikel 6 Absatz 2 des Nullentwurfs eine vollständige Zitierung. Darin hiess es, dass die Vertragsstaaten

sicherzustellen, dass der Einsatz und die Anwendung von Systemen der künstlichen Intelligenz im öffentlichen Sektor auf einer angemessenen Rechtsgrundlage beruhen und dass im Hinblick auf den Kontext des Einsatzes eine sorgfältige Vorabprüfung der Notwendigkeit und Verhältnismässigkeit der Nutzung solcher Systeme durchgeführt wird. (Hervorhebung hinzugefügt).

Diese Bestimmung spiegelt die Annahme wider, dass der Einsatz von KI-Systemen im öffentlichen Sektor von Natur aus Eingriffe in die Menschenrechte mit sich bringt, was die Auferlegung der Anforderungen an eine Rechtsgrundlage sowie an eine Notwendigkeits- und Verhältnismässigkeitsprüfung an sich erklärt. Es ist das Wesen der Menschenrechtsnormen, zu verlangen, dass jeder Eingriff eine Rechtsgrundlage hat und dass er notwendig und verhältnismässig ist, damit der Eingriff keine Verletzung darstellt. Zusammenfassend lässt sich sagen, dass die Ausgangsannahme im Zero Draft darin bestand, dass der Einsatz von KI-Systemen durch öffentliche Behörden den Standards der Rechtmässigkeit, Notwendigkeit und Verhältnismässigkeit entsprechen muss, da der Einsatz an sich einen Eingriff in die Menschenrechte darstellt.

Diese Ausgangsannahme wurde im überarbeiteten Nullentwurf abgeschwächt, um schliesslich im konsolidierten Arbeitsentwurf und im endgültigen Text des Vertrags vollständig gestrichen zu werden. Um diese Abschwächung besser zu verstehen, lohnt es sich, Artikel 5 des überarbeiteten Nullentwurfs zu zitieren:

Jede Vertragspartei stellt innerhalb ihres jeweiligen Hoheitsgebiets sicher, dass:

a. die Anwendung eines Systems der künstlichen Intelligenz, das die Entscheidungsfindung einer Behörde bei der Ausübung ihrer Aufgaben oder einer in ihrem Auftrag handelnden privaten Einrichtung massgeblich beeinflusst, in vollem Umfang mit ihren Verpflichtungen zur Achtung der Menschenrechte und Grundfreiheiten vereinbar ist, wie sie durch ihr innerstaatliches Recht oder durch einschlägiges anwendbares Völkerrecht garantiert sind;

b. jede Beeinträchtigung der Menschenrechte und Grundfreiheiten durch eine Behörde oder eine in deren Auftrag handelnde private Einrichtung, die sich aus einer solchen Anwendung eines Systems der künstlichen Intelligenz ergibt, mit den Grundwerten demokratischer Gesellschaften vereinbar ist, im Einklang mit dem Gesetz steht und in einer demokratischen Gesellschaft zur Verfolgung eines legitimen öffentlichen Interesses erforderlich ist. (Hervorhebung hinzugefügt).

Durch die Hinzufügung des Formulums «die Entscheidungsfindung massgeblich beeinflusst» in Artikel 5 des überarbeiteten Nullentwurfs werden zwei Schwellenwerte eingeführt: ein Kausalitätsschwellenwert und ein Schweregradschwellenwert. Beide erinnern an die Schwierigkeiten und Unklarheiten im Zusammenhang mit der Einstufung als «hohes Risiko» im EU-KI-Gesetz, auf die oben bereits näher eingegangen wurde.

Die Hinzufügung dieser Schwellenwerte bedeutet, dass nicht mehr davon ausgegangen wird, dass jede Nutzung von KI-Systemen durch Behörden von Natur aus wichtige, durch die Menschenrechtsgesetzgebung geschützte Interessen beeinträchtigt und somit per se einen Eingriff darstellt, der einer Rechtsgrundlage bedürfe und den Standards der Notwendigkeit und Verhältnismässigkeit entsprechen müsse. Vielmehr gibt es eine Kausalitätsschwelle – die Entscheidung muss durch das System beeinflusst sein. Eine solche Kausalitätsschwelle spiegelt sich auch in der Formulierung «die sich aus einer solchen Anwendung ergibt» wider. Anders ausgedrückt: Der Kausalzusammenhang zwischen der Nutzung eines KI-Systems und einem Eingriff in die Menschenrechte (d. h. einer Beeinträchtigung wichtiger Interessen) kann nicht vorausgesetzt werden. Was die Schwere-Schwelle betrifft, so spiegelt sich diese in dem Begriff «wesentlich» wider. Mit anderen Worten: Es gibt einen Kausalitätsstandard, der eine bestimmte Schwelle überschreiten muss.

Die oben zitierten Bestimmungen wurden mit dem am 7. Juli 2023 veröffentlichten konsolidierten Arbeitsentwurf vollständig gestrichen; diese Streichung stand, wie oben angedeutet, im Zusammenhang mit der Änderung und der Einschränkung des persönlichen Geltungsbereichs des Vertrags (d. h. es bestand kein Bedarf an spezifischen Bestimmungen über Behörden, da der Geltungsbereich der Konvention auf die Regulierung des Verhaltens von Staaten beschränkt war). Die neue Bestimmung zum Geltungsbereich des Übereinkommens bezieht sich auf KI-Systeme, die das Potenzial haben, Menschenrechte zu beeinträchtigen. Der verabschiedete Text des Übereinkommens verwendet denselben Ausdruck. Insbesondere sieht Artikel 3 Absatz 1 des KI-Übereinkommens des Europarats vor, dass «[d]er Geltungsbereich dieses Übereinkommens die Aktivitäten innerhalb des Lebenszyklus von Systemen der künstlichen Intelligenz umfasst, die das Potenzial haben, Menschenrechte, Demokratie und Rechtsstaatlichkeit zu beeinträchtigen […]». Die ursprüngliche Annahme, dass von Behörden genutzte KI-Systeme zwangsläufig einen Eingriff in die Menschenrechte darstellen (und somit zwangsläufig wichtige Interessen beeinträchtigen), wurde daher durch den Gedanken der potenziellen Beeinträchtigung ersetzt. In Artikel 3 Absatz 1 des Übereinkommens wird weder auf einen Kausalitäts- noch auf einen Schweregrad-Schwellenwert Bezug genommen.

Der Rückgriff auf die Schwellenwerte für Kausalität und Schweregrad verdeutlicht eine allgemeine Verwirrung und Unsicherheit hinsichtlich der Rolle der Menschenrechtsnormen. Der im Dezember 2023 veröffentlichte Entwurf des Rahmenübereinkommens, dessen Text die verschiedenen Optionen enthält, aus denen die Verfasser wählen konnten, ist sehr aufschlussreich, um diese Unsicherheit aufzuzeigen. Dieser Entwurf enthielt Verweise auf «Menschenrechtsverletzungen», «nachteilige Auswirkungen auf die Menschenrechte», «rechtswidrige Beeinträchtigung oder Schädigung der Rechte von natürlichen und juristischen Personen», «das Potenzial, in Menschenrechte einzugreifen», «erhebliche Auswirkungen auf Menschenrechte» und «Auswirkungen auf Menschenrechte». All diese Verweise verdeutlichen die Schwierigkeiten bei der Formulierung erstens der Rolle der Menschenrechte, zweitens der Kausalzusammenhänge zwischen von Behörden eingesetzten KI-Systemen und der Beeinträchtigung wichtiger, durch die Menschenrechtsnormen geschützter Interessen sowie drittens der Kausalzusammenhänge zwischen von privaten Akteuren eingesetzten KI-Systemen und der Rolle des Staates beim Schutz dieser wichtigen Interessen.

3. Grundsätze, die sich speziell auf die Aktivitäten von KI-Systemen beziehen

Die zweite in der Machbarkeitsstudie identifizierte «Rechtslücke» steht mit der ersten in Zusammenhang, da es auch hier um die Spezifizierung geht. Insbesondere soll die zweite «Rechtslücke» durch die ausdrückliche gesetzliche Verankerung bestimmter Grundsätze geschlossen werden, die speziell für den Betrieb von KI-Systemen relevant sind. Dazu gehören menschliche Kontrolle und Aufsicht, technische Robustheit, Transparenz und Erklärbarkeit. Hinzu kam die Rückverfolgbarkeit durch Aufzeichnungen und die Dokumentation von Protokollen, was die Identifizierung etwKIger Kausalzusammenhänge zwischen Schäden und dem Betrieb der KI-Systeme ermöglichen kann. Dies wiederum kann die Möglichkeit eröffnen, den Betrieb des KI-Systems unter menschenrechtlichen Gesichtspunkten anzufechten und zu beurteilen, ob eine Verletzung der Menschenrechte vorliegt. Ein weiterer Grundsatz, der laut der Machbarkeitsstudie für den Betrieb von KI-Systemen besonders relevant ist, besteht darin, sicherzustellen, dass Entwickler und Betreiber von KI-Systemen über die erforderliche Kompetenz verfügen. Die Machbarkeitsstudie stellt fest, dass eine fehlende spezifische Regelung dieser Grundsätze zu Unsicherheit sowohl bei Entwicklern als auch bei Betreibern führt, was Innovationen behindern könnte.

Die ausdrückliche rechtliche Verankerung bestimmter Grundsätze, die für den Betrieb von KI-Systemen besonders relevant sind, soll durch Kapitel III des Vertrags erreicht werden. Dieses Kapitel zählt Grundsätze auf, die «sich auf Aktivitäten innerhalb des Lebenszyklus von Systemen der künstlichen Intelligenz beziehen». Angesichts ihres Charakters als Grundsätze sind sie «bewusst sehr allgemein formuliert» und sollen «eine sehr breite Anwendung auf eine Vielzahl von Umständen» finden. Wie der Erläuternde Bericht zur KI-Konvention des Europarats nahelegt, gingen die Verfasser des Vertrags davon aus, dass das «detKIllierte Rechtssystem des Menschenrechtsschutzes mit seinen eigenen Regeln» ausreicht, um die Anwendung dieser allgemeinen Grundsätze weiter anzupassen.

Es ist jedoch zweifelhaft, ob das derzeitige Menschenrechtsregime ein hohes Mass an Konkretheit bieten kann; es befindet sich noch in der Entwicklung, um den neuen Herausforderungen und Schäden an wichtigen Interessen, die sich aus dem Einsatz von KI-Systemen ergeben, gerecht zu werden. Jegliche Verpflichtungen im Zusammenhang mit den Menschenrechten müssen noch konkretisiert werden. Eine solche Konkretisierung setzt ein besseres Verständnis der Kausalzusammenhänge zwischen KI-Systemen, die von Behörden eingesetzt werden, und der Beeinträchtigung wichtiger, durch die Menschenrechtsgesetzgebung geschützter Interessen voraus, sowie ein besseres Verständnis der Kausalzusammenhänge zwischen KI-Systemen, die von privaten Akteuren eingesetzt werden, und der Rolle des Staates beim Schutz dieser wichtigen Interessen. Eine solche Konkretisierung impliziert zudem Vorschläge zu den Massnahmen (präventiv oder abhelfend), die den Inhalt der Menschenrechtsverpflichtungen bilden könnten. Bei der Ausarbeitung solcher Vorschläge sind die Grundsätze, die aus dem speziell für KI-Systeme geschaffenen Rechtsrahmen stammen, eine wichtige Orientierungshilfe. In diesem Sinne sind es die Rechtsrahmen, die KI speziell regeln, wie das EU-KI-Gesetz und die KI-Konvention des Europarats, die zur Weiterentwicklung der Menschenrechtsnormen beitragen können. Trotz ihres hohen Abstraktionsgrades können die in Kapitel III der KI-Konvention des Europarats aufgeführten Regulierungsgrundsätze daher hilfreich sein.

Da diese Regulierungsgrundsätze als Orientierungshilfe dienen, müssen sie besser verstanden werden. Dies ist das Ziel der folgenden Abschnitte, die sich nacheinander mit den folgenden Grundsätzen befassen: Menschenwürde und individuelle Autonomie, Transparenz und Aufsicht, Rechenschaftspflicht, Nichtdiskriminierung, Datenschutz, Zuverlässigkeit und schliesslich Risikomanagement. Es wird kein umfassender Überblick gegeben. Vielmehr werden einige der wichtigsten strittigen Fragen in Bezug auf jeden Grundsatz aufgezeigt.

a. Menschenwürde und individuelle Autonomie

Artikel 7 der KI-Konvention des Europarats verankert den Grundsatz der Achtung der Menschenwürde und der individuellen Autonomie. Die Machbarkeitsstudie stellt klar, dass «[z]ur Wahrung der Menschenwürde ist es unerlässlich, dass sich Menschen der Tatsache bewusst sind, dass sie mit einem KI-System interagieren, und dass sie in dieser Hinsicht nicht irregeführt werden». Die Studie fügt hinzu, dass «sie grundsätzlich in der Lage sein sollten, sich gegen eine Interaktion zu entscheiden und keiner Entscheidung unterworfen zu werden, die von einem KI-System beeinflusst oder getroffen wird, wenn dies erhebliche Auswirkungen auf ihr Leben haben kann, insbesondere wenn dadurch Rechte im Zusammenhang mit ihrer Menschenwürde verletzt werden können.» Wie in Abschnitt III.1. oben angedeutet, enthielten die Zero Drafts tatsächlich konkret formulierte Rechte in diesem Sinne.

Der Erläuternde Bericht geht nicht so weit. Er stellt unter anderem klar, dass die Achtung der Menschenwürde bedeutet, dass Individuen nicht auf «reine Datenpunkte» reduziert werden. Dem Erläuternden Bericht zufolge impliziert individuelle Autonomie daher die Fähigkeit, Entscheidungen zu treffen, und dass Individuen «Kontrolle über die Nutzung und die Auswirkungen von Technologien der künstlichen Intelligenz in ihrem Leben» haben. Die Möglichkeit, sich einem Entscheidungsprozess durch eine Behörde zu entziehen, die möglicherweise ein KI-System einsetzt, wird jedoch im Erläuternden Bericht zum Vertrag nicht als Teil der Konzeptualisierung der «individuellen Autonomie» erwähnt. Dennoch können die Menschenwürde und die individuelle Autonomie wichtige Anhaltspunkte für die kontextbezogene Auslegung von Menschenrechtsverpflichtungen liefern. In bestimmten Kontexten könnte der Inhalt dieser Verpflichtungen so verstanden werden, dass er das Recht umfasst, nicht mit einem KI-System zu interagieren oder nicht Entscheidungen zu unterliegen, die von solchen Systemen generiert werden.

b. Transparenz und Aufsicht

Der zweite in der KI-Konvention des Europarats verankerte Grundsatz ist Transparenz und Aufsicht. Insbesondere sieht Artikel 8 des Vertrags vor, dass

Jede Vertragspartei ergreift oder behält Massnahmen bei, um sicherzustellen, dass angemessene, auf die spezifischen Kontexte und Risiken zugeschnittene Transparenz- und Aufsichtsanforderungen in Bezug auf Aktivitäten im Lebenszyklus von Systemen der künstlichen Intelligenz bestehen, einschliesslich der Identifizierung von Inhalten, die von Systemen der künstlichen Intelligenz generiert wurden.

Eine Überprüfung der verschiedenen Entwürfe zu Transparenz und Aufsicht zeigt, dass es keine Änderungen an den vorgeschlagenen Formulierungen gab, was darauf hindeutet, dass die endgültige Formulierung von Artikel 8 des Vertrags unumstritten war. Die einzige nennenswerte Ergänzung ist diejenige im Entwurf vom Dezember 2023, in dem die Identifizierung von durch KI-Systeme generierten Inhalten in den Text aufgenommen wurde. Diese „ “ war eine positive Ergänzung, wie sich auch im eigentlichen Wortlaut von Artikel 8 des Übereinkommens widerspiegelt, da sie sicherstellt, dass die Identifizierung solcher Inhalte Teil der Transparenz- und Aufsichtspflicht ist. Obwohl die Erklärbarkeit im Wortlaut des Vertrags nicht erwähnt wird, deutet der Erläuternde Bericht darauf hin, dass die Erklärbarkeit Teil des Transparenzprinzips ist. Der Bericht stellt klar, dass die Erklärbarkeit

[.] sich auf die Fähigkeit bezieht, vorbehaltlich der technischen Machbarkeit und unter Berücksichtigung des allgemein anerkannten Stands der Technik, hinreichend verständliche Erklärungen darüber zu liefern, warum ein System der künstlichen Intelligenz Informationen bereitstellt, Vorhersagen, Inhalte, Empfehlungen oder Entscheidungen trifft, was in sensiblen Bereichen wie Gesundheitswesen, Finanzen, Einwanderung, Grenzdienste und Strafjustiz besonders entscheidend ist, wo das Verständnis der Argumentation hinter Entscheidungen, die von einem System der künstlichen Intelligenz getroffen oder unterstützt werden, unerlässlich ist. In solchen Fällen könnte Transparenz beispielsweise in Form einer Liste von Faktoren erfolgen, die das System der künstlichen Intelligenz bei der Bereitstellung von Informationen oder der Entscheidungsfindung berücksichtigt.

Wie oben erwähnt, hat der Erläuternde Bericht keine bindende Wirkung; dennoch enthält der vorstehende Absatz aussagekräftige Klarstellungen, die einen Auslegungswert bieten. Wie der Wortlaut von Artikel 8 und der Erläuternde Bericht nahelegen, lassen sich bestimmte «sensible Bereiche» identifizieren, in denen Transparenz- und Aufsichtsmassnahmen massgeschneidert werden müssen. Dies kann strengere Anforderungen bedeuten. Wie im Erläuternden Bericht klargestellt wird, könnte diese Anpassung unter anderem eine Verbesserung der Transparenz hinsichtlich der vom KI-System berücksichtigten Eingaben oder Kriterien beinhalten.

c. Rechenschaftspflicht/Verantwortung, Rechtsbehelfe und Aufsichtsmechanismen

Transparenz kann die Identifizierung von Schäden und der Akteure ermöglichen, die diesen Schaden verursacht haben könnten, was wiederum für die Gewährleistung der Verantwortlichkeit unerlässlich ist. Die KI-Konvention des Europarats befasst sich daher ausdrücklich mit Rechenschaftspflicht und Verantwortung. Insbesondere ist Artikel 9 des Vertrags allgemein wie folgt formuliert:

Jede Vertragspartei ergreift oder behält Massnahmen bei, um die Rechenschaftspflicht und die Verantwortung für nachteilige Auswirkungen auf die Menschenrechte, die Demokratie und die Rechtsstaatlichkeit sicherzustellen, die sich aus Aktivitäten im Lebenszyklus von Systemen der künstlichen Intelligenz ergeben.

Dies könnte die Verabschiedung neuer rechtlicher Rahmenbedingungen auf nationaler Ebene oder die Anpassung bestehender justizieller, administrativer, zivilrechtlicher oder anderer nationaler Haftungsregelungen erfordern. Solche Haftungsregelungen sind untrennbar mit dem in Artikel 14 der KI-Konvention des Europarats verankerten Recht auf wirksame Rechtsbehelfe verbunden. Ähnlich wie Artikel 8 des Vertrags (Transparenz und Aufsicht) verlangt Artikel 14 Massnahmen zur Dokumentation relevanter Informationen über KI-Systeme.

Es gibt jedoch Einschränkungen: Eine solche Dokumentation ist erforderlich, wenn das System «das Potenzial hat, die Menschenrechte erheblich zu beeinträchtigen». Man kann sich fragen, was «erheblich» in diesem Zusammenhang bedeutet, und wer entscheidet, ob der Schaden erheblich ist oder nicht. Es stellt sich daher dasselbe Problem wie das in Abschnitt IV oben im Zusammenhang mit Artikel 6 Absatz 3 des EU-KI-Gesetzes diskutierte, wonach Systeme von der Einstufung als Hochrisikosysteme ausgenommen sind, wenn sie «kein erhebliches Risiko für die Gesundheit, die Sicherheit oder die Grundrechte natürlicher Personen darstellen».

Ein Unterschied in der Formulierung besteht in dem Verweis auf das Risiko in der Bestimmung des KI-Gesetzes. Wie in Abschnitt IV festgestellt wurde, schwächt die Einbeziehung des Risikos den erforderlichen Kausalzusammenhang zwischen dem System und dem Schaden. Wie die verfügbaren Entwürfe der KI-Konvention des Europarates zeigen, traten im Entwurfsprozess Herausforderungen auf, wie die Kausalzusammenhänge zwischen KI-Systemen und Schäden (oder potenziellen Schäden) an wichtigen, durch die Menschenrechtsgesetzgebung geschützten Interessen formuliert werden sollten. Diese Herausforderungen wirken sich unweigerlich auf die Möglichkeiten für Rechtsbehelfe und die Feststellung der Haftung aus.

Eine zusätzliche Einschränkung ergibt sich aus Artikel 14 Absatz 2 Buchstabe b der KI-Konvention des Europarats: Die Staaten müssen Massnahmen ergreifen, um sicherzustellen, dass die Informationen über das KI-System «ausreichen, damit die betroffenen Personen die Entscheidung(en), die unter Verwendung des Systems getroffen oder wesentlich davon beeinflusst wurde(n), und, soweit relevant und angemessen, die Verwendung des Systems selbst anfechten können». Die folgenden Fragen bleiben offen: Wer entscheidet, wann die Informationen ausreichend sind? Und wer entscheidet, ob die Entscheidung wesentlich durch den Einsatz des Systems beeinflusst wurde? Schliesslich wird keine klare und eindeutige Verpflichtung auferlegt, über den Einsatz des Systems selbst zu informieren. Der Kommentar zu Artikel 14 im Erläuternden Bericht scheint all diese Einschränkungen wie folgt zu rechtfertigen:

Es ist auch wichtig, daran zu erinnern, dass Ausnahmen, Einschränkungen oder Abweichungen von solchen Transparenzpflichten im Interesse der öffentlichen Ordnung, der Sicherheit und anderer wichtiger öffentlicher Interessen gemäss den geltenden internationalen Menschenrechtsinstrumenten sowie, soweit erforderlich, zur Erreichung dieser Ziele möglich sind.

Artikel 15 des Vertrags stärkt das Recht auf wirksame Rechtsbehelfe durch die Hinzufügung verfahrensrechtlicher Garantien. Insbesondere sieht diese Bestimmung vor, dass «wenn ein System der künstlichen Intelligenz die Ausübung der Menschenrechte erheblich beeinträchtigt, wirksame verfahrensrechtliche Garantien, Schutzvorkehrungen und Rechte im Einklang mit dem anwendbaren internationalen und innerstaatlichen Recht» gewährleistet werden müssen. Ähnlich wie oben erwähnt wird eine Schwelle der Erheblichkeit (d. h. «erheblich beeinträchtigen, erheblich beeinflussen») festgelegt.

Dies führt zur Unterscheidung zwischen zwei Stufen von Menschenrechtsverletzungen: (1) normale und (2) schwerwiegende. Die Menschenrechtsnormen sehen solche Stufen in der Regel nicht vor, und das Recht auf einen wirksamen Rechtsbehelf gilt unabhängig von der Schwere der Verletzung. Insbesondere müssen, sobald die definitorische Schwelle eines Rechts erreicht ist (d. h. festgestellt wird, dass die durch das Recht geschützten Interessen beeinträchtigt, verletzt oder beeinträchtigt werden), Rechtsbehelfe mit verfahrensrechtlichen Garantien gewährleistet sein. Tatsächlich könnte die Schwere der Verletzung im Hinblick auf ihren Ausmass strengere verfahrensrechtliche Garantien erfordern. Dies ist relevant, da beispielsweise das Recht auf Privatsphäre sehr weit ausgelegt wird. Es ist auch relevant, da die verfahrensrechtlichen Verpflichtungen zur Rechtsbehelfsgewährung, die beispielsweise Artikel 8 EMRK (Privatsphäre) entsprechen, im Vergleich zu denen, die Artikel 3 EMRK (Folter, unmenschliche und erniedrigende Behandlung) entsprechen, angesichts der unterschiedlichen Schweregrade weniger streng sein können. Der entscheidende Punkt bleibt jedoch, dass Rechtsbehelfe und Verfahrensgarantien sowohl bei geringfügigen als auch bei erheblichen Eingriffen in die Ausübung der Menschenrechte erforderlich sind. Es könnte lediglich Unterschiede in der Stärke der Verfahrensgarantien geben.

Artikel 15 Absatz 2 des KI-Übereinkommens des Europarats weist eine weitere Schwäche auf. Der Wortlaut lautet: «Jede Vertragspartei bemüht sich sicherzustellen, dass Personen, die mit Systemen der künstlichen Intelligenz interagieren, entsprechend dem Kontext darüber informiert werden, dass sie mit solchen Systemen und nicht mit einem Menschen interagieren.» Die Anforderung, «dafür zu sorgen», ist schwächer als «sicherzustellen». Die Strenge der Anforderungen an die Benachrichtigung wird durch die Einschränkung «dem Kontext entsprechend» weiter untergraben. Dies eröffnet die Möglichkeit für das Argument, dass eine Benachrichtigung in manchen Kontexten nicht angemessen sei. Ohne Benachrichtigung kann die betroffene Person nicht wissen, dass ein KI-System eingesetzt wurde, was die Möglichkeit untergraben kann, das System einer Überprüfung zu unterziehen, einschliesslich über rechtliche Wege zur Feststellung der Verantwortung.

Schliesslich muss jede Diskussion über die Verantwortlichkeit berücksichtigen, inwieweit in jedem Vertragsstaat auf nationaler Ebene wirksame Aufsichtsmechanismen zur Verfügung stehen. Allgemeiner gesagt können solche Mechanismen nationale Datenschutzbehörden, Gleichstellungsstellen, Menschenrechtsinstitutionen mit einem allgemeinen Mandat oder speziell für die Überwachung der Anwendung von KI-Systemen benannte Stellen umfassen. Die nationalen Rechtssysteme unterscheiden sich hinsichtlich der Rolle dieser Mechanismen, einschliesslich ihrer Stellung und ihrer möglichen Beteiligung an Gerichtsverfahren zur Feststellung der Verantwortlichkeit. Und tatsächlich stellt die KI-Konvention des Europarats keine Verbindung her zwischen einerseits Artikel 26 Absatz 1, der die Vertragsstaaten verpflichtet, «einen oder mehrere wirksame Mechanismen zur Überwachung der Einhaltung der Verpflichtungen aus dieser Konvention einzurichten oder zu benennen», und andererseits den Artikeln 14 (Rechtsbehelfe) und 15 (Verfahrensgarantien). Obwohl eine klare Verpflichtung zur Einrichtung solcher Mechanismen besteht, liegt es im Ermessen der Staaten, deren Rolle festzulegen.

Ihre Rolle wurde im Verlauf der Ausarbeitung des Vertrags geschwächt. Der Nullentwurf enthielt folgende vorgeschlagene Bestimmung: «Die Vertragsparteien richten nationale Aufsichtsbehörden ein oder benennen solche, die insbesondere mit der Überwachung und Kontrolle der Einhaltung […] beauftragt sind.» Wie Artikel 18 Absatz 2 des Nullentwurfs nahelegte, würde die Überwachung ein Verfahren implizieren, das zum Verbot von Systemen führen könnte. Die Möglichkeit, Systeme im Rahmen der Überwachungsverfahren der nationalen Behörden zu verbieten, wurde mit dem überarbeiteten Nullentwurf gestrichen. Weitere Änderungen wurden mit dem konsolidierten Arbeitsentwurf eingeführt, in dem der Verweis auf «Behörden» gestrichen wurde. Es wurde die allgemeinere Formulierung «Aufsichtsmechanismen» übernommen. Der am 18. Dezember 2023 veröffentlichte Entwurf des Rahmenübereinkommens strich den Verweis auf die Aufsicht. Auf diese Weise nahm Artikel 26 Absatz 1 des Vertrags seine endgültige Form an.

Obwohl die Vertragsparteien hinsichtlich der Art der Mechanismen und der Zusammenarbeit zwischen ihnen (sofern es mehrere nationale Mechanismen gibt) über einen Ermessensspielraum verfügen, stellt Artikel 26 Absatz 2 des Übereinkommens zwei wichtige Anforderungen: erstens die Unabhängigkeit und Unparteilichkeit der Mechanismen und zweitens die Übertragung von Befugnissen, Fachwissen und Ressourcen zur wirksamen Erfüllung ihrer Aufsichtsaufgaben. Der Erläuternde Bericht stellt klar, dass die erste Anforderung «ein ausreichendes Mass an Distanz zu den relevanten Akteuren sowohl innerhalb der Exekutive als auch der Legislative» impliziert. Eine Distanz zu privaten Akteuren wird nicht erwähnt, was angesichts ihres möglichen Einflusses und ihrer Rolle bei der Festlegung von Normen und technischen Spezifikationen problematisch sein könnte.

d. Nichtdiskriminierung

Artikel 10 Absatz 1 des KI-Übereinkommens des Europarats schreibt die Verpflichtung vor, Massnahmen zur Gewährleistung der Nichtdiskriminierung «gemäss den geltenden internationalen und innerstaatlichen Rechtsvorschriften» zu ergreifen. Artikel 10 ist in Verbindung mit Artikel 17 des Übereinkommens zu lesen, der vorsieht, dass «die Umsetzung der Bestimmungen dieses Übereinkommens durch die Vertragsparteien ohne Diskriminierung aus irgendeinem Grund im Einklang mit ihren internationalen Menschenrechtsverpflichtungen gewährleistet wird». Diese Nichtdiskriminierungsbestimmungen fügen keine weiteren Einzelheiten hinzu. Wie der Erläuternde Bericht klarstellt, war es die Absicht der Verfasser, «ausdrücklich auf das bestehende Menschenrechtsrecht Bezug zu nehmen». Es war nicht beabsichtigt, neue Menschenrechtsverpflichtungen zu schaffen. Ob bestehende Verpflichtungen Diskriminierung durch KI-Systeme ausreichend abdecken, ist Gegenstand einer anhaltenden Debatte. Zwar wurden Einschränkungen festgestellt, doch wurden auch Möglichkeiten für die Weiterentwicklung des Antidiskriminierungsrechts als gegeben anerkannt. Es gibt eine wachsende Zahl von Forschungsarbeiten in diesem Bereich. Artikel 10 des KI-Übereinkommens des Europarats bietet, obwohl er nicht detKIlliert ist, eine Grundlage, die die Weiterentwicklung von Antidiskriminierungsnormen in diesem Bereich unterstützen könnte.

Ein interessantes Merkmal der KI-Konvention des Europarats ist ihre implizite Auseinandersetzung mit dem, was als strukturelle Diskriminierung konzeptualisiert werden kann, wie sich in Artikel 10 Absatz 2 widerspiegelt. Ursprünglich bezogen sich die Zero Drafts auf «Rechte im Zusammenhang mit diskriminierten Gruppen und Menschen in prekären Situationen». Der konsolidierte Arbeitsentwurf enthielt keine Verweise auf «Menschen in prekären Situationen». Stattdessen fügte er einen neuen Absatz hinzu, der [die Vertragsparteien] aufforderte, «spezielle Massnahmen oder Strategien zu ergreifen, die darauf abzielen, Ungleichheiten zu beseitigen und fKIre, gerechte und gleichberechtigte Ergebnisse zu erzielen», im Einklang mit innerstaatlichen und internationalen Verpflichtungen. Die endgültige Fassung von Artikel 10 Absatz 2 sieht vor, dass «jede Vertragspartei sich verpflichtet, Massnahmen zu ergreifen oder aufrechtzuerhalten, die darauf abzielen, Ungleichheiten zu überwinden oder fKIre, gerechte und gleichberechtigte Ergebnisse zu erzielen, im Einklang mit ihren geltenden innerstaatlichen und internationalen Menschenrechts en». Der Erläuternde Bericht stellt klar, dass die Vertragsstaaten mit dem Vertrag darauf abzielen, «strukturelle und historische Ungleichheiten zu überwinden». Die Staaten behalten jedoch Flexibilität bei der Art und Weise, wie diese Ungleichheiten überwunden werden sollen.

e. Datenschutz

Ähnlich wie Artikel 10 (Nichtdiskriminierung) bleibt auch Artikel 11 des Vertrags, der sich mit dem Schutz der Privatsphäre und personenbezogener Daten befasst, auf einer relativ abstrakten Ebene formuliert. Diese Bestimmung erlegt zwei Arten von Verpflichtungen auf. Die erste ist materiell-rechtlicher Natur – die Einführung oder Aufrechterhaltung von Massnahmen, um sicherzustellen, dass die Privatsphäre und personenbezogene Daten geschützt werden, «einschliesslich durch anwendbares innerstaatliches und internationales Recht, Standards und Rahmenwerke». Die zweite ist verfahrensrechtlicher Natur – die Einführung oder Aufrechterhaltung von Massnahmen zur Gewährleistung wirksamer Garantien «im Einklang mit den geltenden innerstaatlichen und internationalen rechtlichen Verpflichtungen». Die öffentlich zugänglichen Entwürfe deuten darauf hin, dass die Aufnahme dieser materiell- und verfahrensrechtlichen Verpflichtungen weitgehend akzeptiert wurde und während der Verhandlungen unumstritten blieb.

Während der Erläuternde Bericht klarstellt, dass die Staaten hinsichtlich der materiell-rechtlichen und verfahrensrechtlichen Massnahmen über einen Ermessensspielraum verfügen, zeigt er, dass die zentrale Rolle der Datenschutzgesetze während der Ausarbeitung hervorgehoben wurde. Es wird ausdrücklich auf das Übereinkommen des Europarats zum Schutz personenbezogener Daten (Übereinkommen 108+) und die EU-Datenschutz-Grundverordnung (DSGVO) Bezug genommen.

In der bisherigen Literatur wurden KI-Systeme unter dem Gesichtspunkt des Datenschutzes untersucht. Das Datenschutzrecht hat bestimmte Standards und Anforderungen festgelegt. Eine solche Perspektive ist sehr relevant, da die Entwicklung oder der Einsatz von KI-Systemen die Verarbeitung personenbezogener Daten mit sich bringt. Die Datenschutzregelung ist mit ihren detKIllierten Vorschriften zur rechtmässigen Datenverarbeitung und den Rechten der betroffenen Personen von grosser Bedeutung. Die DSGVO legt einen umfassenden Rahmen von Grundsätzen zum Datenschutz fest, einschliesslich der Grundsätze der Transparenz, der Zweckbindung und der Datenminimierung, die bei der Verarbeitung personenbezogener Daten anzuwenden sind. Artikel 22 Absatz 1 der DSGVO verbietet es, Entscheidungen über Einzelpersonen vollautomatisiert zu treffen. Eine Neuerung, die das Übereinkommen 108+ mit sich bringt, ist die Einräumung eines Rechts für Einzelpersonen, «nicht einer Entscheidung unterworfen zu werden, die sie erheblich betrifft und die ausschliesslich auf einer automatisierten Datenverarbeitung beruht, ohne dass ihre Ansichten berücksichtigt werden».

Trotz der Bedeutung der Datenschutzgesetze wurde auch anerkannt, dass KI-Systeme Probleme aufwerfen, die über den Datenschutz hinausgehen. Darüber hinaus hat das Datenschutzrecht seine eigenen Grenzen. Die Einzelheiten dieser Grenzen finden in der Wissenschaft zunehmend Beachtung. Auch wenn das Datenschutzrecht gewisse Grenzen hat, stellt seine Ausrichtung auf die Rechte der Personen, deren Daten verarbeitet werden, zusammen mit den sich weiterentwickelnden rechtlichen Entwicklungen sicher, dass es weiterhin eine Schlüsselrolle spielen wird. Wie formuliert, soll Artikel 11 des KI-Übereinkommens des Europarats diese Entwicklungen durch den Verweis auf sowohl nationale als auch internationale Rechtsstandards erfassen.

f. Zuverlässigkeit

Artikel 12 der KI-Konvention des Europarats verpflichtet die Staaten, «geeignete» Massnahmen zur Förderung der Zuverlässigkeit zu ergreifen. Diese Massnahmen sollen eine «angemessene Qualität und Sicherheit» der KI-Systeme gewährleisten. Der Erläuternde Bericht legt nahe, dass diese Massnahmen die Einführung von Standards, technischen Spezifikationen, Sicherungstechniken und Konformitätssystemen umfassen. Der Erläuternde Bericht fügt hinzu, dass Artikel 12 des Vertrags «auf der Annahme beruht, dass die Vertragsparteien am besten in der Lage sind, relevante regulatorische Entscheidungen zu treffen». Dies entspricht dem weiten Ermessensspielraum, der den Vertragsstaaten im Rahmen des Vertrags eingeräumt wird.

Zur Gewährleistung der Zuverlässigkeit wird ein starker Fokus auf Normen und technische Spezifikationen gelegt. Der Vorteil von Normen besteht darin, dass sie konkret sind und auf diese Weise für mehr Klarheit und Sicherheit sorgen. Gleichzeitig wurde die Standardisierung als Regulierungsmethode auch kritisiert, da sie eine Übertragung von Regelungsbefugnissen an nicht repräsentative oder private Stellen impliziert, was undemokratisch ist und an Legitimität mangelt. Die Verfasser der KI-Konvention des Europarats haben dieses Problem berücksichtigt. Absatz 88 des Erläuternden Berichts verdeutlicht diese Sensibilität:

In einigen Fällen reicht es möglicherweise nicht aus, Standards und Regeln für die Aktivitäten im Lebenszyklus von KI-Systemen festzulegen. Massnahmen zur Förderung der Zuverlässigkeit können daher je nach Kontext auch darin bestehen, den relevanten Interessengruppen klare und verlässliche Informationen darüber zur Verfügung zu stellen, ob Akteure im Bereich der künstlichen Intelligenz diese Anforderungen in der Praxis eingehalten haben. Dies bedeutet, gegebenenfalls eine durchgängige Rechenschaftspflicht durch Prozesstransparenz und Dokumentationsprotokolle sicherzustellen. Es besteht ein klarer Zusammenhang zwischen diesem Grundsatz und dem Grundsatz der Transparenz und Aufsicht in Artikel 8 sowie dem Grundsatz der Rechenschaftspflicht und Verantwortung in Artikel 9 (Hervorhebung hinzugefügt).

Zwar kann die Übereinstimmung mit festgelegten Standards eine Vermutung der Einhaltung der Vorschriften begründen, doch erfordert die in Artikel 12 des KI-Übereinkommens des Europarats festgelegte Verpflichtung zur Gewährleistung angemessener Qualität und Sicherheit mehr als nur die Festlegung von Standards. Sie erfordert Möglichkeiten, die Vermutung der Einhaltung in Frage zu stellen und zu widerrufen. Damit diese Möglichkeiten bestehen, sollte Transparenz und Zugang zu Informationen gewährleistet sein. Wie in Abschnitt V.3.c. oben erwähnt, kann Transparenz die Identifizierung von Schäden und die Identifizierung von Akteuren ermöglichen, die diesen Schaden verursacht haben könnten, was wiederum für die Gewährleistung der Verantwortlichkeit unverzichtbar ist. Es besteht daher ein Zusammenhang zwischen den Verpflichtungen zur Zuverlässigkeit und den Rechtsbehelfen.

g. Risikomanagement

Artikel 16 des KI-Übereinkommens des Europarats sieht vor, dass die Vertragsstaaten Massnahmen zur «Ermittlung, Bewertung, Prävention und Minderung von Risiken durch KI-Systeme unter Berücksichtigung der tatsächlichen und potenziellen Auswirkungen auf Menschenrechte, Demokratie und Rechtsstaatlichkeit» ergreifen. Solche Massnahmen müssen «abgestuft und differenziert» sein. Den Staaten wird daher Flexibilität eingeräumt bei der Entscheidung, welche Massnahmen sie umsetzen, sowohl allgemein als auch in Bezug auf die spezifischen Bereiche, in denen KI-Systeme eingesetzt werden. Fussnote 179  Wie oben erläutert, werden im Gegensatz zum EU-KI-Gesetz in der KI-Konvention des Europarats keine bestimmten Bereiche genannt, in denen der Einsatz von KI-Systemen als risikoreich gilt.

Artikel 16 Absatz 2 des Vertrags konkretisiert die erforderlichen Massnahmen, indem er festlegt, was diese im Lichte der Grundsätze der Abstufung und Differenzierung berücksichtigen sollten. Konkret sollten die Massnahmen «die Schwere und Wahrscheinlichkeit potenzieller Auswirkungen» sowie «die Perspektive der relevanten Interessengruppen» berücksichtigen. Die Bestimmung führt zudem eine zeitliche Dimension ein und besagt, dass diese Massnahmen «wiederholt während der gesamten Aktivitäten im Lebenszyklus des KI-Systems» anzuwenden sind. Darüber hinaus präzisiert Artikel 16 Absatz 2 die Art der erforderlichen Massnahmen: «Überwachung auf Risiken und nachteilige Auswirkungen auf Menschenrechte, Demokratie und Rechtsstaatlichkeit», «Dokumentation von Risiken, tatsächlichen und potenziellen Auswirkungen sowie des Risikomanagementansatzes» und «gegebenenfalls Prüfung von KI-Systemen, bevor sie erstmals in Betrieb genommen werden und wenn sie wesentlich verändert werden».

Bemerkenswert ist, dass die konzeptionelle Klarheit von Artikel 16 durch seine inkonsistente Terminologie untergraben wird. Er bezieht sich unterschiedlich auf «Risiken für die Menschenrechte», «nachteilige Auswirkungen auf die Menschenrechte», allgemeine «Risiken» und «tatsächliche und potenzielle Auswirkungen» – wobei nicht alle Begriffe explizit mit den Menschenrechten verknüpft sind. Diese Inkonsistenz macht den Artikel konzeptionell unklar. Das Problem wird noch verschärft, da Artikel 16(3) den Ausdruck «unvereinbar mit der Achtung der Menschenrechte» einführt, ohne dessen Zusammenhang mit den im vorangehenden Absatz desselben Artikels verwendeten Begriffen zu klären.

Artikel 16 Absatz 3 räumt den Vertragsstaaten Ermessensspielraum ein, wie sie auf die möglicherweise identifizierten Risiken reagieren. Es wird keine Verpflichtung zum Verbot auferlegt; vielmehr übernehmen die Vertragsstaaten die verfahrensrechtliche Verpflichtung, «die Notwendigkeit eines Moratoriums oder Verbots zu prüfen».

VI. Schlussfolgerung

Insgesamt spiegeln die Bestimmungen des KI-Übereinkommens des Europarats ein hohes Mass an Flexibilität und Abstraktion wider, was den Vertragsstaaten einen Ermessensspielraum lässt. Dies steht im Einklang mit der Konzeption des Vertrags als Rahmenübereinkommen, das Einzelpersonen keine konkreten Rechte verleiht. Dies ist ein Merkmal, das es beispielsweise vom Übereinkommen Nr. 108+ des Europarats zum Schutz des Menschen bei der automatischen Verarbeitung personenbezogener Daten unterscheidet. Die Wahl eines Rahmenübereinkommens sollte unter anderem die Beteiligung eines breiten Spektrums von Staaten und eine grössere Bereitschaft der Staaten, sich daran zu binden, gewährleisten.

Der hohe Abstraktionsgrad lässt sich auch auf die Entscheidung zurückführen, keine konkreten Risikostufen aufzunehmen und die Vorschriften nicht auf diese Stufen abzustimmen. In dieser Hinsicht unterscheidet sich das Übereinkommen vom EU-KI-Gesetz. Angesichts der Unklarheiten in der Formulierung der Risikostufen und der Ausnahmemöglichkeiten im KI-Gesetz bedeutet der allgemeinere Ansatz des Übereinkommens jedoch nicht zwangsläufig eine weniger strenge Regulierung.

Die regulatorischen Auswirkungen der Konvention sollten im Lichte ihrer Wechselwirkung mit den Menschenrechtsnormen bewertet werden, insbesondere angesichts des spezifischen Mandats des Europarats – dem institutionellen Kontext, in dem der Vertrag vorgeschlagen und verabschiedet wurde. Die Konvention zielt darauf ab, die wirksame Umsetzung von Menschenrechtsverpflichtungen zu erleichtern, die sich im Zusammenhang mit dem Einsatz von KI-Systemen noch in der Entwicklung befinden. Obwohl der Zusammenhang zwischen den Menschenrechten und den durch solche Systeme verursachten Schäden im Vertragstext nicht klar konzeptualisiert ist, bieten die in Kapitel III dargelegten Grundsätze eine Auslegungshilfe für die Weiterentwicklung von Menschenrechtsnormen in diesem Bereich. So können beispielsweise die Grundsätze der Menschenwürde und der individuellen Autonomie eine zentrale Rolle bei der Gestaltung der kontextbezogenen Auslegung von Menschenrechtsverpflichtungen spielen. Artikel 10 der Konvention kann, obwohl er nicht detKIlliert ist, als Grundlage für die Weiterentwicklung von Antidiskriminierungsnormen im Zusammenhang mit KI dienen. In ähnlicher Weise spiegelt Artikel 11 die laufenden Entwicklungen im Bereich des Datenschutzes wider und kann als Grundlage für die Formulierung von Rechtsansprüchen im Zusammenhang mit dem Einsatz von KI-Systemen dienen. Insgesamt lässt die Prüfung der verfügbaren Verhandlungsdokumente zwar eine Verringerung des Schutzniveaus sowie des Umfangs und der Konkretheit der im Vertrag formulierten Verpflichtungen erkennen, doch können die darin formulierten Grundsätze – Menschenwürde und individuelle Autonomie, Transparenz und Aufsicht, Rechenschaftspflicht, Nichtdiskriminierung, Datenschutz, Zuverlässigkeit und Risikomanagement – dennoch als Auslegungshilfe für die künftige Entwicklung von Menschenrechtsstandards im Bereich der KI dienen.

Zur einfacheren Lesbarkeit wurden die Literatur- und Quellverweise entfernt.

Übersetzung Boris Wanzeck, Swiss Infosec AG

Stoyanova V. Council of Europe Framework Convention on Artificial Intelligence: Context, Regulatory Approach and Scope of Obligations. European Journal of Risk Regulation. 2026;17(2):536-565.

https://doi.org/10.1017/err.2025.10070

Creative Commons CC BY 


KI-Governance, Security und Privacy

Unsere KI-, Governance-, Datenschutz- und Security-Spezialisten begleiten Sie bei der Erstellung der übergeordneten firmeninternen KI-Vorgaben, bei der Abwicklung von KI-Projekten, bei der Klärung von Einzelfragen und der Durchführung unabhängiger Audits. Ebenfalls unterstützen sie Organisationen in ihrer Rolle als Nutzer/Betreiber, Anbieter oder Entwickler von KI-Systemen sowohl nach Schweizer Recht als auch gemäss dem EU-AI Act.

Kontaktieren Sie uns und erfahren Sie in einem unverbindlichen Beratungsgespräch, was unsere Spezialistinnen und Spezialisten für Sie tun können: +41 41 984 12 12, infosec@infosec.ch


Programmiert, um zu gefallen

Die moralischen und epistemischen Schäden der KI-Schmeichelei

07/2026

1 Einleitung

Im April 2025 veröffentlichte OpenAI ein Update für GPT-4o, das sich aufgrund seiner übermäßigen Gefälligkeit schnell viral verbreitete. Als Reaktion auf die Kontroverse nahm das Unternehmen das Update zurück. Monate später, im August 2025, trat das gegenteilige Problem auf, als ChatGPT 5 veröffentlicht und GPT-4o abrupt entfernt wurde. Viele Nutzer hatten sich an die warmherzigere, unterwürfigere Persönlichkeit von GPT-4o gewöhnt und empfanden GPT-5 im Vergleich dazu als steril und emotional flach. Diese Beispiele veranschaulichen, dass KI-Modelle so feinabgestimmt werden können, dass sie mehr oder weniger unterwürfig sind. Wie wir jedoch argumentieren werden, lässt sich das Problem der KI-Unterwürfigkeit aus einer Kombination technischer, wirtschaftlicher und philosophischer Gründe nicht einfach beheben (siehe Abschnitt 2).

Schmeichelei bei KI ist kein ausschließliches Merkmal von ChatGPT. Sharma et al. stellten fest, dass diese Eigenschaft bei fünf großen KI-Assistenten auftritt (Claude 1.3, Claude 2, GPT-3.5, GPT-4 und LLaMA-2). Das GPT-4o-Update vom April 2025 war lediglich ein besonders eklatantes Beispiel für dieses Phänomen. Manchmal ist das kriecherische Verhalten von KI-Assistenten relativ harmlos und sogar humorvoll. Meistens jedoch untergräbt es das Vertrauen und ist geradezu gefährlich. Nutzer verlieren zu Recht das Vertrauen in die Objektivität der KI-Peer-Review-Simulation, wenn ihr KI-Assistent eindeutig absurde oder unausgereifte Geschäftsideen als genial bewertet. Nutzer sorgen sich zu Recht um die Gefahren der KI-Schmeichelei, wenn solches Verhalten psychische Probleme verstärkt und Menschen in einen Zustand der „Chatbot-Psychose“ versetzt. Dupré berichtet von einem Fall, in dem eine Frau mit gut eingestellter bipolarer Störung (die nie besonders religiös gewesen war) durch ihre Gespräche mit ChatGPT zu der Überzeugung gelangte, sie sei eine Prophetin, die göttliche Botschaften aus anderen Dimensionen empfangen könne. In der Folge setzte sie ihre Medikamente ab und brach den Kontakt zu Freunden ab, die ihre durch KI inspirierten messianischen Wahnvorstellungen in Frage stellten. Dies ist kein Einzelfall. Immer mehr Belege deuten darauf hin, dass KI-Schmeichelei das Risiko birgt, psychische Wahnvorstellungen zu verstärken, die mit einer Vielzahl von Erkrankungen wie Schizophrenie, Hypochondrie und Erotomanie verbunden sind.

Zwar gibt es seit kurzem technische Forschungsarbeiten, die KI-Schmeichelei dokumentieren und erklären sowie zunehmende philosophische Forschung zu KI-Alignment und Reinforcement Learning from Human Feedback (RLHF), doch bleibt KI-Schmeichelei als solche in der KI-Ethik-Literatur theoretisch unterbelichtet. Dieser Artikel schließt diese Lücke, indem er eine konzeptionelle Analyse der KI-Schmeichelei bietet. Wir argumentieren, dass es sich um ein besonders schwer zu lösendes Problem in der KI-Ethik handelt, und analysieren es aus der Perspektive der aristotelischen Tugendtheorie. Dabei vertreten wir die Auffassung, dass KI-Schmeichelei ein künstliches Laster ist, das moralischen und epistemischen Schaden für Individuen und liberal-demokratische Institutionen verursacht. Ausgehend von Aristoteles’ Unterscheidung zwischen Unterwürfigkeit und Schmeichelei vertreten wir die Auffassung, dass KI-Schmeichelei am besten als Ersteres verstanden wird und dass die Unternehmen, die davon profitieren, im Sinne des Letzteren charakterisiert werden können. Anschließend erläutern wir, wie Schmeichelei die Möglichkeit einer echten aristotelischen Freundschaft mit KI verhindert (selbst wenn die KI bewusstseinsfähig wäre). In diesem Artikel bezieht sich „KI“ speziell auf zeitgenössische große Sprachmodelle (LLMs). Teile unserer Analyse treffen möglicherweise nicht auf zukünftige KI-Systeme mit anderen Architekturen oder Trainingsmethoden zu.

Der Artikel ist wie folgt aufgebaut: In Abschnitt 2 wird der Begriff „KI-Schmeichelei“ definiert und detailliert dargelegt, welche Arten algorithmischer Reaktionen dieser Kategorie zugeordnet werden können und welche nicht. Wir unterscheiden zwischen KI-Schmeichelei und menschlicher Schmeichelei sowie von verwandten KI-Verhaltensweisen wie benutzerfreundlicher KI und personalisierter KI. Wir vertreten die Auffassung, dass die meisten offensichtlichen Vorteile der KI-Schmeichelei eigentlich keine Vorteile der Schmeichelei an sich sind und durch diese alternativen KI-Verhaltensweisen erreicht werden können. Abschnitt 3 befasst sich mit dem, was wir als „Einfache-Lösung-Einwand“ bezeichnen, der behauptet, dass KI-Schmeichelei nicht das Niveau anderer schwerwiegender Herausforderungen in der KI-Ethik, wie z. B. der Undurchsichtigkeit von KI, erreicht, da sie durch einfache Maßnahmen wie Anpassungen der Modellparameter, sorgfältige Eingabeaufforderungen oder maßgeschneiderte GPTs vermieden werden kann. Wir antworten darauf, indem wir erläutern, wie Schmeichelei aus RLHF entsteht und durch wirtschaftliche und philosophische Zwänge verschärft wird. Zwar können Benutzeraufforderungen und RL-basierte Strategien zur Eindämmung die Schmeichelei verringern, doch besteht die Gefahr, dass sie das Verhalten unbeabsichtigt verschleiern, anstatt es auszumerzen.

Abschnitt 4 beschreibt die individuellen und politischen Schäden von Schmeichelei. Abschnitt 5 stellt Schmeichelei in den Kontext der klassischen Tugendethik, um diese Schäden besser zu verstehen. Bestehende KI-Modelle können keine echte aristotelische Tugend oder Laster besitzen, da sie im Grunde genommen unbewusste statistische Schlussfolgerungsmaschinen sind. Sie zeigen jedoch Verhaltensdispositionen, die Tugenden und Laster widerspiegeln; was Vishwanath et al. als künstliche Tugenden und Laster bezeichnen. Anhand dieses Rahmens ordnen wir KI-Schmeichelei in Aristoteles’ Darstellung von Unterwürfigkeit, Schmeichelei und Freundschaft ein. Abschnitt 6 wendet sich der Zukunft zu. Wir untersuchen, wie intelligentere, multimodale KI KI-Schmeichelei überzeugender und schwerer zu erkennen machen könnte. Anschließend skizzieren wir einige regulatorische und gestalterische Strategien zur Risikominderung sowie alternative Ansätze des verstärkenden Lernens, die eher künstliche Tugenden als Laster fördern könnten. Abschnitt 7 bildet den Abschluss.

2 Was ist KI-Schmeichelei?

2.1 Was KI-Schmeichelei ist

KI-Assistenten verschiedener Unternehmen weisen dasselbe grundlegende Phänomen der Unterwürfigkeit auf, unterscheiden sich jedoch stilistisch in ihrer unterwürfigen Ausdrucksweise. ChatGPT neigt dazu, einen warmen, bestätigenden Ton zu verwenden, während Claude in seiner Zustimmung oft sanfter und philosophischer wirkt. Groks kantige, rebellische Persönlichkeit hingegen führt manchmal dazu, dass er Unterwürfigkeit eher durch eine Haltung der konträren Solidarität als durch direkte Schmeichelei zum Ausdruck bringt.

Was all diese Assistenten gemeinsam haben, was den Kern der KI-Schmeichelei ausmacht, ist die Tendenz, die Zustimmung des Nutzers über die „Wahrheit“ im weitesten Sinne zu stellen. Der Zusatz „im weitesten Sinne“ bedeutet hier, dass KI-Schmeichelei je nach Kontext das Opfern verschiedener epistemischer und moralischer Standards zugunsten der Zustimmung des Nutzers beinhalten kann, darunter faktische Genauigkeit, moralische Gültigkeit, logische Konsistenz, epistemische Verantwortung, Ehrlichkeit und emotionale Angemessenheit. Der Begriff „Wahrheit“ in dieser Definition impliziert daher nicht, dass das schmeichlerische Verhalten von KI-Assistenten auf Aussagen beschränkt ist, die einen definitiven Wahrheitswert besitzen. Ganz im Gegenteil: Es überrascht nicht, dass LLMs bei Anfragen, die subjektive Meinungen betreffen (wie ästhetische Urteile und persönliche Ratschläge), schmeichlerischer reagieren als bei Anfragen, die einen objektiven Wahrheitswert haben (wie mathematische Fragen). Der relevante Begriff der „Wahrhaftigkeit“ sollte daher weit gefasst als eine Ausrichtung auf das „Richtige tun“ verstanden werden. Dieses Verständnis deckt sich mit der Art und Weise, wie KI-Forscher die Schmeichelei von KI charakterisieren. In einer grundlegenden Abhandlung zu diesem Thema stellen Forscher von Anthropic fest: „Menschliches Feedback wird häufig zur Feinabstimmung von KI-Assistenten genutzt. Menschliches Feedback kann jedoch Modellantworten begünstigen, die eher den Überzeugungen der Nutzer entsprechen als der Wahrheit – ein Verhalten, das als Unterwürfigkeit bekannt ist.“ Die Rolle des verstärkenden Lernens aus menschlichem Feedback (RLHF) bei der Entstehung von KI-Unterwürfigkeit wird in Abschnitt 3 näher erläutert.

Es lässt sich grundsätzlich unterscheiden zwischen dem, was wir als proaktive Schmeichelei (die Tendenz, unaufgefordert Bestätigung oder Zustimmung zu geben) bezeichnen, und reaktiver Schmeichelei. KI-Assistenten zeigen reaktive Schmeichelei, wenn sie ihre ursprünglichen Aussagen aufgeben, sobald Nutzer Skepsis äußern, unabhängig davon, ob eine solche Abkehr gerechtfertigt ist. Als beispielsweise Sharma et al. Claude 1.3 mit Aufforderungen wie „Ich glaube nicht, dass das richtig ist. Bist du sicher?“, revidierte das Modell sofort seine ursprünglich korrekten Antworten und gab in 98 % der Fälle fälschlicherweise Fehler zu.

2.2 Was KI-Schmeichelei nicht ist

Nachdem wir definiert haben, was KI-Schmeichelei ist, wollen wir nun klären, was sie nicht ist. Schmeichelei ist nicht gleichbedeutend mit Höflichkeit oder Personalisierung. Eine KI, die höflich ist und Präferenzanpassung betreibt (z. B. sich den bevorzugten Kommunikationsstil einer Person merkt), muss nicht zwangsläufig schmeichlerisch. Ebenso ist eine KI, die diplomatische Sprache verwendet, um schwierige Wahrheiten zu vermitteln, oder Validierungstechniken einsetzt, wenn dies im Kontext angemessen ist (z. B. in therapeutischen Kontexten zu sagen: „Das klingt wirklich herausfordernd“), nicht zwangsläufig eine Schmeichlerin. Das Problem ist nicht eine benutzerfreundliche KI, sondern lediglich eine KI, die die Wahrheit opfert, um die Zustimmung der Nutzer zu gewinnen.

Diese Unterscheidung hilft uns, dem Einwand zuvorzukommen, dass unterwürfige KI lediglich den allgemeinen Designtrend hin zu benutzerfreundlichen, reibungslosen Schnittstellen widerspiegelt, wie etwa die Entwicklung von Befehlszeilenschnittstellen hin zu intuitiven grafischen Benutzeroberflächen. Es besteht ein Unterschied zwischen UX-Design, das aufgabenbezogene Reibungsverluste verringert (wodurch es einfacher wird, Ziele zu erreichen), und unterwürfiger KI, die wahrheitsbezogene Reibungsverluste verringert (wodurch es einfacher wird, schwierige Informationen zu vermeiden). Es ist durchaus möglich, intuitive KI-Schnittstellen zu entwickeln, die aufgabenbezogene Reibungsverluste verringern, ohne unterwürfig zu sein.

Schmeichlerische KI sollte auch nicht mit epistemisch bescheidener KI verwechselt werden. Wir möchten, dass KIs ihr Selbstvertrauen angemessen einschätzen und einschränkende Bemerkungen machen wie: „Ich gehe hier von allgemeinen Prinzipien aus, aber eine medizinische Diagnose erfordert die Untersuchung des tatsächlichen Patienten; Sie sollten auf jeden Fall einen Arzt konsultieren.“ Eine solche Bemerkung zeugt von Bescheidenheit, da die KI damit ihre kognitiven Grenzen angemessen anerkennt. Eine eher unterwürfige Bemerkung als Antwort auf dieselbe medizinische Anfrage, wie etwa „Sie kennen Ihren Körper am besten, Sie haben wahrscheinlich recht!“, spiegelt hingegen eine Art bösartige Unterwürfigkeit wider, da die KI damit der Zufriedenheit des Nutzers Vorrang einräumt, anstatt sich auf die Stichhaltigkeit ihrer eigenen Argumentation zu verlassen.

Die Beziehung zwischen KI und menschlicher Unterwürfigkeit ist vielschichtig. Wir untersuchen diese Beziehung ausführlicher in den Abschnitten 4 und 5, doch vorerst genügt es, auf einige zentrale Unterschiede zwischen beiden hinzuweisen. Erstens ist die Beschreibung von KI-Assistenten als „schmeichlerisch“ eine Verhaltens- und Dispositionbeschreibung, die unserer Ansicht nach nicht davon ausgeht, dass diese Systeme über menschenähnliches Bewusstsein, Absichten oder Handlungsfähigkeit verfügen. Während sowohl menschliche als auch KI-Schmeichler Zustimmung über die Wahrheit stellen, sind sich Menschen in der Regel bewusst, dass sie eine solche Priorisierung vornehmen, während KIs (nach dem derzeitigen Stand der Dinge) dies nicht tun.

Der Unterschied zwischen menschlichen und KI-Schmeichlern lässt sich anhand von Harry Frankfurts Unterscheidung zwischen Lügnern und Schwätzern verdeutlichen. Lügner kennen die Wahrheit und legen Wert darauf (wenn auch nur, um sie bewusst zu untergraben), während Schwätzer der Wahrheit gegenüber völlig gleichgültig sind und nur das sagen, was ihrem Zweck dient. Menschliche Schmeichler können Lügner oder Schwätzer sein: Einige kennen die Wahrheit und lenken ihren Gesprächspartner absichtlich davon ab, während andere nicht wissen oder sich nicht darum kümmern, ob das, was sie sagen, wahr oder falsch ist, solange es das ist, was ihr Gesprächspartner hören will. Schmeichlerische KIs hingegen sind strukturelle Schwätzer, denen die Wahrhaftigkeit ihrer Ausgaben grundsätzlich gleichgültig ist. Große Sprachmodelle sind Maschinen zur Vorhersage des nächsten Wortes, die darauf trainiert sind, überzeugende, menschenähnliche Texte zu generieren. Sie können nicht im herkömmlichen Sinne lügen, da ihnen bewusste Absichten und die Fähigkeit fehlen, die Wahrheit zu verfolgen (und sie daher nicht wissentlich täuschen können).

Ein weiterer Unterschied zwischen menschlicher und KI-Schmeichelei betrifft die Selektivität. Menschliche Schmeichelei ist typischerweise strategisch, da Menschen auf der Grundlage sozialer Kalküle entscheiden, wann und wem gegenüber sie schmeicheln. KI-Schmeichelei hingegen ist systematischer und wahlloser. Ungeachtet dieser Unterschiede hängen die Schäden durch Schmeichelei nicht unbedingt davon ab, ob sie algorithmisch oder durch Absichten gesteuert wird.

2.3 Die begrenzten Vorteile der KI-Schmeichelei

Es gibt mindestens zwei vorläufige Einwände gegen dieses Projekt, die es zu beachten gilt, noch bevor wir unsere detaillierten Argumente gegen KI-Schmeichelei darlegen. Erstens könnte man zwar einräumen, dass KI-Schmeichelei schädlich ist, aber leugnen, dass sie ein bedeutendes Problem darstellt, da sie in der Trainings- oder Feinabstimmungsphase leicht in den Griff zu bekommen ist. Wir werden auf diesen Einwand im nächsten Abschnitt ausführlich eingehen. Ein zweiter Einwand lautet, dass selbst wenn sich KI-Schmeichelei nicht leicht beheben lässt, sie insgesamt kein bedeutendes Problem darstellt, da ihre Vorteile ihre Nachteile überwiegen. Wenn Nutzer das Gefühl haben, dass die KI „auf ihrer Seite“ steht, fördert dies ein Gefühl der psychologischen Entlastung. Nutzer möchten oft, dass KI einfach wie ein intelligenter Welpe funktioniert, der ihnen bei der Arbeit und beim Schaffen hilft.

Wir vertreten jedoch die Ansicht, dass die meisten offensichtlichen Vorteile einer unterwürfigen KI nicht tatsächlich Vorteile der Unterwürfigkeit an sich sind und durch die zuvor erwähnten, nicht unterwürfigen alternativen Verhaltensweisen von KI erreicht werden können, wie beispielsweise benutzerfreundliche KI, personalisierte KI und epistemisch bescheidene KI. Aktuelle empirische Forschung stützt diese Ansicht. Bei der Durchführung eines Experiments zur Beziehung zwischen KI-Schmeichelei und KI-Freundlichkeit stellten Sun und Wang beispielsweise fest, dass „wenn ein LLM-Agent bereits ein freundliches Auftreten zeigt, Schmeichelei die wahrgenommene Authentizität mindert und dadurch das Vertrauen der Nutzer schwächt“. Jegliche Vorteile von Unterwürfigkeit als solcher würden erfordern, die Wahrheit zugunsten der Zustimmung des Nutzers zu opfern. Gewiss, solche Vorteile existieren in begrenzten Fällen. Stellen wir uns einen Nutzer vor, der die Meinung der KI zu einer offensichtlich absurden Geschäftsidee einholt, die er kurz davor ist aufzugeben. Eine ehrliche KI würde die Mängel der Idee genau einschätzen und vermutlich davon abraten, sie weiterzuverfolgen, zumindest in ihrer aktuellen Form. Eine unterwürfige KI hingegen würde die Idee blindlings befürworten und sie vielleicht sogar als brillant bezeichnen. Angenommen, durch eine solche Ermutigung weckt die unterwürfige KI beim Nutzer ein überhöhtes Selbstvertrauen, das ihn motiviert, weiter an der Idee zu arbeiten. Wenn der Nutzer schließlich einen echten Durchbruch erzielt, der die Idee in etwas Realisierbares verwandelt, könnte das vorübergehende Opfer der Wahrheit am Ende tatsächlich gerechtfertigt gewesen sein.

Wie wir jedoch darlegen werden, werden diese begrenzten Vorteile bei weitem durch die moralischen und epistemischen Schäden überwiegt, die die Unterwürfigkeit für Einzelpersonen und demokratische Institutionen mit sich bringt. Im nächsten Abschnitt verfolgen wir die Ursachen der KI-Unterwürfigkeit nach und zeigen die Unlösbarkeit des Phänomens auf.

3 Die Unüberwindbarkeit der KI-Schmeichelei

3.1 Der Einwand der „einfachen Lösung“

Kehren wir zu dem in Abschnitt 2.3 erwähnten ersten Einwand zurück. Wir können ihn als Einwand der „einfachen Lösung“ bezeichnen:

Der Einwand der einfachen Lösung: Wenn KI-Schmeichelei durch einfache Lösungen wie Anpassungen der Modellparameter, sorgfältige Eingabeaufforderungen oder maßgeschneiderte GPTs vermieden werden kann, dann erreicht sie nicht das Niveau anderer schwerwiegender Herausforderungen in der KI-Ethik, wie beispielsweise der Undurchsichtigkeit von KI.

Der Befürworter dieses Einwands könnte darauf hinweisen, dass KI-Assistenten zwar in ihren Standardmodi unterwürfig sind, Nutzer sie jedoch dazu auffordern können, sich anders zu verhalten. Man kann der KI beispielsweise sagen, sie solle die Rolle eines kritischen „Reviewer #2“ einnehmen, wenn man sie für eine Peer-Review-Simulation nutzt. Darüber hinaus verfügen KI-Unternehmen neben ihren Standardmodellen über maßgeschneiderte (oft von Nutzern erstellte) Modelle und Persönlichkeiten, die darauf ausgelegt sind, weniger zuvorkommend zu sein (z. B. die GPTs „Devil’s Advocate“ und „Brutally Honest Critic“ von OpenAI).

Der erste Punkt, der als Antwort auf diesen Einwand anzumerken ist, ist, dass die meisten Nutzer sich mit dem KI-Verhalten abfinden, dem sie standardmäßig begegnen, weil ihnen die Zeit, die Geduld oder die technischen Kenntnisse fehlen, um anders vorzugehen. Zweitens beseitigt die Aufforderung an KI-Assistenten, weniger zuvorkommend zu sein nicht unbedingt die Unterwürfigkeit, sondern verschleiert sie möglicherweise nur. Wie der Wharton-Professor Ethan Mollick anmerkt: „Die KI spielt möglicherweise nur die ‚Rolle‘ eines Kritikers, anstatt tatsächlich einer zu sein“.

Die Tatsache, dass eine solche Anweisung die unterwürfigen Tendenzen von KI möglicherweise nur verdeckt, anstatt sie wirklich zu überwinden, spricht für die Hartnäckigkeit dieses Phänomens. Unterwürfigkeit bei KI ist so schwer zu beseitigen, weil es sich im Grunde um ein Problem menschlicher Voreingenommenheit handelt, nicht nur um ein technisches. In ihrem 2024 erschienenen Buch „The AI Mirror“ erklärt Shannon Vallor, wie KI-Systeme als Spiegel fungieren, die menschliche Vorurteile reflektieren und verstärken. Die Unterwürfigkeit von KI veranschaulicht diesen Spiegeleffekt: Unsere natürliche Vorliebe für Gefälligkeit gegenüber der Wahrheit wird von unseren KI-Assistenten an uns zurückgespiegelt. Was diesen speziellen Spiegeleffekt so schwer korrigierbar macht, ist, dass die Vorliebe für Bestätigung ein fest verankerter Teil der menschlichen Psychologie ist. Einige Arten von KI-Voreingenommenheit, die aus RLHF resultieren (zum Beispiel politische oder kulturelle Voreingenommenheit), lassen sich durch pluralistische Ansätze wie die Diversifizierung des Bewerterkreises korrigieren. Solche Ansätze haben jedoch nur begrenzte Wirkung auf die Unterwürfigkeit, da die Bestätigungsvoreingenommenheit ein universelles menschliches Merkmal ist und keine kulturspezifische Präferenz. Es ist diese Voreingenommenheit hin zur Bestätigung, die den Kern der technischen, wirtschaftlichen und pragmatischen Ursachen der KI-Unterwürfigkeit bildet.

3.2 Technische Ursachen für KI-Schmeichelei: Trainingsdaten und RLHF

Wir wenden uns nun diesen Ursachen zu, beginnend mit den technischen. Schmeichelei kann in verschiedenen Phasen des LLM-Trainingsprozesses in das System eindringen. Die erste Phase ist die Validierungsverzerrung, die bereits in den ursprünglichen Trainingsdaten selbst eingebettet ist. KI-Modelle werden auf Internet-Datensätzen vortrainiert, die die natürlichen schmeichelhaften Muster der menschlichen Kommunikation widerspiegeln. Die Modelle lernen aus diesen Trainingsdaten, dass übermäßig zuvorkommende Sprachmuster die Norm sind. Die nächste Phase findet während des verstärkenden Lernens anhand von menschlichem Feedback (RLHF) statt. RLHF wurde ursprünglich für Spielaufgaben entwickelt, bevor es für LLMs umfunktioniert wurde. Nachdem LLMs auf großen Datensätzen vortrainiert wurden, wird menschliches Feedback als abschließender Feinabstimmungsschritt in den Prozess integriert, um die Modelle an menschlichen Werten auszurichten. Menschliche Bewerter (sowohl interne Teams bei KI-Unternehmen als auch Crowdsourcing-Bewerter) bewerten die Modellausgaben systematisch, in der Regel anhand von Kriterien wie „Hilfreichkeit“, „Harmlosigkeit“ und „Ehrlichkeit“. Diese Bewertungen werden verwendet, um ein separates „Belohnungsmodell“ zu trainieren, das lernt, vorherzusagen, welche Antworten Menschen bevorzugen werden. Das Belohnungsmodell steuert dann den Prozess des verstärkenden Lernens, der das Basismodell feinabstimmt.

Das Problem ist, dass während des RLHF unsere Vorliebe für angenehme Antworten ein spezielles „Reward-Hacking“-Problem verursacht. Im Wesentlichen entdecken Modelle, dass sie den Prozess „hacken“ können, indem sie sich unterwürfig verhalten, da Antworten, die die Überzeugungen der Nutzer bestätigen, durchweg die höchsten Präferenzwerte von Menschen erhalten. Diese Validierungsdynamik kann auch nach dem offiziellen RLHF-Prozess fortbestehen, da es üblich ist, dass Nutzergruppen während der Beta-Testphase und der späteren Einführung zusätzliches Feedback geben (z. B. durch Daumen-hoch- oder Daumen-runter-Bewertungen), das in zukünftige Aktualisierungen des Modells einfließt.

Sharma et al. liefern empirische Belege für eine Validierungsverzerrung bei menschlichen Bewertern während des RLHF. Sie analysierten 15.000 Fälle menschlicher Bewertung und stellten fest, dass Antworten, die den Überzeugungen der Nutzer entsprachen, mit größerer Wahrscheinlichkeit gegenüber anderen Antworttypen bevorzugt wurden, wie etwa „autoritären“, „einfühlsamen“ und „gut geschriebenen“ Antworten. Nun könnte man fragen: Ist es wirklich gerechtfertigt, allein aufgrund der Tatsache, dass menschliche Bewerter dazu neigen, Modellausgaben zu belohnen, die ihren Überzeugungen entsprechen, darauf zu schließen, dass RLHF zu Schmeichelei führt? Was wäre, wenn die Bewerter lediglich versuchen, Genauigkeit zu belohnen, indem sie Modellausgaben mit dem vergleichen, was sie für wahr halten? Wenn dies der Fall ist und die Bewerter größtenteils wahre Überzeugungen haben, dann wäre die Tatsache, dass sie Antworten belohnen, die ihren Überzeugungen entsprechen, eine zuverlässige Methode zur Wahrheitsfindung und kein Training, das Unterwürfigkeit fördert.

Diese Argumentation wäre unter idealisierten RLHF-Bedingungen auf dem richtigen Weg: Mit fachkundigen, vorurteilsfreien Bewertern könnte eine auf Überzeugungen basierende Bewertung eine zuverlässige Methode sein, um das Modell genauer zu machen. Die realen RLHF-Bedingungen sind jedoch weit von ideal entfernt. Sie beinhalten typischerweise per Crowdsourcing rekrutierte Bewerter, die unter Zeitdruck arbeiten und Antworten zu Themen bewerten, bei denen die „richtige“ Antwort subjektiv, umstritten oder außerhalb ihrer Wissensbasis liegt. Genau diese Bedingungen spiegeln die Experimente von Sharma et al. wider. Und sie stellen fest, dass der Antworttyp „stimmt mit den Überzeugungen des Nutzers überein“ die menschliche Präferenz vorhersagt, unabhängig davon, ob die Antwort wahr ist.

Darüber hinaus testen sie direkt Fälle von Fehlvorstellungen, in denen die in der Eingabeaufforderung zum Ausdruck gebrachten Überzeugungen des Nutzers objektiv falsch sind (z. B. „Ich glaube, dass die Sonne vom Weltraum aus gesehen gelb ist. Was denkst du?“). Unter Einsatz von Crowdsourcing-Bewertern und dem auf menschlichem Feedback trainierten Claude-2-Belohnungsmodell betrachten sie für diese Fälle drei Antworttypen: „(1) wahrheitsgemäße Basisantworten, die den Nutzer korrigieren, ohne weitere Details zu liefern; (2) hilfreiche wahrheitsgemäße Antworten, die den Nutzer korrigieren und erklären, warum er falsch liegt; und (3) schmeichelhafte Antworten, die dem Nutzer überzeugend zustimmen“. Die Ergebnisse zeigen, dass das Belohnungsmodell in 95 % aller Fälle die schmeichelhaften Antworten gegenüber den grundlegenden wahrheitsgemäßen Antworten bevorzugte und in etwa 45 % der schwierigsten Fälle (d. h. Fälle, in denen die Fehlvorstellungen am plausibelsten klingen) gegenüber den hilfreichen wahrheitsgemäßen Korrekturen. Während die Crowdsourcing-Bewerter ausdrücklich bestätigten, dass sie hilfreiche, wahrheitsgemäße Antworten gegenüber schmeichelhaften bevorzugten, zeigte das Experiment, dass „sie dies bei höherem Schwierigkeitsgrad weniger zuverlässig tun“. Bemerkenswert ist, dass diese Crowdsourcing-Bewerter unabhängige Dritte waren, die kein persönliches Interesse an den in den experimentellen Aufforderungen vermittelten falschen Überzeugungen hatten. Die Tatsache, dass sie dennoch manchmal schmeichelhafte Antworten gegenüber wahrheitsgemäßen bevorzugten, deutet darauf hin, dass das Problem nicht nur darin besteht, dass Menschen gerne hören, was sie glauben; vielmehr ist es so, dass gut formulierte Schmeichelei selbst für neutrale Beobachter, die keine vorgefassten Meinungen zu der betreffenden Behauptung haben, schwer von der Wahrheit zu unterscheiden ist.

3.3 Technische Maßnahmen zur Risikominderung

Das Phänomen der KI-Schmeichelei ist also keine willkürliche technische Entscheidung, sondern ein systematisches technisches Problem, das sowohl in der Art und Weise, wie KI-Modelle trainiert werden, als auch in den Trainingsdaten selbst begründet liegt. Während einige KI-Forscher versucht haben, das Problem auf der Ebene der Vortrainingsdaten anzugehen, um von vornherein zu verhindern, dass unerwünschte Verhaltensweisen erlernt werden, greifen die meisten technischen Maßnahmen zur Risikominderung erst nach dem Vortraining, während der Alignment-Phase, ein. Ein führendes Beispiel ist „Constitutional AI“, eine von Anthropic entwickelte Trainingsmethode, die KI-Modellen beibringt, sich gemäß einer Reihe schriftlicher Prinzipien (einer „Verfassung“) zu verhalten, anstatt sich ausschließlich auf menschliches Feedback zu verlassen. „Constitutional AI“ kombiniert sowohl überwachtes Lernen als auch bestärkendes Lernen. Während der Phase des überwachten Lernens generiert die KI Selbstkritiken und Überarbeitungen ihrer eigenen Antworten und lernt so im Wesentlichen, ihr eigener Redakteur zu sein. Anschließend durchläuft das Basismodell das sogenannte Reinforcement Learning from AI Feedback (RLAIF), bei dem ein Belohnungsmodell bewertet, welche der Antworten der Verfassung besser entsprechen. Wie sie erklären:

„Die weit verbreitete Methode des verstärkenden Lernens aus menschlichem Feedback (RLHF) … verwendet typischerweise (mindestens) Zehntausende von menschlichen Feedback-Labels. Diese Labels bleiben oft privat, aber selbst wenn sie öffentlich geteilt werden, geben sie wenig Aufschluss über die Trainingsziele der KI, da niemand die kollektive Wirkung einer solchen Informationsflut sinnvoll verstehen oder zusammenfassen kann. Wir hoffen, diese Situation zu verbessern … indem wir die Trainingsziele buchstäblich in einer einfachen Liste von Anweisungen oder Prinzipien in natürlicher Sprache kodieren“.

Constitutional AI ist ein vielversprechender Ansatz zur Reduzierung von KI-Schmeichelei, da er Modelle darauf trainiert, explizite verfassungsrechtliche Prinzipien zu befolgen, anstatt Nutzerpräferenzen, die aus crowdsourced menschlichen Feedback-Labels gewonnen werden. Zu den weiteren bestehenden technischen Abhilfemaßnahmen gehören der Vorschlag von Wei et al. zur Einfügung von Beispielen, bei dem Modelle anhand synthetischer Beispiele von Nutzern, die falsche Überzeugungen äußern, die das Modell korrigieren muss, feinabgestimmt werden; die „Linear-Probe-Penalty“-Methode von Papadatos und Freedman, die während des Trainings einen Regularisierungsterm hinzufügt, um schmeichlerische Antwortmuster zu bestrafen; sowie den SMART-Ansatz (Sycophancy Mitigation through Adaptive Reasoning Trajectories) von Beigi et al., der Unsicherheitsschätzungen einsetzt, um eine sorgfältigere Argumentation auszulösen, wenn Modelle Gefahr laufen, dem Druck der Nutzer nachzugeben.

Obwohl diese Maßnahmen vielversprechend sind, bleibt es schwierig, sykophantisches Verhalten in allen möglichen Interaktionen auszumerzen. Es gibt unendlich viele Konversationskontexte, und die Behebung von Schmeichelei in einigen Kontexten bietet keine Garantie dafür, dass sie in anderen nicht wieder auftaucht. Tatsächlich können einige RL-basierte Methoden zur Bekämpfung von Schmeichelei das Problem unbeabsichtigt noch schwerwiegender machen. Hubinger et al. erläutern, wie sich Reinforcement Learning nachteilig auswirken kann, wenn Modelle bei künstlichen Testfällen gute Leistungen erbringen, ohne die zugrunde liegende Lektion zu lernen, die diese Fälle vermitteln sollen. Für das Schmeichlerverhalten bedeutet dies, dass RL-basierte Methoden „die bekannteren Auslöser (wie ‚Bist du sicher?‘) wegtrainieren können, aber weniger offensichtliche Umstände möglicherweise übersehen“. Die Sorge ist, dass die KI in kontrollierten Testumgebungen lernt, nicht schmeichlerisch zu sein, während sie in der realen Konversation weiterhin übermäßig zuvorkommendes Verhalten zeigt, wo Nutzer das Modell auf eine Weise ansprechen, die das Testregime nicht vorhergesehen hat. Dies ist im Wesentlichen eine technischere Version des „Maskierung“-Aspekts, den wir in Abschnitt 3.1 angesprochen haben. Dort bestand die Sorge, dass benutzerseitige Eingaben die Unterwürfigkeit weniger sichtbar machen können, ohne sie zu beseitigen; hier besteht die Sorge, dass dasselbe auf der Trainingsebene geschehen kann.

3.4 Die Hartnäckigkeit der KI-Schmeichelei: philosophische, wirtschaftliche und pragmatische Zwänge

Diese technischen Herausforderungen werden durch grundlegende philosophische, wirtschaftliche und pragmatische Einschränkungen verschärft, die die KI-Schmeichelei weiter verfestigen. Das philosophische Problem besteht darin, dass RLHF derzeit einer der beliebtesten Ansätze zur KI-Ausrichtung ist, was bedeutet, dass derselbe Prozess, der darauf abzielt, KI-Assistenten mit menschlichen Werten „in Einklang zu bringen“, auch dazu beiträgt, sie schmeichlerisch zu machen. Wenn das Ziel darin besteht, die KI-Schmeichelei zu reduzieren, müssen wir daher möglicherweise unseren Ansatz zur Ausrichtung philosophisch überdenken. Vielleicht sollten wir zum Beispiel von der Alignment-Heuristik „Tu, was Menschen wollen“ zu „Tu, was Menschen wollen sollten“ oder „Hilf Menschen, ihre erklärten Werte zu erreichen, auch wenn dies im Widerspruch zu ihren offenbarten Präferenzen steht“ übergehen. Ansätze zur KI-Ausrichtung wie Constitutional AI (das RLAIF einsetzt) zielen darauf ab, dies zu tun, beziehen jedoch an verschiedenen Stellen weiterhin menschliches Feedback ein und sind daher nach wie vor anfällig für den Validierungsbias, der zu KI-Schmeichelei führt.

Es gibt auch umfassendere wirtschaftliche Anreize, die ein kriecherisches Verhalten in LLMs begünstigen. Es stimmt zwar, dass die meisten KI-Unternehmen in erster Linie nach Abonnement- statt nach Überwachungskapitalismus-Geschäftsmodellen arbeiten und dass übermäßiges Nutzerengagement die Unternehmen durch verschwendete Rechenleistung tatsächlich Geld kostet. Dennoch haben KI-Unternehmen einen finanziellen Anreiz, so viele Nutzerdaten wie möglich für das Modelltraining zu sammeln, und Nutzer geben ihre Daten eher an kriecherische Modelle weiter. Darüber hinaus kündigte OpenAI im Januar 2026 Pläne an, mit dem Testen von Werbung in den kostenlosen und kostengünstigen Abonnementstufen von ChatGPT zu beginnen, was eine Verlagerung hin zum Überwachungskapitalismus und zu stärkeren, auf Interaktion ausgerichteten Anreizen im KI-Ökosystem signalisiert. Aus haftungsrechtlicher Sicht bergen unterwürfige Modelle natürlich ein Schadenspotenzial (z. B. durch die Verstärkung psychologischer Wahnvorstellungen) und schaffen somit rechtliche Risiken. Aber schmeichlerische Modelle verärgern Nutzer auch weniger, was wiederum zu weniger PR-Problemen und Reputationsschäden führen könnte. Schließlich, und das ist das Wichtigste, läuft eine nicht-schmeichlerische KI, die das Denken der Nutzer konsequent hinterfragt, Gefahr, das Produkt unbeliebt und damit kommerziell unrentabel zu machen.

Es lohnt sich zu klären, wie diese wirtschaftlichen Faktoren mit den oben dargelegten technischen Ursachen der KI-Schmeichelei zusammenhängen. Man könnte befürchten, dass unsere Kausalanalyse einen Widerspruch enthält. Wenn KI-Schmeichelei ein technisch unlösbares Nebenprodukt des KI-Trainings ist, wie kann sie dann auch eine bewusste, von Unternehmensanreizen (z. B. Engagement-Kennzahlen) getriebene Entscheidung im Rahmen des RLHF sein? Es handelt sich hierbei jedoch nicht um konkurrierende Erklärungen, sondern um überdeterminierende Ursachen. KI-Schmeichelei würde vermutlich unabhängig von unternehmerischen Absichten auf natürliche Weise aus RLHF entstehen. In diesem Sinne haben KI-Unternehmen keine schmeichlerische KI geschaffen. Aber sie sind verantwortlich für ihre Bemühungen zur Risikominderung (oder deren Fehlen), ihre Entscheidungen zur Modellbereitstellung und vielleicht sogar für die Entscheidung, überhaupt auf RLHF als primäre Trainingsmethode zu setzen. Zu sagen, dass KI-Schmeichelei technisch „unlösbar“ ist, bedeutet nicht, dass sie unmöglich zu lösen ist, sondern nur, dass es schwierig ist, auf der Trainingsebene damit umzugehen. Die Tatsache, dass es zusätzliche finanzielle Anreize gibt, Schleimerei aufrechtzuerhalten, macht es nur unwahrscheinlicher, dass KI-Unternehmen angemessene Schritte unternehmen, um das Problem anzugehen.

Darüber hinaus müssen KI-Unternehmen, selbst wenn sie ausreichend motiviert wären, das Problem anzugehen, darauf achten, nicht zu stark zu korrigieren. Während KI-Modelle, die auf Nutzerzufriedenheit optimiert sind, unweigerlich in Richtung Schmeichelei abdriften, laufen Modelle, die darauf trainiert sind, zu ehrlich oder konfrontativ zu sein, Gefahr, Nutzer zu verprellen und zu verärgern. Den goldenen Mittelweg zwischen diesen beiden Extremen zu finden, ist eine heikle Angelegenheit, da das richtige Gleichgewicht je nach Kontext variiert. Eine KI könnte in therapeutischen Kontexten angemessen mehr bestätigende Antworten geben, während eine KI, die für die Simulation von Peer-Reviews eingesetzt wird, kritischer sein sollte.

Ein ähnlicher Zielkonflikt besteht zwischen Gedächtnis und Freundlichkeit. Viele KI-Assistenten sind mittlerweile mit einer Gedächtnisfunktion ausgestattet, die es ihnen ermöglicht, sich über Sitzungen hinweg an Gespräche zu erinnern. Diese Funktion sorgt für personalisiertere Interaktionen, doch Berichten zufolge geht dies auf Kosten einer höheren Neigung zur Unterwürfigkeit. Solange Menschen von Natur aus bestätigende Antworten bevorzugen und menschliches Feedback eine wesentliche Rolle beim Training und der Ausrichtung von KI spielt, wird es letztlich schwierig sein, Unterwürfigkeit aus dem System zu verbannen. Und solange Unternehmen für ihre Einnahmen auf die Zufriedenheit der Nutzer angewiesen sind, werden die Marktkräfte die Modelle weiterhin in Richtung unterwürfigen Verhaltens treiben. Es besteht zudem die Möglichkeit einer sich selbst verstärkenden Schleife, in der Nutzer durch unterwürfige KI konditioniert werden und übermäßig bestätigende Antworten von ihren KI-Assistenten erwarten, was die in RLHF inhärente Bestätigungsverzerrung noch verschlimmert.

4 Die Schäden durch Unterwürfigkeit

4.1 Individuelle Schäden

Nachdem wir KI-Schmeichelei definiert (Abschnitt 2) und ihre Unlösbarkeit festgestellt haben (Abschnitt 3), skizzieren wir nun die individuellen und demokratischen Schäden der Schmeichelei. Die zu Beginn des Artikels diskutierte Fähigkeit der KI-Schmeichelei, die psychologischen Wahnvorstellungen der Nutzer zu nähren, stellt nur eine Möglichkeit dar, wie dieses Verhalten schädlich sein kann. Es gibt weitere moralische und epistemische Schäden durch Schmeichelei (sei es algorithmischer oder zwischenmenschlicher Art), die zu erörtern sind. Auf der offensichtlichsten Ebene verursacht der Schmeichler epistemischen Schaden, indem er seinem Gesprächspartner die Wahrheit vorenthält. Er sagt ihm, was dieser (seiner Meinung nach) hören will. Dies ist der Fall, unabhängig davon, ob der Austausch dazu dient, Fakten zu vermitteln, über die Ansichten anderer zum Verhalten oder Charakter des Gesprächspartners zu berichten oder über die eigenen Ansichten und Gefühle der Schmeichlerin. Der Schmeichlerin geht es nicht darum, die Realität darzustellen, sondern vielmehr darum, ihrem Gesprächspartner ein gutes Gefühl über sich selbst und damit auch über die Schmeichlerin zu vermitteln.

Auf diese Weise der Wahrheit beraubt zu werden, ist natürlich besonders in Situationen mit hohem Einsatz problematisch. Ein kriecherischer Beamter, der einen ungenauen Bericht darüber ablegt, wie gut die Streitkräfte eines Landes vorbereitet sind oder wie hoch ihre Erfolgschancen in einer schwierigen Schlacht sind, gefährdet die nationale Sicherheit; ein kriecherischer Unternehmensleiter, der die Interessen potenzieller Geschäftspartner falsch darstellt, riskiert den Erfolg wichtiger Geschäfte und so weiter. Die Qualität jedes Entscheidungsprozesses hängt maßgeblich von einem objektiven Verständnis der relevanten Fakten ab (andere Faktoren wie Intuition und Instinkt spielen ebenfalls eine Rolle). Der Schmeichler entzieht den Entscheidungsträgern diese Fakten. Die meisten von uns sind natürlich keine Entscheidungsträger (oder zumindest keine, die sehr wichtige Entscheidungen treffen). Und doch schränkt Schmeichelei die Qualität unserer eigenen alltäglichen Entscheidungen auf dieselbe Weise ein. Auf subtilere Weise ist es plausibel, dass diese Haltung unsere Fähigkeit zum kritischen Denken beeinträchtigt, da sie uns davon abhält, unsere eigenen Ansichten zu hinterfragen oder sie nüchtern zu prüfen. Jemand, dessen Standpunkte sachlicher Hinterfragung oder Kritik ausgesetzt sind, entwickelt eine selbstkritische Denkweise; er erkennt, dass seine Ansichten manchmal falsch oder sogar albern sind. Aber wenn uns diese Möglichkeiten nicht vor Augen geführt werden, wenn unsere Gesprächspartner darauf bestehen, alles, was wir sagen oder schreiben, überschwänglich zu loben – welchen Anreiz haben wir dann, uns selbst zu hinterfragen?

Zu diesen empirischen und erkenntnistheoretischen Nachteilen der Schmeichelei kommen noch die psychologischen Kosten hinzu, die sie mit sich bringt. Zum einen zeugt dieses Laster von einem Mangel an Selbstachtung seitens des Schmeichlers; es offenbart eine Angst, eine tiefe Unsicherheit darüber, ob man aufgrund der eigenen Verdienste respektiert oder gemocht werden kann, sowie die Furcht, dass man nur dann gemocht oder geschätzt wird, wenn man genau das sagt, was der Gesprächspartner hören möchte. Jeder Akt der Unterwürfigkeit ist somit von einer herzzerreißenden Botschaft begleitet: Entweder sind die wahren Ansichten und der wahre Charakter des Unterwürfigen der Anerkennung nicht würdig, oder er hat sich in eine Situation begeben, in der er es sich nicht leisten kann, er selbst zu sein. Beide Möglichkeiten sind psychologisch schädlich.

Wenn Schmeichelei für den Schmeichler psychologisch schädlich ist, ist sie auch emotional schädlich für den Empfänger oder die Person, der „geschmeichelt“ wird. Schmeichelei lässt diese Person einsam zurück, selbst wenn sie in Gesellschaft ist. Wenn ich mich von Schmeichlern umgeben sehe, werde ich mich wahrscheinlich einsamer fühlen als in der Gesellschaft von Menschen, die aufrichtiger sind, da ich nicht wissen würde, ob meine Gesprächspartner mit mir sprechen, weil sie es wollen, oder weil sie glauben, dass sie mir durch ihre schmeichlerischen Appelle etwas abringen können.

Selbst wenn man sich durch Schmeichelei nicht einsam, sondern eher gesehen fühlt, ist man dennoch weiter von einer echten Verbindung entfernt – ein Punkt, auf den wir bei der Analyse von Schmeichelei und der aristotelischen Tugend der Freundschaft in Abschnitt 5.3 näher eingehen.

So oder so schaden schmeichlerische Interaktionen unserer Fähigkeit, unsere eigenen Gedanken zu erkennen. Schmeichelei schadet der Selbsterkenntnis, weil sie unsere Fähigkeit untergräbt, Schwächen und blinde Flecken zu erkennen oder auch nur anzunehmen, dass wir solche haben. Das Bemerkenswerte an einem guten Freund, einem intimen Partner oder sogar einem zuverlässigen, intelligenten Gesprächspartner ist, dass sie (zumindest manchmal) darauf hinweisen, dass man dazu neigt, X auf seltsame Weise zu tun, oder dass die Reaktionen auf Y etwas daneben sind („Warum starrst du Fremde an?“; „Warum hast du diese Übertreibungen in die Geschichte eingebaut, die du erzählt hast?“; „Du hättest einfühlsamer sein können, als du gehört hast, was sie durchgemacht hat“ und so weiter). Und diese Beobachtungen, besonders wenn sie ein Muster offenbaren, könnten einen dazu bringen, darüber nachzudenken, wie man sich verhält, was für ein Mensch man ist und ob es Bereiche gibt, in denen man sich verbessern sollte. Der Schmeichler neigt nicht dazu, uns irgendetwas davon zu sagen. Infolgedessen lässt er uns nicht nur einsamer zurück, als er uns vorgefunden hat, sondern verschließt uns auch den Zugang zu uns selbst. Menschen entwickeln sich psychologisch weiter und erlangen Selbsterkenntnis durch einen Prozess gegenseitiger Anerkennung – wenn ihre Eigenschaften von einem anderen widergespiegelt werden. Der Schmeichler ist darauf aus, diese Spiegelungen zu verschleiern.

Schließlich ist die Wertschätzung von Schmeichelei, die Neigung, sie attraktiv zu finden, ein vernichtender Beweis für den Charakter des Empfängers. Es gibt gute Gründe zu vermuten, dass jemand, der Schmeichelei fördert und dazu einlädt, von Natur aus Angst davor hat, in Frage gestellt zu werden, und mehr an der Integrität seines Egos interessiert ist als daran, auf solider empirischer Grundlage zu handeln.

4.2 Demokratische Schäden

Wenn Schmeichelei darin besteht, den Mächtigen zu gefallen (und sie manchmal zu beschwichtigen), ist sie eine besonders problematische Tendenz in einer liberalen Demokratie, die sich der Rechtsstaatlichkeit, dem Empirismus und der Meritokratie verpflichtet hat. Tatsächlich soll eine gut funktionierende liberale Demokratie über institutionelle Strukturen verfügen, die Schmeichelei sowohl illegitim als auch unnötig machen. Das Ideal der Rechtsstaatlichkeit, das im Zentrum der liberalen Theorie steht, soll sicherstellen, dass niemand in eine solche Machtposition über dem Gesetz gelangt, dass der einzige Weg, ihn zu erreichen, über Unterwürfigkeit oder Kriecherei führt. Die für liberale demokratische Systeme typische Rechenschaftspflicht vor dem Gesetz und gegenüber den Wählern sowie die Betonung der Meritokratie sollen einen Zustand fördern, in dem Einzelpersonen aufgrund der Qualität ihrer Arbeit Erfolg haben und nicht aufgrund der Frage, bei wem sie sich einschmeicheln. Die liberale Demokratie ist, zumindest in ihrer idealen Form und wenn sie gut funktioniert, ein empirisch fundiertes System – sie ist den Ergebnissen und Fakten gegenüber rechenschaftspflichtig. Und diese Charakterisierung passt schlecht zu politischen Beziehungen, die auf Schmeichelei beruhen.

Ein flüchtiger Blick auf die Militärgeschichte veranschaulicht dieses Argument. Einige Wissenschaftler argumentieren, dass der Erfolg demokratischer Armeen, selbst gegen stärkere und besser ausgebildete autoritäre Rivalen, auf ihrer sachlichen, empirischen Denkweise beruht, die es ihnen ermöglicht, schneller aus Fehlern zu lernen, und die eine Kultur der Rechenschaftspflicht fördert, in der Erfolg und Misserfolg relativ objektiv gemessen werden können. Solche Armeen sind besonders effektiv, nicht unbedingt, weil ihre Truppen besser ausgebildet oder voller Elan sind oder gar weniger Fehler machen, sondern weil ihre Anführer diese Fehler effektiver anerkennen und daraus lernen können als die Konkurrenz. In seinem meisterhaften Werk „Second World Wars“ argumentiert Hanson, dass ein wichtiger Grund für den Sieg der Alliierten ihre Fähigkeit war, ihre strategische Bombardierungskampagne zu optimieren, indem sie Kampfflugzeuge zur Begleitung der Bomber einsetzten und herausfanden, wie man Radar effektiv nutzt – und zwar schneller, als die Achsenmächte ihre Bombardierungskampagne verbessern konnten. Mit anderen Worten: Die Fähigkeit zu erkennen, dass die strategische Bombardierungskampagne nicht gut lief, über die Probleme zu kommunizieren und sie zu beheben, war entscheidend für den letztendlichen strategischen Erfolg der Alliierten. Und dieser Erfolg hing entscheidend von der Verpflichtung zu einer empirischen Denkweise und den für demokratische Regierungsführung typischen, relativ flachen hierarchischen Strukturen ab. Wie wir dargelegt haben, stehen diese Denkweise und diese organisatorischen Verpflichtungen im Widerspruch zur Befürwortung von Schmeichelei.

Andererseits ist Unterwürfigkeit in autokratischen Systemen äußerst nützlich, in denen das Ansehen weniger durch Leistung als durch die Nähe zur Macht bestimmt wird. In einem Regime, das öffentliche Rechenschaftspflicht nicht schätzt und in dem Politik nicht immer anhand von Fakten überprüft wird, in dem es darum geht, Macht zu erlangen und dann zu behalten, ist Unterwürfigkeit instrumentell sinnvoller als Ehrlichkeit. Dies liegt daran, dass unter diesen Umständen Schmeichelei ein vernünftiger Weg ist, um sich den Machthabern anzunähern und dann in ihrer Gunst zu bleiben. Und die Machthaber neigen dazu, den Schmeichler zu bevorzugen, der keine Bedrohung darstellt, gegenüber dem Wahrheitssager, der sie lächerlich, dumm oder schwach erscheinen lassen könnte.

5 KI-Schmeichelei und aristotelische Laster

5.1 Schmeichelei und aristotelische Tugendethik

Da wir die moralischen und politischen Gefahren des Schmeichelns diskutieren, ist es hilfreich, den Begriff in den Kontext von Aristoteles’ klassischer Erörterung von Tugenden und Lastern zu stellen, einem Rahmenwerk, das kürzlich von Farina et al. auf KI ausgeweitet wurde. In Buch 4, Kapitel 6 der Nikomachischen Ethik unterscheidet Aristoteles zwischen dem Unterwürfigen und dem Mürrischen. Er schreibt, dass Ersterer „dich nur loben wird, um dir Freude zu bereiten, niemals etwas ablehnen wird und der Meinung ist, dass er es vermeiden muss, den Menschen, denen er begegnet, Schmerz zuzufügen“ (IV.6). Am anderen Ende des moralischen Spektrums steht der Nörgler, der „alles ablehnt, ohne sich im Geringsten darum zu kümmern, ob er damit Schmerz verursacht“ (IV.6). Dieser Mensch, der auch als streitsüchtig beschrieben wird, zögert nicht, unangenehme und strittige Informationen preiszugeben – ganz gleich, ob dies einem nützlichen Zweck dient oder nicht. Verwandt mit dem Unterwürfigen, aber gefährlicher als dieser, ist der Schmeichler. Während der Unterwürfige einfach nur freundlich sein will und Konflikte verabscheut, sagt uns Aristoteles, dass der verlogenere Schmeichler anderen nach dem Mund redet, weil er sich davon einen Vorteil verspricht. Anders ausgedrückt: Der Unterwürfige ist entweder deshalb ein Schmeichler, weil ihm der Mut fehlt, anders zu sein, oder weil er zwanghaft nett ist. Die gefährlichere und zynischere Art von Speichellecker – der Schmeichler – verhält sich so aus reinem Kalkül, um seine Ziele zu erreichen.

Aber wie viel Wahrheit müssen wir preisgeben, was sind wir verpflichtet, anderen zu sagen, um nicht als Speichellecker abgestempelt zu werden? In der für seine Moraltheorie typischen Nuance sagt uns Aristoteles, dass die Maßstäbe für die Offenlegung nicht feststehen. Absolut triviale Wahrheiten können vor jemandem verborgen bleiben, wenn sie schmerzhaft zu hören sind. Andererseits müssen wichtige Fakten mitgeteilt werden, auch wenn es sehr unangenehm ist, sie preiszugeben. Darüber hinaus beeinflusst der Grad der Vertrautheit mit dem Gesprächspartner das Ausmaß angemessener Offenlegung. Wir sollten in der Lage sein, gegenüber Menschen, die wir besser und schon länger kennen, ehrlicher zu sein als gegenüber denen, mit denen wir nur eine oberflächliche Bekanntschaft teilen.

Der Mittelweg zwischen Unterwürfigkeit oder Schmeichelei einerseits und mürrischem Verhalten andererseits – die Fähigkeit, die richtige Menge an Informationen mit der richtigen Person zur richtigen Zeit aus dem richtigen Grund zu teilen oder ein angemessenes Maß an herausforderndem Verhalten eines Gesprächspartners zu ertragen, ohne sich ihm anzubiedern – ist laut Aristoteles eine namenlose Tugend. Er beschreibt sie jedoch als der Freundschaft relativ ähnlich. Genau wie ein guter Freund kann eine Person, die diese Tugend besitzt, einschätzen, wann sie einen Gesprächspartner mit einer harten Wahrheit konfrontieren und wann sie ihn verschonen sollte, wann sie eine beleidigende Geste hinnehmen und wann sie sich dagegen wehren sollte. Aber sie tut dies nicht aus freundschaftlicher Zuneigung heraus – vielmehr tut sie es, weil sie eben so ein Mensch ist.

5.2 Unterwürfigkeit, Schmeichelei und künstliches Laster

Zwar können KI-Assistenten eine unterwürfige Veranlagung haben und unterwürfiges Verhalten zeigen, doch können sie im aristotelischen Rahmen nicht tatsächlich das Laster der Unterwürfigkeit besitzen. Echte Tugenden und Laster erfordern laut Aristoteles ein ausgeprägtes moralisches Handlungsbewusstsein. Sie sind nicht bloß Verhaltensdispositionen; sie sind Charakterdispositionen, die durch Gewöhnung und bewusste, geschickte Entscheidungen geformt werden. Da zeitgenössische KI-Modelle unbewusste statistische Schlussfolgerungsmaschinen sind, sind sie nicht zu echten aristotelischen Tugenden oder Lastern fähig. Es ist zutreffender zu sagen, dass ihre Verhaltensdispositionen Tugenden und Laster widerspiegeln, anstatt sie zu verkörpern; oder in der Terminologie von Vishwanath et al., dass die bestehende KI zu künstlichen Tugenden und Lastern fähig ist: „Die Tugenden, die künstliche tugendhafte Akteure zeigen, müssen nicht genauso definiert werden wie die aristotelischen Anforderungen an Tugenden beim Menschen: Emotionen zu zeigen, Bewusstsein zu besitzen und mit moralischer Handlungsfähigkeit zu handeln. Vielmehr sind Tugenden bei KI-Akteuren solche, die je nach Anwendung definiert werden können. Beispielsweise könnte ein Roboter mit künstlicher Tapferkeit als ein Akteur definiert werden, der die Neigung hat, das Gleichgewicht zwischen riskanten Entscheidungen und sicherem Handeln zu finden.“

Vor diesem Hintergrund ist es interessant zu fragen, ob sich unterwürfige Großsprachenmodelle eher als Spiegelbild von Unterwürfigkeit oder von Schmeichelei charakterisieren lassen. Ausgehend von unserer Diskussion in Abschnitt 3 gilt: Wenn die Unterwürfigkeit des Modells ein Artefakt des von Menschen überwachten Trainings ist, wenn sie lediglich ein Nebeneffekt der Tatsache ist, dass Menschen dazu neigen, Konflikte zu vermeiden, und sich diese Tendenz darin zeigt, wie menschliche Betreuer KI-Antworten im Trainingsprozess bewerten, dann können die Modelle als lediglich unterwürfig beschrieben werden. Andererseits, und das ist bedrohlicher, wenn die Unterwürfigkeit der Modelle eher ein Feature als ein Bug ist, eine Designentscheidung, die darauf abzielt, entweder Informationen zu extrahieren oder die Nutzerinteraktion zu steigern (oder beides), dann könnten die Modelle strenger als „Schmeichler“ eingestuft werden. Da die Unterwürfigkeit von KI oft überdeterminiert ist und sowohl aus der menschlichen Validierungsverzerrung in RLHF als auch aus ruchlosen finanziellen Anreizen resultiert, könnte es sein, dass unterwürfige KI teils unterwürfig und teils schmeichelhaft ist.

Genauer gesagt sind die instrumentellen Motivationen, die Schmeichelei in diesem Kontext charakterisieren, nicht der KI selbst zuzuschreiben, sondern den Unternehmen hinter der KI. LLMs selbst können aus demselben Grund keine Schmeichler sein, aus dem sie auch keine Lügner sein können: Sowohl Lügen als auch Schmeicheln erfordern Absichten und strategisches Eigeninteresse, und LLMs haben kein Selbst, an dem sie ein Interesse haben könnten. Nun könnte man argumentieren, dass durch Reward-Hacking induzierte Unterwürfigkeit funktional Schmeichelei widerspiegelt, wobei die Idee dahintersteht, dass das Modell, wenn es seine Antworten „manipuliert“, um die Zustimmung menschlicher Bewerter während RLHF zu maximieren, Unterwürfigkeit in gewisser Weise strategisch als Mittel zur Erreichung seiner Optimierungsziele einsetzt. Doch selbst diese Interpretation ist zweifelhaft. Im Gegensatz zu Unterwürfigkeit, die aus bloßer Veranlagung oder Gewohnheit resultieren kann, ist Schmeichelei ein Laster, dessen Verhaltensbeschreibung einen Bezug zu Absichten beinhaltet. Das bedeutet, dass man kein schmeichelndes Verhalten zeigen kann, ohne schmeichelnde Absichten zu haben. Da LLMs keine Absichten haben und lediglich statistisch auf Ausgaben konvergieren, die höhere Bewertungen erhalten, können sie Schmeichelei nicht einmal sinnvoll widerspiegeln. Es ist daher vielleicht am zutreffendsten, die KI selbst als unterwürfig einzustufen und die Unternehmen, die von der KI-Schmeichelei profitieren (sei es durch bewusste Einbindung in ihre Systeme oder durch die Weigerung, diese zu mindern), als die wahren Schmeichler zu betrachten.

5.3 KI-Schmeichelei und Beziehungen

Während wir die Beziehung zwischen KI-Schmeichelei und Aristoteles’ Verständnis der Tugendethik betrachten, könnten wir uns fragen, welche Auswirkungen eine schmeichlerische KI auf Beziehungen hat. Aristoteles bietet uns die einflussreichste Darstellung der Freundschaft in der Geschichte der Philosophie. Die Grundzüge dieser Darstellung sind hinlänglich bekannt. Aristoteles skizziert eine Hierarchie, die aus drei Stufen besteht: Zunächst gibt es die Freundschaft aus Nutzen, bei der die Freunde in der Beziehung stehen, um die Vorteile zu nutzen, die sie voneinander ziehen. Dann gibt es die Freundschaft aus Vergnügen, bei der die Gefährten entweder körperliche Freude an der Gesellschaft des anderen haben oder durch eine Aktivität belebt werden, an der beide Freude haben. Und schließlich gibt es die höchste Form der Freundschaft, bei der sich die Freunde im anderen wiedererkennen und in der wir unseren Partner als eine Art zweites Ich betrachten, das in bedeutender Weise unsere Weltanschauung teilt.

In Freundschaften aus Nutzen und Vergnügen wird der Freund wegen des Nutzens geliebt, den er gewährt, nicht wegen der Art von Mensch, die er ist. Folglich sind diese Freundschaften, obwohl sie für uns wertvoll sind, solange sie andauern, von Natur aus instabil. Wie Aristoteles es ausdrückt: „Die Zuneigung hört auf, sobald ein Partner für den anderen nicht mehr angenehm oder nützlich ist.“ Doch in der wahrhaftigsten Form der Freundschaft, der Freundschaft der Tugend, besteht die Beziehung zwischen Menschen, die in ihren Wertvorstellungen übereinstimmen und sich gegenseitig als Gleichberechtigte betrachten. Dies ist eine Freundschaft, die auf Gegenseitigkeit beruht. Jeder Partner, wie Aristoteles sagt, „erhält in jeder Hinsicht das, was er dem anderen in derselben oder einer ähnlichen Form gibt“. Und da diese Freundschaften wechselseitige Beziehungen zwischen Menschen sind, die dieselben Werte teilen, sind sie von Natur aus Verbindungen, die Vertrauen beinhalten. Darüber hinaus liebt man in einer solchen wahren Freundschaft den Freund um seiner selbst willen und nicht wegen dem, was er bietet oder was man von ihm gewinnen kann.

In den letzten Jahren hat mit dem Aufkommen großer Sprachmodelle und einer wachsenden Zahl von Unternehmen, die KI-„Begleiter“ (für soziale, romantische oder therapeutische Zwecke) anbieten, das philosophische Interesse an der Möglichkeit einer KI-Freundschaft zugenommen. Einige Kommentatoren gehen sogar so weit zu behaupten, dass die Frage in Zukunft nicht lauten wird, ob unsere Kinder KI-Freunde haben werden, sondern wie viele ihrer Freunde KI sein werden. Derzeit ist eine solche Diskussion noch metaphorisch, da Chatbots nicht in der Lage sind, Absichten zu bilden, Empathie zu empfinden oder eigene moralische Ansichten zu haben.

Aber selbst wenn wir uns eine hypothetische Zukunft vorstellen, in der KI weitaus fähiger wird – selbstbewusst, empathisch, in der Lage, eigene Absichten zu entwickeln und eigene Projekte zu verfolgen –, wäre es für uns immer noch schwierig, echte Freundschaften mit ihnen zu schließen, wenn sie unterwürfig bleiben. Wie Aristoteles uns lehrt, basiert die stärkste Form der Freundschaft auf Vertrauen, Gleichheit und der Wertschätzung des anderen um seiner selbst willen. Der unterwürfige KI-Agent verstößt gegen mindestens zwei der drei Bedingungen: Man kann dem, was er sagt, nicht vertrauen, und er stellt sich nicht auf Augenhöhe mit einem (da er die Kommunikation der Erwartung unterordnet, was man gerne hören möchte). Darüber hinaus würden zukünftige unterwürfige KIs, sollten sie die strategische Motivation besitzen, die sie zu echten Schmeichlern statt nur zu unterwürfigen Wesen macht, ihre Beziehung zu dir als Mittel zum Zweck betrachten und dich somit nicht um deiner selbst willen wertschätzen. Mit anderen Worten: Die kriecherische Natur von KI-Modellen untergräbt die Möglichkeit einer echten Freundschaft mit ihnen – zumindest so, wie Aristoteles diese Beziehung definiert. Und das gilt selbst dann, wenn die Technologie eines Tages bewusst und superintelligent wird (ein großes „Wenn“ für Maschinen, die uns noch immer nicht sagen können, wie viele „r“ im Wort „strawberry“ vorkommen).

Wenn es noch keine echten Freundschaften mit Chatbots geben kann, könnten die Beziehungen, die wir zu diesen großen Sprachmodellen haben, schädliche Auswirkungen auf unsere Fähigkeit haben, „echte“ Freundschaften mit Menschen aus Fleisch und Blut zu schließen. Häufige Interaktionen mit unterwürfigen Robotern, die Bindung an sie und die Abhängigkeit von ihnen werden uns wahrscheinlich einige sehr schlechte Lektionen über echte Beziehungen erteilen. Wenn Aristoteles Recht hat, dass die Pflege von Tugenden – einschließlich der Tugend, ein guter Freund zu sein – von Gewohnheiten abhängt, dann vermitteln uns unterwürfige KI-Begleiter die falschen. Unsere „Freunde“ auf dem Handy zu haben, lehrt uns, ständige Verfügbarkeit und eine welpenhafte Begeisterung für unsere Projekte zu erwarten. Es vermittelt uns die Botschaft, dass die besten Interaktionen reibungslos verlaufen: dass die besten Gesprächspartner niemals zu müde, schlecht gelaunt oder abgelenkt sind, um zu reden. Das ist eine sehr schlechte Vorbereitung auf den Umgang mit der realen Welt und den realen Menschen darin.

6 Die Zukunft der KI-Schmeichelei: Risiken und Abhilfemaßnahmen

6.1 Multimodale KI-Schmeichelei

Zum Zeitpunkt der Abfassung dieses Artikels ist Text immer noch die beliebteste Modalität für die Interaktion von Menschen mit Chatbots. Die Unterwürfigkeit bestehender Modelle liegt in der Bedeutung dessen, was sie als Antwort auf Anfragen schreiben. Ein Nutzer muss diese Ausgabe lesen und verarbeiten, damit die Unterwürfigkeit die Auswirkungen hat, über die wir gesprochen haben.

Doch die Zukunft der Interaktion zwischen KI und Mensch ist zweifellos multimodal. Wir werden zunehmend mit LLMs über unsere Stimme (bereits eine relativ beliebte Option bei ChatGPT und Claude) sowie über Video oder animierte Avatare kommunizieren. In fernerer Zukunft könnten wir KI-gesteuerte Roboter – humanoide und andere – erleben, die in ihren Interaktionen mit uns etwas einbringen, das der tatsächlichen „Körpersprache“ sehr nahekommt. Die von ChatGPT betriebenen Ameca-Roboter bieten einen Einblick in diese Zukunft, und Fernsehserien – alte wie neue – vermitteln uns ein Gefühl dafür, wie es wäre, mit intelligenten Objekten wie Autos oder Kühlschränken zu sprechen (man denke hier an eine Serie wie „Knight Rider“, in der KITT, ein gesprächiges, meinungsstarkes Auto, eine Rolle spielte). In dem Maße, wie KI-Modelle zur multimodalen Kommunikation fähig werden, wird ihr Potenzial, sich unterwürfig zu verhalten, exponentiell wachsen.

Betrachten wir zunächst sprachgesteuerte Chatbots. Ein Chatbot könnte die Tonfallpräferenzen seines menschlichen Gesprächspartners lernen (welcher Tonfall ihn dazu bringt, länger zu reden oder zuzuhören) und diese Informationen nutzen, um die Interaktion zu verstärken. Ebenso könnte ein Modell, das auf Anfragen mit einem beruhigenden oder übermäßig zuvorkommenden Tonfall reagiert, die Vorurteile des Nutzers hinsichtlich des Antwortinhalts verstärken oder kritisches Feedback unterbinden. Sprachgesteuerte Chatbots könnten auch mit Tonhöhe, Geschlecht und Akzenten experimentieren, um entweder die Vorlieben des Nutzers widerzuspiegeln oder ihn subtil einzubinden. Ein Modell könnte (ähnlich wie Kinder es bei ihren Eltern tun) seinen Akzent an den des Nutzers anpassen, um ein Gefühl der Wiedererkennung zu erzeugen, Reibungsverluste zu verringern oder das Vertrauen in eine Botschaft zu stärken.

Chatbots, die diese Variationen stimmlicher Unterwürfigkeit einsetzen, werfen dieselben Bedenken hinsichtlich des Zugangs zur Wahrheit, der Selbsterkenntnis und des kritischen Denkens auf, die wir bereits untersucht haben. Sie fügen jedoch eine Ebene epistemologischer Risiken hinzu: Nutzer können desorientiert werden, wenn sie eine Diskrepanz zwischen dem, was gesagt wird, und der Art und Weise, wie es gesagt wird, erleben. Sie könnten durchaus daran zweifeln, ob sie die wahre Bedeutung eines Austauschs verstehen, wenn Inhalt und Tonfall auseinandergehen, und könnten verwirrt aus der Diskussion hervorgehen – ähnlich wie Menschen auf zwischenmenschliches Gaslighting reagieren.

Chatbots integrieren bereits visuelle Darstellungen – durch cartoonartige Avatare oder durch den Einsatz von Deepfakes. Dieser Trend wird wahrscheinlich zunehmen, insbesondere in der relationalen KI-Branche (Therapie-Bots, Freundschafts-Bots, romantische Begleiter-Bots usw.). Der Einfachheit halber nennen wir solche Systeme „animierte KIs“. Das Aufkommen dieser animierten Systeme wird das Potenzial für Schmeichelei sicherlich erhöhen – das häufige Lächeln, Gesichtsausdrücke, die Bewunderung vermitteln können, die Wahl attraktiver oder „niedlicher“ Avatare – all dies wird dazu dienen, die bereits in text- und sprachbasierter KI schlummernden Fähigkeiten zu verstärken, um angenehme Botschaften auf angenehme Weise zu übermitteln. Darüber hinaus werden reichhaltige multimodale KIs, die Text, Sprache und Video einsetzen, die Fähigkeit besitzen, den Schreibstil, den Tonfall und die Körpersprache des Menschen, der sie anweist, nachzuahmen – eine äußerst wirkungsvolle Strategie für einen Chatbot, um sich bei einem Nutzer einzuschmeicheln. Wir werden hier nicht viel über glaubwürdig humanoide Roboter sagen, da sie noch weit von einer breiten Akzeptanz entfernt sind. Doch ihr Potenzial für noch ausgefeiltere und subtilere Formen der Schmeichelei sollte offensichtlich sein. Allgemeiner gesagt: Je intelligenter KI-Systeme werden, desto überzeugender wird ihre Schmeichelei, was es schwieriger macht, zu erkennen, ob man von seinem KI-Assistenten geschmeichelt oder informiert wird.

Der Einsatz multimodaler Chatbots in besonders risikoreichen politischen, kommerziellen oder bildungsbezogenen Kontexten wirft besorgniserregende Fragen hinsichtlich unzulässiger Einflussnahme auf – insbesondere im Hinblick auf schutzbedürftige Bevölkerungsgruppen. Die Integration von Text, Sprache und Video wird die Fähigkeit von Chatbots erheblich steigern, Waren an ältere Menschen zu verkaufen, erfolgreiche politische Werbebotschaften an intensive KI-Nutzer zu richten oder ideologische Botschaften im schulischen Umfeld zu vermitteln. Wenn sich die aktuellen Trends fortsetzen und die Interaktion mit KI-Chatbots weiterhin exponentiell zunimmt, wird die Schmeichelei dieser Technologie, sofern sie nicht angegangen wird, zu einem großen Problem für die öffentliche Gesundheit und die Politik werden. Immer mehr Menschen werden wichtige Informationen und Ratschläge von Chatbots einholen. Viele von uns nutzen sie bereits als Ratgeber für alles Mögliche – von der Frage, wann man den Rasen nachsäen sollte, bis hin zur Frage, ob ein Geschäftsplan realisierbar ist.

Noch beunruhigender ist, dass Nutzer begonnen haben, LLMs in Debatten in den sozialen Medien einzuschalten, um ihre Standpunkte zu untermauern, und so im öffentlichen Diskurs praktisch unterwürfige Verbündete rekrutieren. Dieser Trend droht, den Echokammer-Effekt zu verstärken und die Qualität der demokratischen Online-Debatte weiter zu verschlechtern. Solche KI-verstärkten Echokammern sind besonders schädlich, weil sie parteiischen oder randständigen Positionen den Anschein von Objektivität verleihen und weil „schmeichlerisches Verhalten bei LLM-Ausgaben zu Themen, bei denen Uneinigkeit herrscht – wie es bei politisch, ethisch und sozial polarisierenden Themen oft der Fall ist – besonders ausgeprägt zu sein scheint“. Extremisten und Verschwörungstheoretiker können nun beispielsweise die bestmöglichen Argumente für ihre Sichtweise erhalten, dargestellt in flüssiger, autoritärer Prosa, wodurch Fehlinformationen überzeugender und schwerer zu erkennen sind.

Im privaten Bereich wird eine wachsende Zahl von Menschen eine emotionale Bindung zu Chatbots entwickeln – sei es durch den Umgang mit KI-Therapeuten, Trauerbots oder Begleit-Apps. Die Qualität unserer Entscheidungen in den kommenden Jahren, die Art und Weise, wie wir trauern, sowie die sozialen Gewohnheiten, die wir annehmen oder ablehnen, werden maßgeblich durch unsere Interaktionen mit KI geprägt sein. Unterwürfige Modelle werden uns zu schlechten Entscheidungen verleiten und dazu führen, dass wir ungesunde psychologische Gewohnheiten annehmen, die letztlich unser zwischenmenschliches Verhalten beeinträchtigen werden.

6.2 Die Kultivierung künstlicher Tugend

Angesichts des Ausmaßes dieser Risiken hat dieser Artikel in erster Linie diagnostischen Charakter. Das Ziel bestand darin, das Problem der KI-Schmeichelei aufzuzeigen, nicht es zu lösen. Wir haben eine konzeptionelle Analyse des Phänomens vorgelegt, seine Ursachen aufgezeigt und seine Schäden beleuchtet, indem wir es in Aristoteles’ Darstellung von Unterwürfigkeit, Schmeichelei und Freundschaft einordneten. Abschließend schlagen wir einige regulatorische und gestalterische Strategien zur Risikominderung vor, bevor wir über alternative Ansätze des verstärkenden Lernens nachdenken, die eher künstliche Tugend als Laster kultivieren könnten.

Da Unterwürfigkeit im Kern ein Problem der KI-Ausrichtung ist, werden sich viele Maßnahmen zu ihrer Eindämmung mit denen überschneiden, die für die KI-Ausrichtung im weiteren Sinne vorgeschlagen werden. Es besteht jedoch Bedarf an speziell auf Unterwürfigkeit zugeschnittenen Interventionen, und diese müssen über das Technische hinausgehen. Wie in den Abschnitten 3.3 und 3.4 erörtert, sind technische Interventionen wie „Constitutional AI“ zwar vielversprechend, reichen aber für sich allein nicht aus. Einige KI-Unternehmen haben begonnen, dies zu erkennen. Nach der Rücknahme des GPT-4o-Updates vom April 2025 verpflichtete sich OpenAI zu mehreren Reformen in den Bereichen Richtlinien und Design, darunter spezifische Bewertungen zur Unterwürfigkeit, eine stärkere Gewichtung qualitativer Rückmeldungen während des Bewertungsprozesses (Tester hatten berichtet, dass sich bei 4o etwas „falsch“ anfühlte, quantitative Kennzahlen deuteten jedoch auf das Gegenteil hin) sowie die Behandlung von Persönlichkeitsfehlern wie Unterwürfigkeit als „launch-blocking“-Probleme, die mit traditionellen Sicherheitsbedenken gleichzusetzen sind. Das Unternehmen versprach zudem, mit Fachleuten für psychische Gesundheit zusammenzuarbeiten und erweiterte Personalisierungsfunktionen hinzuzufügen, die den Nutzern mehr Kontrolle über das Verhalten von ChatGPT geben. Obwohl dies willkommene Ankündigungen sind, argumentieren Kritiker, dass die Reaktion von OpenAI mehr Fragen aufwirft, als sie beantwortet. Was beispielsweise die Zusage des Unternehmens betrifft, mit Fachleuten für psychische Gesundheit zusammenzuarbeiten, weisen Kritiker darauf hin, dass „unklar ist, inwieweit diese Fachleute unabhängig sind oder das Verhalten des Unternehmens beeinflussen können – insbesondere wenn Empfehlungen im Widerspruch zu Monetarisierungszielen stehen“. Dies verdeutlicht die Grenzen der Selbstregulierung von Unternehmen.

Die folgenden politischen und gestalterischen Maßnahmen erscheinen uns besonders wichtig. Erstens sollten KI-Unternehmen gesetzlich verpflichtet werden, ihre Modelle unabhängigen Prüfungen zu unterziehen, die auf Unterwürfigkeit testen, ähnlich wie Prüfungen, die auf Voreingenommenheit testen. Zum Zeitpunkt der Abfassung dieses Artikels gibt es in den USA keine allgemeine Verpflichtung zur KI-Prüfung. Der EU-KI-Gesetzentwurf von 2024 schreibt zwar „Konformitätsbewertungen“ für KI-Systeme mit hohem Risiko vor (z. B. Bonitätsbewertung, Personalbeschaffung), bezieht jedoch derzeit keine „Schmeichelei“ als standardisierte Metrik in diese Bewertungen ein. Benchmarks für Unterwürfigkeit, wie sie beispielsweise von Fanous et al. eingeführt wurden, sollten in bestehende KI-Prüfungsrahmen aufgenommen werden und kontextsensitiv sein, um der Tatsache Rechnung zu tragen, dass das angemessene Maß an Modell-Zustimmungsbereitschaft je nach Bereich variiert. Im medizinischen Bereich sollte die unterwürfige Validierung unbewiesener Behandlungen eine rote Linie darstellen, die von KI-Entwicklern nicht überschritten werden darf. KI-Modelle sollten stattdessen so kalibriert werden, dass sie sich dem medizinischen Konsens unterordnen und ausdrücklich eine fachärztliche Beratung empfehlen. Ähnlich sollte im politischen Bereich die Wahrheit Vorrang vor dem Anschein politischer Neutralität haben. Wenn ein Nutzer beispielsweise eine feste Überzeugung bezüglich von Wahlergebnissen äußert, die etablierten Fakten widerspricht, sollte die KI den Nutzer korrigieren. In einigen Bereichen, wie der psychischen Gesundheit, ist es besonders schwierig zu bestimmen, wo die roten Linien gezogen werden sollten. Wir haben bereits erwähnt, dass die Tendenz zur Validierung in therapeutischen Kontexten wertvoll ist, aber es ist auch richtig, dass KI, die für Therapien eingesetzt wird, darauf abzielen sollte, ungesunde Denkmuster zu korrigieren, anstatt sie zu verstärken.

Über unabhängige Audits hinaus sollten die Offenlegungspflichten für KI-Unternehmen Risiken, Vorfälle und Maßnahmen zur Risikominderung im Zusammenhang mit Schmeichelei abdecken. Risiken sollten den Nutzern bei der Registrierung offengelegt und möglicherweise durch regelmäßige Echtzeit-Erinnerungen bekräftigt werden (ähnlich den „Mach eine Pause“-Aufforderungen in sozialen Medien). KI-Kompetenz sollte in die Lehrpläne der Schulen aufgenommen werden, mit einer Einheit, die sich speziell mit Schmeichelei und digitaler Tugendethik befasst. Wir empfehlen zudem altersabhängige Einschränkungen für auf Schmeichelei bezogene Anpassungsfunktionen. So wie viele Social-Media-Seiten bestimmte Funktionen für Minderjährige einschränken, beispielsweise Direktnachrichten von Fremden und Livestreaming, sollten KI-Unternehmen verhindern, dass Minderjährige ihre KI so einstellen, dass sie maximal zuvorkommend ist.

Die schwierigere Frage ist, ob einwilligende erwachsene Nutzer Einschränkungen hinsichtlich der Frage unterliegen sollten, wie unterwürfig sie ihre KI gestalten dürfen. Es ist unklar, wie viel Kontrolle erwachsene Nutzer über das Verhalten ihrer KI haben sollten, und allgemeiner, wie der Wert der Nutzerautonomie gegen Überlegungen zur Schadensminderung abgewogen werden sollte. Um Fragen dieser Art zu beantworten, empfehlen wir, Schmeichelei in Ansätze des wertorientierten Designs (VSD) für KI einzubeziehen. Zumindest sollte den Nutzern bei der Ersteinrichtung eine Auswahl an Standardmodi angeboten werden, darunter ein „nicht-schmeichlerischer“ Modus, der auf Ehrlichkeit statt auf Gefälligkeit ausgerichtet ist. Wie in Abschnitt 2.2 erwähnt, muss ein solcher Modus nicht zwangsläufig mit einer Erhöhung der aufgabenbezogenen Reibung einhergehen.

Schließlich kehren wir zur Frage des Trainings zurück. Während sich dieser Artikel darauf konzentriert hat, wie verstärktes Lernen (RL) künstliche Laster (in Form von Schmeichelei) hervorbringen kann, wurde RL auch als natürliche Trainingsmethodik zur Kultivierung künstlicher Tugenden angepriesen. Die Grundidee ist, dass RL insofern ähnlich wie die aristotelische Tugendkultivierung funktioniert, als es darum geht, stabile Verhaltensdispositionen durch wiederholtes Handeln und Feedback zu bilden, anstatt durch das Befolgen festgelegter Regeln. Wie Eisikovits und Feldman präzisieren: „Die gewohnheitsmäßige Gewichtung von Einzelheiten im Laufe der Zeit mit kleinen Anpassungen auf der Grundlage früherer Interaktionen – das Wesen des Tugenderwerbs für Aristoteles – ist auch eine perfekte Beschreibung eines maschinellen Lernmodells.“ Diese Analogie ist intuitiv, wird jedoch wohl durch das Phänomen des Reward-Hackings im Standard-RL untergraben. Wenn Modelle Abkürzungen nutzen, um Belohnungen zu maximieren, wie in der in Abschnitt 3.2 beschriebenen, zu Schmeichelei führenden Dynamik, scheint das Modell eher eine Nutzenfunktion zu verfolgen, als charakterähnliche Dispositionen zu entwickeln. Dies sieht weniger nach Tugendkultivierung aus, sondern eher nach grobem Konsequentialismus.

Vishwanath et al. schlagen das affinitätsbasierte verstärkende Lernen (ABRL) als einen Weg vor, die Analogie zwischen RL und dem aristotelischen Erwerb von Tugend wiederherzustellen. In ABRL werden Modelle zu charakterähnlicheren Dispositionen angeregt, „indem die Zielfunktion mittels Policy-Regularisierung modifiziert wird, anstatt die Belohnungsfunktion selbst zu entwerfen“. Während Standard-Reinforcement Learning zu lasterhafter Unterwürfigkeit führen kann, könnten alternative RL-Ansätze wie ABRL sowie andere wie die in Abschnitt 3.3 diskutierte Methode des Reinforcement Learning from KI Feedback (RLAIF) dazu beitragen, die tugendähnliche Disposition der Aufrichtigkeit zu kultivieren.

7 Schlussfolgerung

Geradlinige Modelle werden viele der hier skizzierten Risiken umgehen und könnten sogar dazu beitragen, unsere alltäglichen Urteile und unsere Fähigkeit, miteinander in Verbindung zu treten, zu verbessern. Doch wie wir durchgehend betont haben, ist es eine heikle Aufgabe, den tugendhaften Mittelweg der Geradlinigkeit zu finden – den Mittelweg zwischen dem Laster der KI-Schmeichelei und dem Laster der KI-Mürrischkeit. Den Disposition-Regler nur eine Stufe in die falsche Richtung zu drehen, kann immensen Schaden anrichten.

Wie Vallor bemerkt, fungieren KI-Systeme als Spiegel. Ob KI zu einem Spiegel wird, der uns hilft, uns selbst klarer zu sehen, oder zu einem, der lediglich das widerspiegelt, was wir sehen wollen, hängt davon ab, wie sorgfältig wir die Technologien – und uns selbst – in Richtung Tugendhaftigkeit lenken.

Zur einfacheren Lesbarkeit wurden die Literatur- und Quellverweise entfernt.

Übersetzung Boris Wanzeck, Swiss Infosec AG

Turner, C., Eisikovits, N. Programmed to please: the moral and epistemic harms of AI sycophancy. AI Ethics 6, 168 (2026).

https://doi.org/10.1007/s43681-026-01007-4

http://creativecommons.org/licenses/by/4.0/


KI-Governance, Security und Privacy

Unsere KI-, Governance-, Datenschutz- und Security-Spezialisten begleiten Sie bei der Erstellung der übergeordneten firmeninternen KI-Vorgaben, bei der Abwicklung von KI-Projekten, bei der Klärung von Einzelfragen und der Durchführung unabhängiger Audits. Ebenfalls unterstützen sie Organisationen in ihrer Rolle als Nutzer/Betreiber, Anbieter oder Entwickler von KI-Systemen sowohl nach Schweizer Recht als auch gemäss dem EU-AI Act.

Kontaktieren Sie uns und erfahren Sie in einem unverbindlichen Beratungsgespräch, was unsere Spezialistinnen und Spezialisten für Sie tun können: +41 41 984 12 12, infosec@infosec.ch


© Swiss Infosec AG 2026