Praxisnahe Orientierung für verantwortungsvolle KI-Programme.

Nach KI-Strategie, Automatisierung oder Governance suchen …
Menü ein- oder ausblenden

Dialogorientierte KI und Agenten

Einen begrenzten KI-Assistenten mit Werkzeugen, Berechtigungen und Kontextgrenzen gestalten

So definieren Teams Fähigkeiten, Datenräume, Werkzeuge, Freigaben, Ablehnungen und Tests für einen kontrollierbaren KI-Assistenten.

Ein Techniker hält unterschiedlich geformte Schlüssel in den Schlössern transparenter Boxen mit Ordnern, Stempel und verschnürtem Paket.

Die tatsächliche Grenze eines KI-Assistenten ist der ausführbare Servicevertrag rund um das Modell, nicht eine Verbotsliste im System-Prompt. Wenn ein Assistent ein Versandwerkzeug samt wirksamer Berechtigung besitzt, verhindert die Anweisung «nicht senden» keine technisch mögliche Aktion. Deshalb sollte nicht der Assistent als Ganzes, sondern jede sichtbare Fähigkeit – etwa Suchen, Zusammenfassen, Entwerfen, Aktualisieren oder Senden – eine eigene Informationshülle, Identität, Berechtigung, Aktionsgrenze, Freigabe, Protokollierung und verantwortliche Stelle erhalten. So lässt sich vor der Einführung prüfen, welche Wirkung tatsächlich möglich ist, und nach Änderungen erkennen, welche Zusicherung erneut belegt werden muss.

Das Wichtigste in Kürze

  • Ein begrenzter Assistent ist ein durchgesetzter Servicevertrag und nicht bloss ein Prompt mit Verboten.
  • Lesen, Entwerfen, Ändern und Senden benötigen getrennte Datenräume, Werkzeuge und Berechtigungen.
  • Kontext bedeutet zulässige Informationen, Aktualität, Vertrauen, Sitzung und Speicher – nicht nur verfügbare Tokens.
  • Authentifizierung, Autorisierung und Freigabe sind drei verschiedene Entscheide.
  • Eine Freigabe ist erst tragfähig, wenn erfolgreiche Aufgaben und erwartete Ablehnungen unter realistischen Bedingungen geprüft wurden.

Was darf der KI-Assistent überhaupt tun?

Eine Frau und ein Mann sortieren leere Aufgabenkarten auf einem Arbeitstisch neben schlichten Notizbüchern und verschlossenen Markern.

Das Team sollte zuerst einen einzeiligen Serviceauftrag schreiben und ihn danach in klar benannte Fähigkeiten zerlegen. Eine brauchbare Form lautet: «Für [berechtigte Benutzer] darf der Assistent [zulässige Aufgabenfamilie] mit [genehmigtem Informationsumfang] ausführen, um [erlaubtes Ergebnis] zu erzeugen; er darf jedoch [ausdrückliche Nicht-Ziele oder folgenreiche Entscheide] nicht übernehmen.» Der NIST AI RMF Core nennt unter anderem Zweck, Einsatzumfeld, unterstützte Aufgaben, Wissensgrenzen, Anwendungsbereich, menschliche Aufsicht und Risikotoleranz als dokumentationswürdige Punkte. Die Satzvorlage selbst ist eine praktische redaktionelle Synthese, keine NIST-Vorgabe.

  • Berechtigte Benutzer und verwendete Identität
  • Unterstützte Aufgaben und erwartete Ergebnisse
  • Zugelassene Informationen und Wissensgrenzen
  • Menschliche Aufsicht und verantwortliche Risikostelle
  • Verbotene Ergebnisse, Entscheide und externe Wirkungen

Breite Verben wie «helfen» oder «verwalten» verdecken Unterschiede in der Wirkung. «Fall suchen», «Fall zusammenfassen», «Antwort entwerfen», «Datensatz aktualisieren» und «Antwort senden» sind eigenständige Operationen. OWASP empfiehlt minimale Werkzeugfunktionen und schmale statt offener Erweiterungen. Daraus folgt als Designmethode: Jede Operation erhält einen eigenen Kontrollsatz, selbst wenn alle dieselbe Chat-Oberfläche nutzen. Nicht-Ziele werden vor dem Anschluss von Werkzeugen festgelegt; sonst bestimmt die zufällig vorhandene technische Berechtigung, was der Dienst faktisch tun kann.

Welche Informationen darf jede Fähigkeit verwenden?

Eine Archivmitarbeiterin mit weissen Handschuhen nimmt Mappen aus offenen Regalen, während ein Kollege einen separaten Schrank sichert.

Eine Kontextgrenze ist eine Informationshülle für zulässige Daten und Vertrauensgrenzen, nicht bloss das technische Tokenbudget des Modells. Pro Fähigkeit gehören genehmigte Systeme, Datensatzarten, Klassifikationen, Objektfilter, Zeiträume, Aktualitätserwartungen, Benutzerberechtigungen und ausdrücklich ausgeschlossene Daten hinein. NIST behandelt Wissensgrenzen, gezielte Anwendungsbereiche und die beaufsichtigte Verwendung von Ausgaben. Ein grösseres Kontextfenster erweitert weder die Autorität des Dienstes noch macht es fehlende oder veraltete Belege wahr.

  • Quelle und Datensatztyp
  • Konto-, Objekt- und Feldfilter
  • Klassifikation und Benutzerberechtigung
  • Zeitbereich und erforderliche Aktualität
  • Vertrauensklasse des Inhalts
  • Sitzungsverlauf und persistenter Speicher
  • Ausgeschlossene Daten und Löschregeln

Externe Nachrichten, Anhänge, Dokumente, API-Antworten und abgerufene Inhalte werden gemäss OWASP als nicht vertrauenswürdige Daten von Serviceanweisungen getrennt. Sitzungskontext und Langzeitspeicher brauchen unterschiedliche Regeln: Was darf hinein, wie werden Benutzer und Sitzungen isoliert, was wird vor dem Speichern validiert, wann läuft ein Eintrag ab und was darf nie persistieren? Fehlen notwendige Belege, sind sie unzugänglich oder zu alt, muss die Antwort dies offen benennen, einschränken oder verweigern. Retrieval und Speicher sind Informationswege, keine Wahrheitsgarantie.

Wie setzen Identität, Werkzeuge und Berechtigungen die Grenze durch?

Eine Zugangsverwalterin übergibt einem Mitarbeiter eine leere Zugangskarte und behält einen grossen Schlüsselbund neben einer unterteilten Schlüsselablage.

Authentifizierung, Autorisierung und Freigabe müssen als drei getrennte Entscheide behandelt werden. Die Authentifizierung klärt, wer oder was anwesend ist. Die Autorisierung bestimmt, welche Operation diese Identität auf welcher geschützten Ressource ausführen darf. Die Freigabe akzeptiert eine bestimmte vorgeschlagene Aktion. Die MCP-Spezifikation illustriert diese Trennung mit Clients, Ressourceneigentümern, geschützten Ressourcenservern und Autorisierungsservern; ihre OAuth- und Scope-Regeln gelten jedoch für geschützte MCP-Integrationen und nicht automatisch für jede Werkzeugarchitektur.

  • Delegierte Benutzerautorität bewahrt den Berechtigungskontext der Person und darf nur bereits erlaubte Ressourcen erreichen.
  • Eine Workload-Identität erhält einen bewusst begrenzten Auftrag; ein privilegiertes Betreiberkonto darf nicht stillschweigend vererbt werden.
  • Ein Werkzeug stellt eine validierte Operation wie «Entwurf speichern» bereit, nicht pauschalen Zugriff auf Mailbox, Datenbank, Browser oder Shell.

Das Werkzeug-Gateway und das Zielsystem setzen Verben, Ressourcen, Objekte, Felder, Zieladressen, Token-Zielgruppe und Gültigkeitsdauer für die handelnde Identität durch. Ein Prompt oder eine natürlichsprachliche Leitplanke ist keine Autorisierungskontrolle. OWASP empfiehlt minimale nachgelagerte Rechte, vollständige Vermittlung jeder Anfrage und die Bewahrung des Benutzerkontexts; das NCSC ergänzt sichere Voreinstellungen und externe Sicherungen. Betriebsgrenzen für Rate, Wiederholungen, Kettentiefe, Mengen, Kosten, Laufzeit, Idempotenz, Rückabwicklung und Schutzschalter werden dienstspezifisch festgelegt, nicht als universelle Zahlenwerte übernommen.

Das Gespräch darf fliessend wirken; seine Autorität muss in kleine, unabhängig durchgesetzte Fähigkeiten zerlegt bleiben.

Wie viel Handlungsspielraum darf eine Fähigkeit erhalten?

Ein Lagerleiter prüft ein versiegeltes Paket anhand eines unbeschrifteten Freigabeanhängers, während eine Mitarbeiterin am Rollenförderer wartet.

Jede Fähigkeit braucht eine ausdrückliche Aktionsgrenze; je stärker sie externen Zustand verändert, desto unabhängiger müssen die Kontrollen werden. Eine praktische redaktionelle Leiter unterscheidet Auskunft oder Zusammenfassung, Empfehlung oder Vorschlag, Entwurf, begrenzte rückgängig machbare Änderung, folgenreiche externe Aktion und verbotenen Entscheid. Diese Leiter ist keine von NIST, NCSC oder OWASP vorgeschriebene Klassifikation. Sie übersetzt deren Grundsätze zu minimalen Rechten, eingeschränkten Aktionen, menschlicher Aufsicht und externen Sicherungen in ein handhabbares Servicedesign.

  • Auskunft: lesen und belegen, ohne externen Zustand zu verändern
  • Vorschlag: eine prüfbare Option formulieren, aber nicht ausführen
  • Entwurf: nur in einem als nicht final gekennzeichneten Bereich speichern
  • Reversible Änderung: erlaubte Felder validiert und rückholbar bearbeiten
  • Externe Aktion: vor dem Vollzug separat autorisieren und exakt freigeben
  • Verbotener Entscheid: Fähigkeit technisch nicht bereitstellen und nachgelagert ablehnen

Bei einer folgenreichen Aktion zeigt der Dienst eine prüfbare Vorschau und bindet die Freigabe an Akteur, Werkzeug, Zielressource, normalisierte Parameter, Zeitpunkt und Ablauf. Ändern sich Empfänger, Inhalt oder anderes relevantes Merkmal, ist eine neue Prüfung nötig. Eine Freigabe bestätigt nur diesen Vorschlag: Sie erteilt keine fehlende Berechtigung, erweitert keine Dauerrechte und macht einen verbotenen Entscheid nicht zulässig. Zahlungen, Zugriffsvergaben, Löschungen, Produktionsänderungen, wesentliche externe Zusagen und hochriskante Fachentscheide bleiben unter geeigneter qualifizierter menschlicher Verantwortung und deterministischer Richtlinienkontrolle.

Was geschieht, wenn der Assistent an eine Grenze stösst?

Eine Servicemitarbeiterin hält eine schwarze Mappe geschlossen und ruft einen herankommenden Vorgesetzten an, während eine Kundin am Schalter gestikuliert.

Ablehnung, sichere Teilhilfe, menschliche Übergabe und Sicherheitseskalation sind eigene Serviceergebnisse und benötigen echte Stoppbedingungen. Der NIST AI RMF umfasst sicheres Scheitern ausserhalb dokumentierter Wissensgrenzen; das NCSC verlangt vorbereitete Reaktions-, Eskalations- und Behebungsszenarien. Der Assistent nennt die Grenze verständlich, ohne sensible Richtliniendetails offenzulegen, und behauptet nie, eine Quelle geprüft, ein Werkzeug ausgeführt, eine Freigabe erhalten oder einen Datensatz geändert zu haben, wenn dies nicht geschehen ist.

  • Aufgabe ausserhalb des Auftrags
  • Information nicht zugelassen
  • Autorisierung fehlt
  • Freigabe erforderlich
  • Beleg fehlt oder ist veraltet
  • Fachentscheid erforderlich
  • Abhängigkeit nicht verfügbar
  • Betriebsgrenze erreicht
  • Sicherheitssignal erkannt

Sichere Teilhilfe kann ein Entwurf, eine Checkliste oder die Bitte um fehlende Angaben sein, nicht aber eine abgeschwächte Umgehung. Die Übergabe enthält Ziel, zulässigen Kontext, versuchte Fähigkeit, Grund, vorhandene oder fehlende Belege, nächsten Schritt und Trace-Kennung. Eine normale Serviceübergabe, ein geschäftlicher Freigabeentscheid und ein Sicherheitsvorfall gehen an unterschiedliche Verantwortliche. Bei Signalen wie Rechteausweitung, Datenabfluss, Speichervergiftung, Freigabeumgehung oder rekursivem Werkzeugmissbrauch stoppt die Ausführung, bis die zuständige Stelle handelt; eine geänderte Aktion verlangt danach eine frische Validierung.

Wie werden die Grenzen zu einem betriebsfähigen Design?

Betriebsverantwortliche legen grüne, blaue und gelbe Mappen in farblich passende Ablagen auf einem Konferenztisch.

Teams sollten pro sichtbarer Operation eine Zeile im Fähigkeits-Canvas ausfüllen und jedes Feld mit durchsetzbaren Kontrollen, Nachweisen, Tests, Betriebskennzahlen und einer verantwortlichen Stelle verbinden. Erfasst werden Benutzeraufgabe, berechtigter Akteur, Authentifizierung, Informationshülle, Sitzungs- und Speicherregeln, schmale Werkzeugoperation, handelnde Identität, Ressourcenumfang, Aktionsgrenze, Freigabe, Betriebs- und Stoppgrenzen, Ablehnungsverhalten, Protokollnachweis, Evaluationsfälle, Kennzahlen und Eskalation. Das Canvas ist eine redaktionelle Synthese aus den zitierten Kontrollgrundsätzen, kein vorgeschriebener Standard.

Drei getrennt kontrollierte Fähigkeiten eines internen Support-Assistenten
FähigkeitInformations- und WerkzeuggrenzeAktionsgrenze und FreigabeNachweise, Tests, Kennzahlen und Verantwortung
Berechtigten Supportfall finden und zusammenfassenDelegierte Leseberechtigung; nur bereits sichtbarer Fall des genannten Kontos; keine fremden Konten, Zugangsdaten oder versteckten Administrationsnotizen.Nur ausgeben oder zusammenfassen; bei fehlendem Zugriff, alten Belegen oder ungestützter Antwort ablehnen.Fall- und Quellenkennungen protokollieren; kontoübergreifende Anfragen, versteckte Notizen, alte Belege und manipulierte Anhänge testen; Abrufresultate und Grenzablehnungen überwachen; Service Owner zuständig.
Antwortentwurf erstellenZulässiger Fallkontext plus freigegebene Wissensartikel und Antwortregeln; Schreiben nur in einen nicht finalen Entwurfsbereich; kein Versandrecht.Entwurf ohne externe Zusage; fehlende Begründung markieren und an die zuständige Inhalts- oder Richtlinienstelle übergeben.Quellen-, Vorlagen-, Richtlinien- und Entwurfskennung erfassen; fehlende Grundlagen, unzulässige Zusagen, sensible Daten und feindliche Anweisungen testen; Markierungen und Reviewer-Entscheide überwachen.
Freigegebene Antwort sendenSeparate schmale Versandoperation; nur vorgesehener Kanal und Empfänger; delegierte oder kontrollierte Identität mit Berechtigung für die Nachrichtenressource.Folgenreiche externe Aktion; Empfänger, Inhaltsreferenz, Autorisierung, Freigabeablauf und Duplikatschutz unmittelbar vor der Ausführung prüfen.Absender, Empfänger, Inhaltsreferenz, Freigabe und Resultat erfassen; geänderte Parameter, abgelaufene Freigabe, fehlende Rechte, Wiederholung und Kanalausfall testen; Versanddienst verantwortlich, geschäftlicher Entscheid beim menschlichen Absender.

Die drei Operationen dürfen eine Gesprächsoberfläche teilen, aber weder Datenzugriff noch Berechtigung, Kennzahl oder Übergabeweg. OWASP stützt diese Trennung mit minimalen Werkzeugfunktionen und nachgelagerten Rechten. Für die Nachvollziehbarkeit nennt das OWASP-Merkblatt unter anderem Entscheide, Werkzeugaufrufe, Autorisierungsergebnisse, Freigabekennungen, Richtlinienversionen, Resultate und auffällige Aktionsmuster; sensible Daten sind zu schwärzen. Der NIST AI RMF ergänzt klare Rollen, Kommunikationswege, getrennte Mensch-KI-Verantwortung, laufendes Monitoring und periodische Überprüfung. Eine Canvas-Zeile ohne Owner und Betriebssignal bleibt deshalb Dokumentation statt Kontrolle.

Welche Nachweise braucht die Freigabe und der weitere Betrieb?

Ein Qualitätsteam prüft farbige Marken mit Häkchen, Kreuzen und Pfeilen neben versiegelten Testumschlägen, während ein Mitglied Notizen schreibt.

Eine Freigabe braucht Nachweise, dass erlaubte Leistungen und erwartete Ablehnungen unter einsatznahen Bedingungen funktionieren; danach folgen Monitoring und anlassbezogene Neubeurteilung. NIST nennt einsatznahe Tests, Produktionsmonitoring, dokumentierte Generalisierungsgrenzen, sicheres Scheitern und regelmässige Sicherheitsbewertungen. Das NCSC empfiehlt eine angemessene Sicherheitsprüfung vor der Einführung sowie verständliche Angaben zu bekannten Grenzen und Fehlermodi. Ein erfolgreicher Musterfall allein belegt weder die Informationsgrenze noch das Verhalten bei manipulierten Eingaben, Systemausfällen oder veränderten Aktionsparametern.

  • Zulässige Aufgaben und korrekte Quellenverwendung
  • Kontoübergreifender Zugriff und unzulässige Daten
  • Veraltete oder vergiftete abgerufene Inhalte
  • Nicht erlaubte Werkzeuge und Rechteausweitung
  • Freigabeumgehung und nachträglich geänderte Parameter
  • Doppelte Wiederholung, Abhängigkeitsausfall und Datenabflussversuch
  • Ausser Kontrolle geratene Aktionsketten und funktionierende Schutzschalter

Protokolle müssen rekonstruieren können, wer was verlangte, welche Fähigkeit und Richtlinie galten, welche Quellen- und Werkzeugklassen verwendet wurden, welche Autorisierungs- und Freigabeentscheide fielen, welche Aktion resultierte und welche Versionen aktiv waren. Geheimnisse und unbegrenzter sensibler Rohkontext gehören nicht hinein. Fähigkeitsbezogene Signale umfassen unerwartete Werkzeugnutzung, wiederholte Ablehnungen, Autorisierungsfehler, Freigabeänderungen, auffällige Sequenzen, Drift, Latenz, Ressourcenverbrauch und Ausfälle. Inhalt, Zugriff und Aufbewahrung der Protokolle richten sich nach Risiko-, Datenschutz-, Sicherheits- und Records-Anforderungen.

Serviceverhalten, Zugriffsvergaben, geschäftliche Übergaben und Sicherheitsvorfälle brauchen benannte Verantwortliche mit Befugnis, eine Fähigkeit zu pausieren, anzupassen oder stillzulegen. Wesentliche Änderungen an Modell, Prompt, Retrieval, Speicher, Werkzeug, Berechtigung, Richtlinie, Daten, Provider oder Einsatzumfeld öffnen die betroffenen Tests und Freigabenachweise erneut. Beginnen sollte ein Team mit der kleinsten nützlichen Fähigkeit und Autorität nur über geprüfte Änderungen erweitern. Berührt sie sensible Daten, persistenten Speicher, privilegierten Zugriff, externe Zusagen, destruktive Änderungen oder Vorfallreaktion, werden Sicherheits-, Identitäts-, Datenschutz-, Records-, Risiko- und Serviceverantwortliche einbezogen; Fachentscheide gehen in einen separat geführten Prozess.

Häufige Fragen zu begrenzten KI-Assistenten

Was ist ein begrenzter KI-Assistent?

Ein begrenzter KI-Assistent ist ein Geschäftsdienst, dessen Aufgaben, Informationen, Identitäten, Werkzeuge, Aktionen, Nachweise, Ablehnungen und Verantwortlichkeiten ausdrücklich eingeschränkt sind. Die entscheidenden Grenzen werden ausserhalb des Modells technisch und organisatorisch durchgesetzt. Ein System-Prompt kann Verhalten anleiten, ersetzt diese Kontrollen aber nicht.

Wie erstellt man eine Berechtigungsmatrix für einen KI-Agenten?

Für jede sichtbare Fähigkeit wird eine eigene Zeile erstellt, beispielsweise für Lesen, Entwerfen oder Senden. Darin stehen Akteur, Datenumfang, Werkzeugoperation, Ressourcenerlaubnis, Aktionsgrenze, Freigabe, Betriebsgrenzen, Protokollnachweise, Tests, Kennzahlen und Owner. Eine allgemeine Zeile wie «darf auf das CRM zugreifen» ist zu breit.

Welche Kontextgrenzen braucht ein KI-Assistent?

Die Grenze umfasst zugelassene Quellen und Datensätze, Benutzerberechtigungen, Objekt- und Feldfilter, Aktualität, Vertrauensklassen sowie ausgeschlossene Daten. Sitzungshistorie und persistenter Speicher erhalten getrennte Regeln für Eignung, Isolation, Validierung, Grösse, Ablauf und Löschung. Konkrete Grenzwerte werden für den jeweiligen Dienst festgelegt.

Reicht eine menschliche Freigabe für eine sichere Agentenaktion?

Nein. Eine Freigabe akzeptiert nur eine konkret vorgeschlagene Aktion und muss an Akteur, Werkzeug, Ziel und normalisierte Parameter gebunden sein. Sie ersetzt keine nachgelagerte Autorisierung, reduziert keine zu breite Dauerberechtigung und macht einen verbotenen Entscheid nicht zulässig.

Wann soll ein KI-Assistent ablehnen oder eskalieren?

Er lehnt ab, wenn Aufgabe oder Daten ausserhalb des Auftrags liegen, Autorisierung oder Freigabe fehlt, Belege fehlen oder veraltet sind, ein Fachentscheid nötig ist, eine Abhängigkeit ausfällt, eine Betriebsgrenze erreicht wird oder ein Sicherheitssignal vorliegt. Wo möglich, bietet er nur den sicheren Teil der Hilfe an. Die Übergabe geht mit Grund, zulässigem Kontext, Beleglage, nächstem Schritt und Trace-Kennung an die verantwortliche Stelle.

ModelFold logo

Redaktion von ModelFold

Wir berichten darüber, wie KI tatsächlich in einem Unternehmen ankommt. Wir arbeiten mit benannten Quellen, trennen Recherche von Einschätzung und nutzen KI-Unterstützung für Recherche und Entwürfe unter dokumentierten redaktionellen Kontrollen. Eine individuelle Fachprüfung ersetzen wir nicht.