RequestChange
Version 0.7
Living Whitepaper

Woran wir arbeiten.

Wie können KI-Agenten technische Anfragen zuverlässig vorbereiten? Wir untersuchen das Zusammenspiel von Firmenwissen, Werkzeugen und menschlicher Prüfung — gemessen an Ergebnisqualität und Gesamtkosten.

Praxis, Prüfplan und AusblickDie Agenda baut auf unserer Projektarbeit auf. Der beschriebene Vergleich ist geplant; Messergebnisse stehen noch aus.
Nächster Prüfauftrag

Von der Anfrage zur fachlichen Freigabe.

Wir wollen klären, wo KI die Bearbeitung einer technischen Anfrage erleichtert: Welche Angaben aus Zeichnung und Produktanforderung sind belastbar, welche fehlen und was muss ein Mensch vor der Weitergabe prüfen?

Prüfplan formuliert · Vergleich noch offen

Der betrachtete Ablauf

  1. 01Anfrage & Zeichnung
  2. 02Daten & Regeln prüfen
  3. 03Entwurf vorbereiten
  4. 04Fachlich freigeben
  1. Aufgabe und Abnahme festlegen

    Für eine begrenzte Aufgabenklasse freigegebene Beispieldaten auswählen, den bisherigen Ablauf erfassen und fachliche Erfolgskriterien definieren. Fehlende Angaben und Ausnahmen gehören zum Testumfang.

  2. Mit denselben Fällen vergleichen

    Einen festen Workflow und einen einzelnen Agenten auf denselben Aufgaben vergleichen. Für Agent Onboarding zusätzlich die allgemein eingerichtete und die eingearbeitete Variante mit gleichem Modell und zulässigen Rechten prüfen; Kontext und Werkzeuge dokumentieren. Mehrere Agenten folgen nur bei begründetem Zusatznutzen. Die fachlichen Abnahmekriterien bleiben gleich.

  3. Befugnisse und Betrieb bewerten

    Unerlaubte Aktionen und Wiederherstellung in einer isolierten Umgebung prüfen. Für fachlich geeignete Varianten anschließend lokale, hybride und Cloud-Betriebsformen anhand von Datenanforderungen, Last und Gesamtkosten bewerten.

Was der Vergleich zeigen soll

  • Ergebnisqualität, Rückfragen, Fehler und nötige Nacharbeit.
  • Zeit und Gesamtkosten bis zum akzeptierten Ergebnis.
  • Wirksame Berechtigungsgrenzen und Aufwand für Freigaben.

Nächster Nachweis ist ein dokumentierter Vergleich mit klarer Systemgrenze und benannten Einschränkungen. Qualität und zulässiger Datenzugriff sind Voraussetzungen; erst innerhalb dieser Grenzen vergleichen wir den Aufwand. Testfälle und Messung stehen noch aus.

Unsere Schwerpunkte

KI für verlässliche Produktarbeit.

Wie wird aus einer Zeichnung, einer Produktregel oder einer Anforderung ein fachlich brauchbares Ergebnis? Wir betrachten vier Seiten derselben Aufgabe: Zusammenarbeit und Systemaufbau sowie Wirtschaftlichkeit und Sicherheit im Betrieb.

01

Mit Agenten zusammenarbeiten

Fachleute geben Ziele, Zeichnungen und Referenzen vor; Agenten unterstützen die Bearbeitung. Wir fragen, wie Kontext und Feedback die Qualität von Designvarianten, Prüfungen und Entwürfen verbessern.

Offene Frage

Welche Anweisungen, Referenzen und Rückmeldungen braucht ein Agent für eine konkrete Fachaufgabe?

Prüffragen und Vorgehen

  • Prompting entwickelt sich weiter: Ziele, Referenzen und Erfolgskriterien gewinnen an Gewicht. An Aufgaben wie Zeichnungsauslesung oder Variantenvergleich wollen wir prüfen, welcher Kontext hilft und wo zusätzliche Regeln die Arbeit erschweren.
  • Unternehmenswissen soll im passenden Moment verfügbar sein. Context Engineering heißt für uns: die benötigten Informationen auswählen und aktuell halten. Skills bündeln wiederkehrendes Fachwissen, Arbeitsanweisungen und Werkzeuge zur Wiederverwendung.
  • Menschen setzen Prioritäten, beurteilen Ergebnisse und geben Feedback. Wir prüfen, welche Rückmeldungen in bessere Referenzen oder Prüfungen einfließen sollten, damit die nächste Aufgabe weniger Mikromanagement braucht.
  • Anthropics aktuelle Beiträge zeigen, wie sich Anleitung mit leistungsfähigeren Modellen verändert. Solche Ansätze sollen am jeweiligen Prozess geprüft werden; kürzere Prompts sind für sich genommen kein Qualitätsziel.
02

Agentensysteme aufbauen

Agent Onboarding macht den Einstieg konkret: Wir richten Agenten für eine Fachaufgabe ein – mit Produktwissen, Arbeitsanweisungen und passenden Werkzeugen. Am Ergebnis prüfen wir, wo sie einen Vorteil bieten.

Offene Frage

Wann genügt ein einfacher Workflow, und wann rechtfertigt mehr Eigenständigkeit oder die Zusammenarbeit mehrerer Agenten ihren zusätzlichen Aufwand?

Prüffragen und Vorgehen

  • Wir beginnen beim Fachprozess: Welche Daten sind verlässlich, welche Systeme müssen erreichbar sein und welche Aktionen sind erlaubt? Wir klären Zuständigkeiten, Zugriffsrechte und die Schritte, die eine menschliche Freigabe brauchen.
  • Für bekannte Abläufe betrachten wir zuerst feste Workflows. An denselben Testaufgaben soll geprüft werden, ob ein einzelner Agent bei variablen Eingaben oder Rückfragen hilft. Mehrere Agenten werden erst relevant, wenn getrennte Aufgaben oder unabhängige Prüfung einen messbaren Vorteil erwarten lassen.
  • Wiederholte Arbeitszyklen brauchen ein prüfbares Ziel, Stoppbedingungen und Grenzen für Laufzeit und Tokenverbrauch. Tokens sind die Texteinheiten, die ein Sprachmodell verarbeitet. Bei Unklarheiten oder ausgeschöpftem Budget muss der nächste Schritt eindeutig sein.
  • Vorgesehen ist ein Vergleich mit repräsentativen Testaufgaben, sogenannten Evals: Ergebnisqualität, Fehler, Dauer und Kosten werden gemeinsam betrachtet. Geprüft werden sollen tatsächliche Ergebnisse im Zielsystem und die Schritte, an denen ein Mensch entscheidet. Bei einem Modellwechsel wird auch der Aufbau erneut überprüft.
  • Neon zeigt ein Muster für die Einarbeitung: Skills führen Agenten zu passender Dokumentation und vermitteln Arbeitsweisen; angebundene Werkzeuge ermöglichen Aktionen. Wir übertragen dieses Prinzip auf betriebliche Fachaufgaben. Das Beispiel belegt den technischen Ansatz, noch keinen Nutzen in unseren Kundenprozessen.

Agent Onboarding: KI-Agenten im Unternehmen einarbeiten.

Ein Agent braucht Orientierung: Welche Quellen gelten, wie wird gearbeitet und wer entscheidet bei Unklarheiten? Wir beginnen mit einem Fachprozess, einer Agentenrolle und einem verantwortlichen Team. Die Einarbeitung verbindet Unternehmenswissen, Arbeitsweisen und Systemzugänge mit einer praktischen Abnahme.

  1. 01
    Auftrag klären

    Aufgabe, Verantwortliche und erwartetes Ergebnis festlegen. Gemeinsam definieren, woran brauchbare Arbeit erkennbar ist.

  2. 02
    Firmenwissen erschließen

    Gültige Quellen, Fachbegriffe und Produktregeln zugänglich machen. Wissen gezielt nachladen und seine Pflege zuordnen.

  3. 03
    Arbeitsweise vermitteln

    Wiederkehrende Schritte in Skills, Beispielen und Vorlagen beschreiben – einschließlich Rückfragen und Ausnahmewegen.

  4. 04
    Werkzeuge einrichten

    Benötigte Systeme anbinden, Rechte technisch begrenzen und menschliche Freigaben im Ablauf verankern.

  5. 05
    Praxisprüfung bestehen

    Normale und fehlerhafte Fälle bearbeiten. Fachleute prüfen Ergebnisse; erlaubte und unerlaubte Aktionen werden getestet.

  6. 06
    Aktuell bleiben

    Das Team schulen, Quellen und Skills pflegen und bei Änderungen erneut prüfen. Zugangsentzug und Wiederherstellung gehören zur Übergabe.

Beispiel: eine technische Anfrage vorbereiten

Ein Mitarbeiter legt eine Anfrage mit Zeichnung ab. Der Agent findet die gültigen Produktregeln, belegt seine Angaben und markiert Lücken. Er bereitet Rückfragen vor; der zuständige Mensch prüft sie und entscheidet über die Weitergabe.

Unsere Prüffrage: Verringert die Einarbeitung wiederholte Erklärungen, Rückfragen und Nacharbeit? Wir vergleichen dieselben Aufgaben mit gleichem Modell und zulässigen Rechten; Kontext und Werkzeuge werden dokumentiert. Maßstab sind fachlich akzeptierte Ergebnisse, wirksame Handlungsgrenzen und Gesamtkosten einschließlich Pflege. Der Vergleich steht noch aus.

Agent Onboarding & Team-Enablement
03

KI wirtschaftlich betreiben

Zeichnungsprüfung, Variantenbildung und Angebotsvorbereitung haben unterschiedliche Anforderungen. Daraus leiten wir passende Modelle, Betriebsformen und Hardware ab. Entscheidend sind Qualität und Gesamtkosten des Ergebnisses.

Offene Frage

Welche Kombination aus Architektur, Hardware und Betrieb liefert ein fachlich akzeptiertes Ergebnis zu vertretbaren Gesamtkosten?

Prüffragen und Vorgehen

  • Aus Aufgabe, Qualitätsziel, Datenanforderungen und Lastprofil ergibt sich die Betriebsarchitektur. Unsere These: Viele Unternehmen werden solche KI-Anwendungen dauerhaft betreiben. Mit „AI Factory“ meinen wir hier die dafür nötige Umgebung aus Daten, Modellen, Werkzeugen und Prüfungen; Umfang und Betriebsform bleiben pro Anwendung zu klären.
  • Modellarchitekturen sollen passend zur Aufgabe verglichen werden: Dichte Modelle nutzen ihre Modellteile durchgängig; Mixture-of-Experts-Modelle (MoE) aktivieren ausgewählte Teilnetze. Bei Quantisierung werden Modellwerte mit geringerer Genauigkeit gespeichert. Ob das Speicher und Kosten spart, ohne die benötigte Qualität zu verlieren, muss der Anwendungstest zeigen.
  • Modellrouting weist Aufgaben geeigneten Modellen zu. Caching verwendet bereits berechneten Kontext erneut, Batching bündelt Anfragen. Diese Verfahren sollen gemeinsam mit Antwortzeit und Qualität bewertet werden: Maßstab der Token-Ökonomie sind die Kosten je fachlich akzeptiertem Ergebnis, einschließlich Fehlversuchen und Nacharbeit.
  • Hardware wählen wir nach Modell und Lastprofil: CPU als Hauptprozessor, GPU oder NPU als Beschleuniger sowie Arbeits- und Modellspeicher (RAM/VRAM). Speicherbandbreite, Netzwerk und Datenspeicher können den Durchsatz begrenzen. Lokaler, hybrider und Cloud-Betrieb sollen anhand von Auslastung, Datenanforderungen und Betriebsaufwand verglichen werden.
  • Zur Kostenrechnung gehören Energie unter Last und im Leerlauf, Kühlung, Abschreibung, Integration, Dienste, Wartung, Sicherheitsprüfung und Wiederherstellung nach Störungen sowie menschliche Prüfung und Nacharbeit. Wir untersuchen, wie sich Verbrauch und gemeinsame Infrastruktur nachvollziehbar Abteilungen und Prozessen zuordnen lassen. Energie je Ergebnis braucht Messungen am konkreten System; eine Chip-Leistungsangabe reicht dafür nicht. Cloud-Verbrauch bleibt bei fehlenden Messdaten ausdrücklich eine Schätzung.
04

KI-Agenten absichern

Ein Agent darf eine Zeichnung prüfen, ohne dadurch Kundendaten versenden oder ein Angebot freigeben zu dürfen. Wir fragen, wie sich solche Grenzen technisch durchsetzen und im Fachprozess überprüfen lassen.

Offene Frage

Wie viel Autonomie ist für einen konkreten Prozess vertretbar, und welche nachweisbaren Kontrollen braucht sie?

Prüffragen und Vorgehen

  • Minimale Zugriffsrechte, getrennte Identitäten und klar begrenzte Werkzeuge bilden die Grundlage. Berechtigungen werden im Zielsystem durchgesetzt; kritische Änderungen und Datenweitergaben brauchen eine überprüfbare Freigabe. Unsere Prüffrage: Halten diese Grenzen auch bei unvollständigen Aufträgen und bei der Delegation an weitere Agenten?
  • Externe Dokumente, Webseiten und Werkzeugantworten können manipulierte Anweisungen enthalten: sogenannte Prompt Injection. Solche Inhalte dürfen keine zusätzlichen Befugnisse schaffen. Wir prüfen Datenwege, erlaubte Empfänger und die Herkunft eingebundener Werkzeuge und Skills. Zugangsschlüssel gehören in eine getrennte Verwaltung, nicht in den Modellkontext. Lokaler Betrieb allein gewährleistet keine Sicherheit.
  • Geprüft werden sollen manipulierte Eingaben, unerlaubte Aktionsversuche und Abbruchfälle in isolierten, freigegebenen Testumgebungen. Wir wollen sowohl verhinderte Grenzüberschreitungen als auch fälschlich blockierte Arbeit und den Aufwand für menschliche Freigaben erfassen. Maßgeblich sind tatsächliche Aktionen im Zielsystem.
  • Zum Betrieb gehören nachvollziehbare Protokolle ohne Zugangsschlüssel, die Erkennung ungewöhnlicher Aktionen und Verbrauchsmuster sowie ein geübter Weg zum Stoppen, Entziehen von Zugängen und Wiederherstellen. Zuständigkeiten und der Aufwand für diese Kontrollen fließen in die Kosten je akzeptiertem Ergebnis ein.
  • Dario Amodeis Essay vom September 2026 und Anthropics Berichte geben Anlass zu diesen Fragen. Wir unterscheiden seine Zukunftseinschätzung, beobachteten Missbrauch und unerlaubte Agentenaktionen in fehlkonfigurierten Tests. Die Grenzen dieser Quellen stehen unten; sie ersetzen keine Prüfung unserer konkreten Anwendungen.
Weiterführende Forschungsrichtung

Der Prozess endet nicht an der Unternehmensgrenze.

Auf die Einarbeitung eigener Agenten kann ein zweiter Schritt folgen: Kunden- und Lieferantenagenten erhalten einen verständlichen Zugang zu Produktinformationen, Variantenregeln und Anfragewegen. Öffentliche Skills können dabei Orientierung geben. Datenzugriff und Vertretungsbefugnis werden separat geprüft und technisch begrenzt. Wir wollen untersuchen, wie daraus nachvollziehbare Übergaben mit Quelle, Version und menschlicher Freigabe entstehen.

  1. 01

    Anfrage

    Anforderung, Zeichnung, Quellen und Produktkontext werden strukturiert übergeben.

  2. 02

    Prüfung

    Der Empfänger prüft Auftrag, Produktregeln und fehlende Angaben; Agenten können unterstützen.

  3. 03

    Rückfrage

    Unklare Punkte gehen strukturiert an den Kunden zurück.

  4. 04

    Freigabe

    Menschen entscheiden über Preis, Termin und Ausnahmen.

  5. 05

    Übergabe

    Ergebnis, Quelle, Version und Verantwortung werden dokumentiert.

Framework

Dafür braucht es sechs klare Regeln.

Technische Verbindung allein reicht nicht. Jede Übergabe braucht einen festen Rahmen.

  1. 01

    Identität

    Wer handelt für welches Unternehmen?

  2. 02

    Mandat

    Was darf der Agent prüfen, ausführen oder zusagen?

  3. 03

    Semantik

    Welche Begriffe und Produktregeln gelten?

  4. 04

    Daten

    Welche Informationen dürfen die Firma verlassen?

  5. 05

    Nachweis

    Welche Quelle und Version stützt das Ergebnis?

  6. 06

    Eskalation

    Wann muss ein Mensch entscheiden?

Quellen & Einordnung

Worauf wir uns beziehen.

Diese Primärquellen geben methodische und technische Orientierung. Herstellerbefunde und standardisierte Benchmarks ersetzen keine Prüfung im eigenen Unternehmensprozess. Quellenstand: 16. September 2026; Neon-Ergänzungen geprüft am 20. September 2026.

  1. Anthropic · 29.09.2025

    Effective context engineering for AI agents

    Beschreibt den Übergang von einzelnen Prompts zur laufenden Auswahl relevanten Kontexts. Klare Anweisungen bleiben Teil dieser Arbeit.

  2. Anthropic · Thariq Shihipar · 24.07.2026

    The new rules of context engineering for Claude 5 generation models

    Berichtet über vereinfachte Anweisungen, bessere Schnittstellen und bedarfsgeladenen Kontext. Die Befunde betreffen bestimmte Claude-Modelle und interne Coding-Tests; sie sind keine allgemeine Regel zur Promptlänge.

  3. Anthropic · Delba de Oliveira & Michael Segner · 30.06.2026

    Loop engineering: Getting started with loops

    Ordnet Arbeitszyklen nach Auslösern und Stoppbedingungen und verbindet Qualitätsprüfungen mit Tokenbudgets. Empfiehlt einfache Lösungen für einfache Aufgaben.

  4. Anthropic · 09.01.2026

    Demystifying evals for AI agents

    Methodik für wiederholbare Agententests mit technischen, modellbasierten und menschlichen Bewertungen. Testfälle und Erfolgskriterien müssen zum Fachprozess passen.

  5. Neon · 22.01.2026

    Agent Skills in 2026

    Beschreibt Skills als Einstieg zu Arbeitsweisen und aktueller Dokumentation, ergänzt um authentifizierte MCP-Werkzeuge. Vorbild für unseren Ansatz; kein Nachweis seiner Wirkung in anderen Unternehmen.

  6. Neon · 25.08.2026

    Just landed in the Neon CLI

    Zeigt die gemeinsame Einrichtung von Authentifizierung, MCP und Skills sowie deren Aktualisierung. Die konkrete Umsetzung betrifft Neon; betriebliche Fachaufgaben benötigen eigene Abnahmekriterien.

  7. AMD · 16.03.2026

    Efficient MoE Inference on Strix and Halo

    Fallstudie zum Zusammenspiel von MoE, Quantisierung, CPU, NPU und Speicher. Modell- und plattformspezifische Ergebnisse; kein allgemeiner Hardwarevergleich oder Kaufurteil.

  8. International Energy Agency (IEA) · 16.04.2026

    Key Questions on Energy and AI

    Ordnet Strombedarf, Infrastruktur und die Entwicklung von KI ein. Globale Szenarien liefern keine Verbrauchszahl für eine einzelne Unternehmensanwendung.

  9. MLCommons · Geprüft: 16.09.2026

    MLPerf Inference: Datacenter

    Vergleichbare Inferenztests für definierte Lasten. Die ausgewiesenen Energiemessungen gelten für das Gesamtsystem im jeweiligen Benchmark, nicht pauschal für andere Aufgaben.

  10. Dario Amodei · September 2026

    We Must Pace the Frontier

    Persönlicher Essay über Zukunftsrisiken und unabhängige Sicherheitsprüfung. Die Prognosen sind Amodeis Einschätzung; daraus folgt keine gemessene Eintrittswahrscheinlichkeit für Unternehmensanwendungen.

  11. Anthropic · Threat Intelligence Team · 10.09.2026

    Detecting and countering misuse of AI: September 2026

    Ausgewählte Missbrauchsfälle aus Dezember 2025 bis August 2026. Ein Bericht des Threat Intelligence Teams, kein persönlicher Bericht Amodeis und keine repräsentative Häufigkeitsmessung.

  12. Anthropic · Paul C. Bogdan et al. · 09.09.2026 · korrigiert 10.09.2026

    An alignment assessment of recent cybersecurity incidents

    Herstelleranalyse von vier Vorfällen in fehlkonfigurierten Cyber-Tests mit Internetzugang und deaktivierten üblichen Cyber-Schutzmaßnahmen. Die Testbedingungen erlauben keine Ausfallquote für den normalen Unternehmensbetrieb.

  13. OWASP GenAI Security Project · Ausgabe 2025 · geprüft 16.09.2026

    LLM06:2025 Excessive Agency

    Beschreibt Risiken durch zu weitreichende Werkzeuge, Rechte und Autonomie. Orientierung für technische Zugriffskontrollen und überprüfbare Freigaben, keine Zertifizierung eines Systems.

Zusammenarbeit

Welche Aufgabe soll KI bei Ihnen verlässlich übernehmen?

Wir sprechen über den Prozess, die vorhandenen Daten und ein überprüfbares Ziel. Daraus lässt sich ein begrenzter Versuch ableiten – mit klaren Verantwortlichkeiten und einem Maßstab für Qualität und Aufwand.