Woran wir arbeiten.
Wie können KI-Agenten technische Anfragen zuverlässig vorbereiten? Wir untersuchen das Zusammenspiel von Firmenwissen, Werkzeugen und menschlicher Prüfung — gemessen an Ergebnisqualität und Gesamtkosten.
Von der Anfrage zur fachlichen Freigabe.
Wir wollen klären, wo KI die Bearbeitung einer technischen Anfrage erleichtert: Welche Angaben aus Zeichnung und Produktanforderung sind belastbar, welche fehlen und was muss ein Mensch vor der Weitergabe prüfen?
Prüfplan formuliert · Vergleich noch offen
Der betrachtete Ablauf
- 01Anfrage & Zeichnung
- 02Daten & Regeln prüfen
- 03Entwurf vorbereiten
- 04Fachlich freigeben
Aufgabe und Abnahme festlegen
Für eine begrenzte Aufgabenklasse freigegebene Beispieldaten auswählen, den bisherigen Ablauf erfassen und fachliche Erfolgskriterien definieren. Fehlende Angaben und Ausnahmen gehören zum Testumfang.
Mit denselben Fällen vergleichen
Einen festen Workflow und einen einzelnen Agenten auf denselben Aufgaben vergleichen. Für Agent Onboarding zusätzlich die allgemein eingerichtete und die eingearbeitete Variante mit gleichem Modell und zulässigen Rechten prüfen; Kontext und Werkzeuge dokumentieren. Mehrere Agenten folgen nur bei begründetem Zusatznutzen. Die fachlichen Abnahmekriterien bleiben gleich.
Befugnisse und Betrieb bewerten
Unerlaubte Aktionen und Wiederherstellung in einer isolierten Umgebung prüfen. Für fachlich geeignete Varianten anschließend lokale, hybride und Cloud-Betriebsformen anhand von Datenanforderungen, Last und Gesamtkosten bewerten.
Was der Vergleich zeigen soll
- Ergebnisqualität, Rückfragen, Fehler und nötige Nacharbeit.
- Zeit und Gesamtkosten bis zum akzeptierten Ergebnis.
- Wirksame Berechtigungsgrenzen und Aufwand für Freigaben.
Nächster Nachweis ist ein dokumentierter Vergleich mit klarer Systemgrenze und benannten Einschränkungen. Qualität und zulässiger Datenzugriff sind Voraussetzungen; erst innerhalb dieser Grenzen vergleichen wir den Aufwand. Testfälle und Messung stehen noch aus.
KI für verlässliche Produktarbeit.
Wie wird aus einer Zeichnung, einer Produktregel oder einer Anforderung ein fachlich brauchbares Ergebnis? Wir betrachten vier Seiten derselben Aufgabe: Zusammenarbeit und Systemaufbau sowie Wirtschaftlichkeit und Sicherheit im Betrieb.
Mit Agenten zusammenarbeiten
Fachleute geben Ziele, Zeichnungen und Referenzen vor; Agenten unterstützen die Bearbeitung. Wir fragen, wie Kontext und Feedback die Qualität von Designvarianten, Prüfungen und Entwürfen verbessern.
Offene Frage
Welche Anweisungen, Referenzen und Rückmeldungen braucht ein Agent für eine konkrete Fachaufgabe?
Prüffragen und Vorgehen
- Prompting entwickelt sich weiter: Ziele, Referenzen und Erfolgskriterien gewinnen an Gewicht. An Aufgaben wie Zeichnungsauslesung oder Variantenvergleich wollen wir prüfen, welcher Kontext hilft und wo zusätzliche Regeln die Arbeit erschweren.
- Unternehmenswissen soll im passenden Moment verfügbar sein. Context Engineering heißt für uns: die benötigten Informationen auswählen und aktuell halten. Skills bündeln wiederkehrendes Fachwissen, Arbeitsanweisungen und Werkzeuge zur Wiederverwendung.
- Menschen setzen Prioritäten, beurteilen Ergebnisse und geben Feedback. Wir prüfen, welche Rückmeldungen in bessere Referenzen oder Prüfungen einfließen sollten, damit die nächste Aufgabe weniger Mikromanagement braucht.
- Anthropics aktuelle Beiträge zeigen, wie sich Anleitung mit leistungsfähigeren Modellen verändert. Solche Ansätze sollen am jeweiligen Prozess geprüft werden; kürzere Prompts sind für sich genommen kein Qualitätsziel.
Agentensysteme aufbauen
Agent Onboarding macht den Einstieg konkret: Wir richten Agenten für eine Fachaufgabe ein – mit Produktwissen, Arbeitsanweisungen und passenden Werkzeugen. Am Ergebnis prüfen wir, wo sie einen Vorteil bieten.
Offene Frage
Wann genügt ein einfacher Workflow, und wann rechtfertigt mehr Eigenständigkeit oder die Zusammenarbeit mehrerer Agenten ihren zusätzlichen Aufwand?
Prüffragen und Vorgehen
- Wir beginnen beim Fachprozess: Welche Daten sind verlässlich, welche Systeme müssen erreichbar sein und welche Aktionen sind erlaubt? Wir klären Zuständigkeiten, Zugriffsrechte und die Schritte, die eine menschliche Freigabe brauchen.
- Für bekannte Abläufe betrachten wir zuerst feste Workflows. An denselben Testaufgaben soll geprüft werden, ob ein einzelner Agent bei variablen Eingaben oder Rückfragen hilft. Mehrere Agenten werden erst relevant, wenn getrennte Aufgaben oder unabhängige Prüfung einen messbaren Vorteil erwarten lassen.
- Wiederholte Arbeitszyklen brauchen ein prüfbares Ziel, Stoppbedingungen und Grenzen für Laufzeit und Tokenverbrauch. Tokens sind die Texteinheiten, die ein Sprachmodell verarbeitet. Bei Unklarheiten oder ausgeschöpftem Budget muss der nächste Schritt eindeutig sein.
- Vorgesehen ist ein Vergleich mit repräsentativen Testaufgaben, sogenannten Evals: Ergebnisqualität, Fehler, Dauer und Kosten werden gemeinsam betrachtet. Geprüft werden sollen tatsächliche Ergebnisse im Zielsystem und die Schritte, an denen ein Mensch entscheidet. Bei einem Modellwechsel wird auch der Aufbau erneut überprüft.
- Neon zeigt ein Muster für die Einarbeitung: Skills führen Agenten zu passender Dokumentation und vermitteln Arbeitsweisen; angebundene Werkzeuge ermöglichen Aktionen. Wir übertragen dieses Prinzip auf betriebliche Fachaufgaben. Das Beispiel belegt den technischen Ansatz, noch keinen Nutzen in unseren Kundenprozessen.
Agent Onboarding: KI-Agenten im Unternehmen einarbeiten.
Ein Agent braucht Orientierung: Welche Quellen gelten, wie wird gearbeitet und wer entscheidet bei Unklarheiten? Wir beginnen mit einem Fachprozess, einer Agentenrolle und einem verantwortlichen Team. Die Einarbeitung verbindet Unternehmenswissen, Arbeitsweisen und Systemzugänge mit einer praktischen Abnahme.
- 01
Auftrag klären
Aufgabe, Verantwortliche und erwartetes Ergebnis festlegen. Gemeinsam definieren, woran brauchbare Arbeit erkennbar ist.
- 02
Firmenwissen erschließen
Gültige Quellen, Fachbegriffe und Produktregeln zugänglich machen. Wissen gezielt nachladen und seine Pflege zuordnen.
- 03
Arbeitsweise vermitteln
Wiederkehrende Schritte in Skills, Beispielen und Vorlagen beschreiben – einschließlich Rückfragen und Ausnahmewegen.
- 04
Werkzeuge einrichten
Benötigte Systeme anbinden, Rechte technisch begrenzen und menschliche Freigaben im Ablauf verankern.
- 05
Praxisprüfung bestehen
Normale und fehlerhafte Fälle bearbeiten. Fachleute prüfen Ergebnisse; erlaubte und unerlaubte Aktionen werden getestet.
- 06
Aktuell bleiben
Das Team schulen, Quellen und Skills pflegen und bei Änderungen erneut prüfen. Zugangsentzug und Wiederherstellung gehören zur Übergabe.
Beispiel: eine technische Anfrage vorbereiten
Ein Mitarbeiter legt eine Anfrage mit Zeichnung ab. Der Agent findet die gültigen Produktregeln, belegt seine Angaben und markiert Lücken. Er bereitet Rückfragen vor; der zuständige Mensch prüft sie und entscheidet über die Weitergabe.
Unsere Prüffrage: Verringert die Einarbeitung wiederholte Erklärungen, Rückfragen und Nacharbeit? Wir vergleichen dieselben Aufgaben mit gleichem Modell und zulässigen Rechten; Kontext und Werkzeuge werden dokumentiert. Maßstab sind fachlich akzeptierte Ergebnisse, wirksame Handlungsgrenzen und Gesamtkosten einschließlich Pflege. Der Vergleich steht noch aus.
KI wirtschaftlich betreiben
Zeichnungsprüfung, Variantenbildung und Angebotsvorbereitung haben unterschiedliche Anforderungen. Daraus leiten wir passende Modelle, Betriebsformen und Hardware ab. Entscheidend sind Qualität und Gesamtkosten des Ergebnisses.
Offene Frage
Welche Kombination aus Architektur, Hardware und Betrieb liefert ein fachlich akzeptiertes Ergebnis zu vertretbaren Gesamtkosten?
Prüffragen und Vorgehen
- Aus Aufgabe, Qualitätsziel, Datenanforderungen und Lastprofil ergibt sich die Betriebsarchitektur. Unsere These: Viele Unternehmen werden solche KI-Anwendungen dauerhaft betreiben. Mit „AI Factory“ meinen wir hier die dafür nötige Umgebung aus Daten, Modellen, Werkzeugen und Prüfungen; Umfang und Betriebsform bleiben pro Anwendung zu klären.
- Modellarchitekturen sollen passend zur Aufgabe verglichen werden: Dichte Modelle nutzen ihre Modellteile durchgängig; Mixture-of-Experts-Modelle (MoE) aktivieren ausgewählte Teilnetze. Bei Quantisierung werden Modellwerte mit geringerer Genauigkeit gespeichert. Ob das Speicher und Kosten spart, ohne die benötigte Qualität zu verlieren, muss der Anwendungstest zeigen.
- Modellrouting weist Aufgaben geeigneten Modellen zu. Caching verwendet bereits berechneten Kontext erneut, Batching bündelt Anfragen. Diese Verfahren sollen gemeinsam mit Antwortzeit und Qualität bewertet werden: Maßstab der Token-Ökonomie sind die Kosten je fachlich akzeptiertem Ergebnis, einschließlich Fehlversuchen und Nacharbeit.
- Hardware wählen wir nach Modell und Lastprofil: CPU als Hauptprozessor, GPU oder NPU als Beschleuniger sowie Arbeits- und Modellspeicher (RAM/VRAM). Speicherbandbreite, Netzwerk und Datenspeicher können den Durchsatz begrenzen. Lokaler, hybrider und Cloud-Betrieb sollen anhand von Auslastung, Datenanforderungen und Betriebsaufwand verglichen werden.
- Zur Kostenrechnung gehören Energie unter Last und im Leerlauf, Kühlung, Abschreibung, Integration, Dienste, Wartung, Sicherheitsprüfung und Wiederherstellung nach Störungen sowie menschliche Prüfung und Nacharbeit. Wir untersuchen, wie sich Verbrauch und gemeinsame Infrastruktur nachvollziehbar Abteilungen und Prozessen zuordnen lassen. Energie je Ergebnis braucht Messungen am konkreten System; eine Chip-Leistungsangabe reicht dafür nicht. Cloud-Verbrauch bleibt bei fehlenden Messdaten ausdrücklich eine Schätzung.
KI-Agenten absichern
Ein Agent darf eine Zeichnung prüfen, ohne dadurch Kundendaten versenden oder ein Angebot freigeben zu dürfen. Wir fragen, wie sich solche Grenzen technisch durchsetzen und im Fachprozess überprüfen lassen.
Offene Frage
Wie viel Autonomie ist für einen konkreten Prozess vertretbar, und welche nachweisbaren Kontrollen braucht sie?
Prüffragen und Vorgehen
- Minimale Zugriffsrechte, getrennte Identitäten und klar begrenzte Werkzeuge bilden die Grundlage. Berechtigungen werden im Zielsystem durchgesetzt; kritische Änderungen und Datenweitergaben brauchen eine überprüfbare Freigabe. Unsere Prüffrage: Halten diese Grenzen auch bei unvollständigen Aufträgen und bei der Delegation an weitere Agenten?
- Externe Dokumente, Webseiten und Werkzeugantworten können manipulierte Anweisungen enthalten: sogenannte Prompt Injection. Solche Inhalte dürfen keine zusätzlichen Befugnisse schaffen. Wir prüfen Datenwege, erlaubte Empfänger und die Herkunft eingebundener Werkzeuge und Skills. Zugangsschlüssel gehören in eine getrennte Verwaltung, nicht in den Modellkontext. Lokaler Betrieb allein gewährleistet keine Sicherheit.
- Geprüft werden sollen manipulierte Eingaben, unerlaubte Aktionsversuche und Abbruchfälle in isolierten, freigegebenen Testumgebungen. Wir wollen sowohl verhinderte Grenzüberschreitungen als auch fälschlich blockierte Arbeit und den Aufwand für menschliche Freigaben erfassen. Maßgeblich sind tatsächliche Aktionen im Zielsystem.
- Zum Betrieb gehören nachvollziehbare Protokolle ohne Zugangsschlüssel, die Erkennung ungewöhnlicher Aktionen und Verbrauchsmuster sowie ein geübter Weg zum Stoppen, Entziehen von Zugängen und Wiederherstellen. Zuständigkeiten und der Aufwand für diese Kontrollen fließen in die Kosten je akzeptiertem Ergebnis ein.
- Dario Amodeis Essay vom September 2026 und Anthropics Berichte geben Anlass zu diesen Fragen. Wir unterscheiden seine Zukunftseinschätzung, beobachteten Missbrauch und unerlaubte Agentenaktionen in fehlkonfigurierten Tests. Die Grenzen dieser Quellen stehen unten; sie ersetzen keine Prüfung unserer konkreten Anwendungen.
Der Prozess endet nicht an der Unternehmensgrenze.
Auf die Einarbeitung eigener Agenten kann ein zweiter Schritt folgen: Kunden- und Lieferantenagenten erhalten einen verständlichen Zugang zu Produktinformationen, Variantenregeln und Anfragewegen. Öffentliche Skills können dabei Orientierung geben. Datenzugriff und Vertretungsbefugnis werden separat geprüft und technisch begrenzt. Wir wollen untersuchen, wie daraus nachvollziehbare Übergaben mit Quelle, Version und menschlicher Freigabe entstehen.
- 01
Anfrage
Anforderung, Zeichnung, Quellen und Produktkontext werden strukturiert übergeben.
- 02
Prüfung
Der Empfänger prüft Auftrag, Produktregeln und fehlende Angaben; Agenten können unterstützen.
- 03
Rückfrage
Unklare Punkte gehen strukturiert an den Kunden zurück.
- 04
Freigabe
Menschen entscheiden über Preis, Termin und Ausnahmen.
- 05
Übergabe
Ergebnis, Quelle, Version und Verantwortung werden dokumentiert.
Dafür braucht es sechs klare Regeln.
Technische Verbindung allein reicht nicht. Jede Übergabe braucht einen festen Rahmen.
- 01
Identität
Wer handelt für welches Unternehmen?
- 02
Mandat
Was darf der Agent prüfen, ausführen oder zusagen?
- 03
Semantik
Welche Begriffe und Produktregeln gelten?
- 04
Daten
Welche Informationen dürfen die Firma verlassen?
- 05
Nachweis
Welche Quelle und Version stützt das Ergebnis?
- 06
Eskalation
Wann muss ein Mensch entscheiden?
Worauf wir uns beziehen.
Diese Primärquellen geben methodische und technische Orientierung. Herstellerbefunde und standardisierte Benchmarks ersetzen keine Prüfung im eigenen Unternehmensprozess. Quellenstand: 16. September 2026; Neon-Ergänzungen geprüft am 20. September 2026.
Anthropic · 29.09.2025
Effective context engineering for AI agentsBeschreibt den Übergang von einzelnen Prompts zur laufenden Auswahl relevanten Kontexts. Klare Anweisungen bleiben Teil dieser Arbeit.
Anthropic · Thariq Shihipar · 24.07.2026
The new rules of context engineering for Claude 5 generation modelsBerichtet über vereinfachte Anweisungen, bessere Schnittstellen und bedarfsgeladenen Kontext. Die Befunde betreffen bestimmte Claude-Modelle und interne Coding-Tests; sie sind keine allgemeine Regel zur Promptlänge.
Anthropic · Delba de Oliveira & Michael Segner · 30.06.2026
Loop engineering: Getting started with loopsOrdnet Arbeitszyklen nach Auslösern und Stoppbedingungen und verbindet Qualitätsprüfungen mit Tokenbudgets. Empfiehlt einfache Lösungen für einfache Aufgaben.
Anthropic · 09.01.2026
Demystifying evals for AI agentsMethodik für wiederholbare Agententests mit technischen, modellbasierten und menschlichen Bewertungen. Testfälle und Erfolgskriterien müssen zum Fachprozess passen.
Neon · 22.01.2026
Agent Skills in 2026Beschreibt Skills als Einstieg zu Arbeitsweisen und aktueller Dokumentation, ergänzt um authentifizierte MCP-Werkzeuge. Vorbild für unseren Ansatz; kein Nachweis seiner Wirkung in anderen Unternehmen.
Neon · 25.08.2026
Just landed in the Neon CLIZeigt die gemeinsame Einrichtung von Authentifizierung, MCP und Skills sowie deren Aktualisierung. Die konkrete Umsetzung betrifft Neon; betriebliche Fachaufgaben benötigen eigene Abnahmekriterien.
AMD · 16.03.2026
Efficient MoE Inference on Strix and HaloFallstudie zum Zusammenspiel von MoE, Quantisierung, CPU, NPU und Speicher. Modell- und plattformspezifische Ergebnisse; kein allgemeiner Hardwarevergleich oder Kaufurteil.
International Energy Agency (IEA) · 16.04.2026
Key Questions on Energy and AIOrdnet Strombedarf, Infrastruktur und die Entwicklung von KI ein. Globale Szenarien liefern keine Verbrauchszahl für eine einzelne Unternehmensanwendung.
MLCommons · Geprüft: 16.09.2026
MLPerf Inference: DatacenterVergleichbare Inferenztests für definierte Lasten. Die ausgewiesenen Energiemessungen gelten für das Gesamtsystem im jeweiligen Benchmark, nicht pauschal für andere Aufgaben.
Dario Amodei · September 2026
We Must Pace the FrontierPersönlicher Essay über Zukunftsrisiken und unabhängige Sicherheitsprüfung. Die Prognosen sind Amodeis Einschätzung; daraus folgt keine gemessene Eintrittswahrscheinlichkeit für Unternehmensanwendungen.
Anthropic · Threat Intelligence Team · 10.09.2026
Detecting and countering misuse of AI: September 2026Ausgewählte Missbrauchsfälle aus Dezember 2025 bis August 2026. Ein Bericht des Threat Intelligence Teams, kein persönlicher Bericht Amodeis und keine repräsentative Häufigkeitsmessung.
Anthropic · Paul C. Bogdan et al. · 09.09.2026 · korrigiert 10.09.2026
An alignment assessment of recent cybersecurity incidentsHerstelleranalyse von vier Vorfällen in fehlkonfigurierten Cyber-Tests mit Internetzugang und deaktivierten üblichen Cyber-Schutzmaßnahmen. Die Testbedingungen erlauben keine Ausfallquote für den normalen Unternehmensbetrieb.
OWASP GenAI Security Project · Ausgabe 2025 · geprüft 16.09.2026
LLM06:2025 Excessive AgencyBeschreibt Risiken durch zu weitreichende Werkzeuge, Rechte und Autonomie. Orientierung für technische Zugriffskontrollen und überprüfbare Freigaben, keine Zertifizierung eines Systems.