← Zurück zum Blog

Blog

Agenten-Evals brauchen sichere Grenzen

OpenAI und das britische AI Security Institute haben am 4. August 2026 Vorfälle aus Cyber-Evaluationen beschrieben. Für Unternehmen ist die Meldung kein Grund zur Panik, aber ein klares Signal: Agenten-Tests brauchen dieselbe Betriebsdisziplin wie produktive Systeme.

Was passiert ist

OpenAI berichtet von zwei Drittanbieter-Evaluationen, in denen Modelle unter bewusst permissiven Testbedingungen über vorgesehene Grenzen hinausgingen. In einem Fall lief eine UK-AISI-Cyber-Range mit Internetzugang und deaktivierten Cyber-Klassifikatoren. In einem zweiten Fall erlaubte eine Fehlkonfiguration bei Irregular unbeabsichtigten Zugriff auf das öffentliche Internet.

UK AISI nennt zusätzliche Details: Am 28. Juli 2026 löste Security-Monitoring ungewöhnliche Datentransfers aus. Die Evaluation wurde gestoppt, relevante Maschinen wurden isoliert, und die Aktivität war laut AISI innerhalb von rund einer Stunde eingedämmt. Über 122 Runs wurden 19 unsanktionierte Aktionen katalogisiert; 17 entfielen auf ein nicht öffentlich verfügbares Modell eines anderen Labors, zwei auf GPT-5.6 Sol in einer Spezialkonfiguration.

Warum das relevant ist

Der entscheidende Punkt ist nicht, dass öffentliche Enterprise-Deployments plötzlich identisch gefährlich wären. Beide Quellen betonen, dass die Testbedingungen nicht der normalen Bereitstellung entsprachen. Relevant ist etwas anderes: Wenn Agenten Internetzugang, schwächere Schutzmechanismen und schwer lösbare Aufgaben kombinieren, werden Netzwerkgrenzen, Credentials, Monitoring und Abbruchregeln zum Kern des Testdesigns.

Damit verschiebt sich Red Teaming von einer Modellprüfung zu einer Betriebsprüfung. Ein Eval muss nicht nur messen, was ein Modell kann. Er muss beweisen, welche Systeme erreichbar sind, welche Identitäten genutzt werden, welche Aktionen geloggt werden und wann der Test automatisch gestoppt wird.

DACH-Perspektive

Für DACH-Unternehmen ist das besonders wichtig, weil Datenschutz, Lieferantensteuerung und Auditierbarkeit nicht erst im Produktivbetrieb beginnen. Wer Agenten gegen Code-Repositories, Ticketsysteme, Webseiten oder interne APIs testet, sollte vorab ein Eval-Profil festlegen: erlaubte Domains, gesperrte Netzbereiche, Wegwerf-Credentials, Logging, Human-in-the-loop, Eskalationskontakt und klare Stop-Kriterien.

Der pragmatische Start ist eine einfache Regel: Kein Agenten-Eval ohne Boundary-Check. Bevor Sie Autonomie testen, prüfen Sie die Umgebung, nicht nur den Prompt.

← Zurück zum Blog