Anthropic baut sein Cyber Verification Program (CVP) aus. Sicherheitsforscher und Organisationen können darüber künftig je nach Zugriffsstufe Fähigkeiten von Claude nutzen, die bei den allgemein verfügbaren Modellen stärker eingeschränkt sind.
Bisher gab es dafür zwei getrennte Programme. Über Project Glasswing erhielten ausgewählte Organisationen Zugriff auf Claude Mythos, eine nur eingeschränkt verfügbare Modellvariante mit erweiterten Cyberfähigkeiten. Über das CVP konnten verifizierte Sicherheitsteams Claude Opus und Sonnet mit weniger restriktiven Cyberfiltern einsetzen, allerdings gab es nur eine Zugriffsstufe. Nun führt Anthropic beide Ansätze in einem erweiterten CVP zusammen und teilt den Zugang in drei Stufen. Alle drei umfassen Claude Opus 5.5, Sonnet 5.5 und Mythos 5.1 sowie künftig weitere Modelle. Bestehende Glasswing-Teilnehmer wechseln in die höchste Stufe.
Anthropic reagiert damit auf das Dual-Use-Problem von Cyber-KI: Dieselben Fähigkeiten können Schwachstellen finden und absichern, aber auch für Angriffe missbraucht werden. Deshalb koppelt das Unternehmen den Zugriff stärker an Verifikation und Umfang der Cyberarbeit.
Die drei Stufen im Überblick
Die niedrigste Stufe heißt "Defense Access" und richtet sich an defensive Aufgaben wie den Umgang mit Sicherheitsvorfällen, Malwareanalyse, Reverse Engineering oder die Analyse und Validierung von Schwachstellen. Neben Organisationen können sich hier auch einzelne Sicherheitsforscher bewerben, sofern sie bereits nachweislich Schwachstellen gemeldet haben.
Die mittlere Stufe "Red Team Access" erlaubt zusätzlich autorisierte Penetrationstests und Red-Teaming und steht nur Organisationen offen. Die höchste Stufe "Specialized Access" ist für besonders sensible Tests gedacht, etwa an Stromnetzen, Flugbetriebssystemen, Telekommunikationsnetzen oder der Infrastruktur für Interbanken-Überweisungen. Bewerber prüft Anthropic nach eigenen Angaben gemeinsam mit der US-Regierung. Je höher die Stufe, desto riskantere Aufgaben sind erlaubt und desto strenger fallen die Zugangsvoraussetzungen aus.
Wie unterschiedlich die Cyberfilter eingreifen, zeigt Anthropic mit Claude Opus 5.5 auf CyScenarioBench, einem Benchmark für mehrstufige offensive Cyberoperationen. Ohne CVP wurden alle 50 Versuche schon beim ersten Prompt blockiert. Bei Defense Access griff der Filter in 46 von 50 Durchläufen ein, bei Red Team Access wurde keiner der 50 Versuche blockiert. Anthropics Nutzungsregeln gelten trotzdem weiter vollständig: Auch bei Red Team Access sollen Echtzeitfilter unter anderem den Einsatz von Ransomware und Handlungen mit möglichem physischem Schaden blockieren.
Project Glasswing: Über 130.000 verifizierte Schwachstellen
Parallel zur Neuordnung nennt Anthropic neue Ergebnisse aus Project Glasswing. Partner hätten zwischen April und Juli mindestens 129.000 verifizierte Softwareschwachstellen gefunden, weitere 5.500 seien zwischen April und Oktober bei eigenen Scans von Open-Source-Software hinzugekommen. Mehr als 33.000 davon gelten als kritisch oder hoch. Die Partnerzahlen beruhen auf unvollständigen Daten aus 33 Partnerberichten, Anthropic versteht die Ergebnisse deshalb als Untergrenze.