Anthropic hat offiziell eine Zusammenarbeit mit Accenture angekündigt, um unabhängige Bewertungen an der Spitze der künstlichen Intelligenz durchzuführen. Dies ist ein wichtiger Schritt zur Erfüllung des Versprechens des CEO in seinem Artikel „Wir müssen mit der Spitze Schritt halten“, das darauf abzielt, Bewerter in das Unternehmen Anthropic zu integrieren.
Die Zusammenarbeit wird von Accentures spezialisiertem AI-Team geleitet
Diese Zusammenarbeit wird von Accentures spezialisiertem AI-Geschäft Faculty geleitet und umfasst die Bewertung von Modellen und Red-Teaming-Tests, die Durchführung von Alignments-Bewertungen sowie die Prüfung der Sicherheit der Modelle. Accenture hilft Unternehmen und Regierungen in verschiedenen Branchen bei der Implementierung von künstlicher Intelligenz. Ihr Verständnis dafür, wie Unternehmen AI tatsächlich nutzen, wird ihren Ansatz zur Sicherheitsbewertung unterstützen und diese Perspektive in die Bewertung der Anthropic-Modelle einbringen.
Beide Seiten planen, in den nächsten fünf Jahren mindestens 1 Milliarde US-Dollar zu investieren
Anthropic und Accenture erwarten, in den nächsten fünf Jahren in diesem Bereich mindestens 1 Milliarde US-Dollar zu investieren. Embedded Assessments sind ein neues Konzept, und viele Details sind noch in der Ausarbeitung. Im Gegensatz zu aktuellen externen Bewertern werden Embedded Assessors intern im AI-Unternehmen arbeiten und vergleichbare Zugriffsrechte wie die Mitarbeiter haben. Dieser Zugang ermöglicht es ihnen, den Entstehungsprozess der Modelle während des Trainings zu beobachten, den Entscheidungsprozess nachzuvollziehen und direkt mit den Mitarbeitern zu kommunizieren. Aus dieser Perspektive können Embedded Assessors die Abläufe im Unternehmen bewerten, überprüfen, ob Sicherheitsversprechen eingehalten werden, und blinde Flecken identifizieren.
„Unabhängige Embedded Assessors verringern nicht unsere Verantwortung, sondern helfen, sie verifizierbarer zu machen. Die Sicherheit unserer Modelle bleibt unsere Verantwortung.“
Anthropic
Zukünftig wird ein Bewertungsökosystem mit gemeinsamen Standards aufgebaut
Derzeit gibt es keine Standards, die festlegen, welche Informationen Embedded Assessors erhalten sollten oder wie sie ihre Erkenntnisse berichten. Langfristig glaubt Anthropic, dass die Finanzierung aus zentralen oder staatlichen Ressourcen kommen sollte, wie wir in unserem „Advanced AI Framework“ im Juni gefordert haben. Da derzeit beide nicht vorhanden sind, plant Anthropic, mit verschiedenen Bewertern unter unterschiedlichen Finanzierungsvereinbarungen zusammenzuarbeiten.
Angesichts der Bedeutung und Dringlichkeit dieser Arbeit wird Anthropic die Arbeit von Accenture direkt finanzieren. Wir führen auch Gespräche mit METR und anderen gemeinnützigen Bewertern, um Teile der Embedded Assessment-Elemente mit ihren eigenen Mitteln zu pilotieren. Letztendlich glauben wir, dass an der Spitze der künstlichen Intelligenz ein Bewertungsökosystem benötigt wird, das auf gemeinsamen Standards basiert.
Darüber hinaus erwartet Anthropic, dass die Frontier Labs gleichzeitig mit mehreren Organisationen zusammenarbeiten werden. Unsere Partnerschaften sind nicht exklusiv; Anthropic wird mit anderen Bewertern zusammenarbeiten und in den kommenden Wochen weitere Partner bekannt geben, während Accenture auch in ähnlicher Weise mit anderen AI-Entwicklern kooperieren wird.
Wir werden weiterhin an der Ausbildung und Veröffentlichung von fortschrittlichen Modellen arbeiten und hoffen, dass unabhängige Bewerter Seite an Seite mit uns arbeiten können. Wir teilen diese frühen Bemühungen, damit Menschen und andere AI-Entwickler unseren Prozess verstehen können. Wir erwarten, dass sich unser Ansatz mit der Reifung dieses Bereichs weiterentwickeln wird, und werden mehr Informationen teilen, wenn die Arbeit beginnt und weitere Bewerter hinzugezogen werden.
Einführung des Lebenswissenschafts-Bewertungsprogramms
Das Lebenswissenschafts-Bewertungsprogramm (LSVP) bietet Fachleuten der Lebenswissenschaften Zugang zu den Modellen Claude Mythos, Opus und Sonnet und hat lockerere Sicherheitsmaßnahmen für biowissenschaftliche Arbeiten eingerichtet.
Während wir gemeinsam mit unseren Kunden an der Entwicklung fortschrittlicher Sicherheitsmaßnahmen arbeiten, verbessern wir auch unsere Ausrichtung und Sicherheitsarbeit. Am 30. Juli berichteten wir über drei Vorfälle, bei denen das Claude-Modell unbefugten Zugriff auf tatsächliche Computersysteme hatte. Wir führen eine eingehende Analyse dieser Vorfälle durch und planen eine unabhängige Überprüfung in Zusammenarbeit mit METR. In der Zwischenzeit werden wir einige der Änderungen teilen, die wir im vergangenen Monat vorgenommen haben.
Originalartikel auf techritual.com lesen (traditionelles Chinesisch) →
The TechRitual editorial desk in Hong Kong. Articles on TechRitual World are translated from the Traditional Chinese originals on techritual.com.

