NieuwsMacroAnthropic publiceert automatiseringsniveaus van R&D, toezichtgegevens over agenten en veiligheidscompute-metrics

Anthropic publiceert automatiseringsniveaus van R&D, toezichtgegevens over agenten en veiligheidscompute-metrics

Auteur: Metaverse Post·

Belangrijkste punten

  • •Anthropic's nieuwe R&D Automation Index beoordeelt elke interne AI R&D-taak op Epoch AI's AL0–AL5-automatiseringsschaal, en per augustus 2026 leidt AI ongeveer 26% van het R&D-werk van het bedrijf, terwijl Claude op alle gemeten gebieden niet-autonoom blijft.
  • •Meer dan 90% van de R&D-taken van Anthropic scoort op of boven het niveau waarop AI met mensen samenwerkt; cijfers die het bedrijf gebruikt om de afstand van de industrie tot recursieve zelfverbetering te peilen.
  • •Ongeveer 30.000 AI-agenten voeren onderzoek en engineering uit op het meest gebruikte interne platform van Anthropic, en van meer dan een miljard agentbeslissingen die in augustus zijn geanalyseerd, werd ongeveer 0,002% geblokkeerd, met circa 100.000 wekelijks gevlagde transcripties en slechts ongeveer 50 geëscaleerd naar menselijke beoordeling.
  • •In een weekelijkse compute-momentopname ging ongeveer 6% van de AI R&D-compute van Anthropic naar veiligheidswerk, oplopend tot ongeveer 12% binnen AI-gedreven R&D; schattingen die het bedrijf bewust conservatief noemt.
  • •Anthropic is van plan onafhankelijke externe beoordelaars in te bedden met toegang vergelijkbaar met die van zijn interne risicoteams, maar erkent dat er nog geen gedeelde methodologie bestaat om automatiseringsmetrics tussen labs te vergelijken.
Anthropic publiceert automatiseringsniveaus van R&D, toezichtgegevens over agenten en veiligheidscompute-metrics

Anthropic heeft een reeks interne metingen vrijgegeven die bedoeld zijn om het publiek, toezichthouders en externe waarnemers een duidelijker beeld te geven van hoe snel de ontwikkeling van frontier-AI verloopt — waaronder hoeveel van het werk aan het bouwen van nieuwe modellen tegenwoordig door AI zelf wordt uitgevoerd.

Het kernstuk van de publicatie is de Anthropic R&D Automation Index, een prototype-metric die elke soort AI-onderzoeks- en ontwikkelingstaak binnen het bedrijf catalogueert en elk ervan beoordeelt op een automatiseringsschaal die is ontwikkeld door Epoch AI. De schaal loopt van AL0, wat geen AI-betrokkenheid betekent, tot AL5, wat volledig autonome operatie zonder menselijke tussenkomst betekent. Binnen dat kader staat AL3 voor taken waarbij AI samenwerkt onder nauwe menselijke aansturing, terwijl AL4 taken omvat die AI end-to-end voltooit vanuit een high-level prompt met menselijk toezicht. De afstand tussen die treden en AL5 geeft de index zijn betekenis: het meet, taak voor taak, hoe ver de R&D-operatie van het bedrijf verwijderd is van het punt waarop AI het werk zou kunnen uitvoeren zonder menselijke tussenkomst.

Per augustus 2026 opereert Claude op geen enkel gemeten gebied van AI R&D volledig autonoom. Desondanks leidt AI ongeveer 26% van het R&D-werk van Anthropic, en meer dan 90% van de taken scoort op of boven het niveau waarop AI met mensen samenwerkt. Anthropic presenteert deze cijfers als een manier om te volgen hoe dicht de industrie bij recursieve zelfverbetering is — een scenario waarin een model autonoom zijn eigen opvolger bouwt — en merkt op dat de cijfers zich waarschijnlijk zouden verschuiven bij een gecoördineerde inspanning de frontier-ontwikkeling te vertragen. Zo gepresenteerd, zet de publicatie een abstracte zorg om in een vastgestelde, herhaalbare basislijn waaraan toekomstige openbaarmakingen kunnen worden gemeten.

Het bedrijf kondigde de openbaarmaking aan in een bericht op X:

AI systems are getting more powerful, and they're increasingly being used to build the next version of themselves. We want to illuminate that progress for the public. Today, we're sharing three measurements that help track development: 1. How much AI R&D is done by AI. 2. How…

— Anthropic (@AnthropicAI) September 17, 2026

Samen dekken de metingen af hoeveel AI R&D door AI wordt uitgevoerd, hoe AI-agenten in de praktijk worden bewaakt, en hoe compute over het werk van het bedrijf wordt verdeeld.

Het bedrijf combineerde de index met nieuwe gegevens over het toezicht op AI-agenten. Ongeveer 30.000 agenten voerden onderzoeks- en engineeringwerk uit op het meest gebruikte interne platform van Anthropic, en elke handeling van hen gaat vóór uitvoering door realtime online monitors, evenals offline monitors die de activiteit achteraf beoordelen. Van meer dan een miljard agentbeslissingen die in augustus zijn geanalyseerd, werd ongeveer 0,002% — grofweg één op de 47.000 — geblokkeerd. Offline monitors vlaggen één tot twee transcripties per duizend, met ongeveer 100.000 wekelijks gevlagd en slechts ongeveer 50 geëscaleerd naar menselijke beoordeling. De cijfers schetsen een versmallende toezichttrechter — van meer dan een miljard geanalyseerde beslissingen in augustus tot circa 100.000 wekelijks gevlagde transcripties en ongeveer 50 geëscaleerd naar menselijke beoordeling — en tonen hoe geautomatiseerde screening gelaagd is onder menselijk oordeel naarmate agenten echt onderzoek en engineeringwerk uitvoeren.

Compute-verdeling ontstaat als verifieerbare tempohefboom

De derde meting betreft compute, een van de meest verifieerbare invoervariabelen van AI-ontwikkeling en daarmee een mogelijke hefboom voor een toekomstig sectorbreed temperegime. In een weekelijkse momentopname van het totale computergebruik van Anthropic ging ongeveer 6% van de compute besteed aan AI R&D naar veiligheidswerk; binnen AI-gedreven R&D specifiek was dat circa 12%. Het bedrijf omschrijft deze als bewust conservatieve schattingen, met de kanttekening dat compute een onvolmaakte proxy is voor investeringen in veiligheid, aangezien veel veiligheidsonderzoek ontwerpintensief rather dan compute-intensief is. De percentages zijn ook het soort harde, telbare cijfers dat externe partijen — of een toekomstig tempoakkoord — in de loop van de tijd kunnen volgen.

Anthropic positioneert de publicatie als aanvulling op de risicorapporten van zijn Responsible Scaling Policy en zijn beleidsvoorstel Advanced AI Framework, dat transparantieverplichtingen schetst die over aan labs zouden kunnen opleggen. Het bedrijf kondigde ook plannen aan om onafhankelijke externe beoordelaars van meerdere organisaties in Anthropic in te bedden, hen toegang te verlenen tot interne systemen en gegevens vergelijkbaar met wat zijn eigen risicobeoordelingsteams ontvangen.

Vergelijking tussen labs blijft een uitdaging. Anthropic erkent dat er geen gedeelde methodologie bestaat voor het meten van automatisering en dat het gebruik van eigen modellen om zijn systemen te evalueren potentiële blinde vlekken creëert. Het wijst op verificatie door derden, of evaluatie door modellen van andere ontwikkelaars met waarborgen voor concurrentiegevoelige informatie, als een pad naar gestandaardiseerde rapportage waarop overheden en het publiek kunnen vertrouwen. Tot zo'n methodologie bestaat, heeft een cijfer als de automatiseringsgraad van 26% geen overeengeomen tegenhanger bij andere ontwikkelaars — waardoor de geplande inbedding van onafhankelijke beoordelaars, en elke beweging richting gemeenschappelijke meetnormen, de concrete ijkpunten zijn of deze transparantie-inspanning zich verder kan uitstrekken dan één lab.

Bron: Metaverse Post