Microsoft-paper onthult goedkope skill-distillatie waarmee GPT-5.4-mini zijn eigen reasoning-modus verslaat
Belangrijkste punten
- •Microsofts paper van 11 augustus toont een skill-distillatiemethode waarmee GPT-5.4-mini zijn duurdere reasoning-modus kan evenaren of overtreffen voor 1 tot 3 dollar per domein, zonder hertraining.
- •De aanpak genereert markdown-skill-documenten van 40 tot 130 regels uit 35 tot 50 taaktrajecten, die geïnspecteerd, bewerkt en versiebeheerd kunnen worden zoals gewone prompt-assets.
- •Op de ALFWorld-benchmark scoorde de met skills versterkte GPT-5.4-mini 0,787 tegenover 0,713 voor de volledige reasoning-modus, terwijl het over de benchmarks 2,7 tot 6 keer minder output-tokens gebruikte.
- •De paper bouwt voort op Microsofts in juni verschenen SkillOpt-framework, dat een gemiddelde winst van 23,5 punten liet zien voor GPT-5.5 over zes benchmarks.
- •Er blijven open vragen over hoe duurzaam gedestilleerde skills zijn naarmate onderliggende modellen worden bijgewerkt en of de methode generaliseert buiten de geteste agentische domeinen.

Microsoft-onderzoekers hebben een manier gevonden om een goedkoper AI-model zijn eigen dure reasoning-modus te laten overtreffen, en dat trucje kost ongeveer evenveel als een cappuccino.
Een paper die op 11 augustus werd gepubliceerd onder de titel “Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills,” introduceert een passieve skill-distillatiemethode die compacte regelsets destilleert uit een klein aantal taakvoorbeelden. Die regels, geschreven in gewone markdown, worden in de systeemprompt van een model geïnjecteerd en leren het effectief shortcuts aan die de noodzaak van kostbare chain-of-thought-redenering omzeilen. Het doormodel is in dit geval GPT-5.4-mini, dat in maart verscheen.
Het resultaat is meer dan één benchmarkwinst. Reasoning-modi drijven de inferentiekosten op omdat ze vóór het antwoord lange ketens van tussenliggende tokens genereren, en token-output is op schaal een van de belangrijkste kostenfactoren voor AI-aanbieders. Output-tokens met een factor verminderen—terwijl de nauwkeurigheid behouden blijft of verbetert—verandert direct de economie van het draaien van agentische workloads in productie, waar dezelfde taak duizenden of miljoenen keren kan worden uitgevoerd.
Hoe het werkt
Het proces is verrassend eenvoudig. Een coding-agent bestudeert 35 tot 50 taaktrajecten, in wezen opnames van hoe een model specifieke taken aanpakte—and soms mislukte. Uit die trajecten destilleert de agent een natuurlijk-talig “skill”-document van 40 tot 130 regels markdown. Dit zijn geen abstracte embeddings of aangepaste modelgewichten via fine-tuning. Het zijn leesbare, controleerbare regels afgeleid van wat er mis en wat er goed ging.
Die leesbaarheid is een wezenlijke breuk met de twee dominante manieren waarop domeinkennis doorgaans in modellen wordt ingebouwd: fine-tuning, dat trainingsruns en gespecialiseerde hardware vereist, en ondoorzichtige retrieval- of op embeddings gebaseerde benaderingen. Omdat de gedestilleerde kennis in platte tekst staat, kunnen ontwikkelaars een skill-document inspecteren, bewerken en versiebeheeren zoals elk ander prompt-asset—zonder MLOps-pijplijn.
Zodra dat skill-document wordt opgenomen in de systeemprompt van een niet-reasoning-model, gebeurt er iets opmerkelijks. Het model herwint 55% tot ruim 100% van het prestatieverschil dat reasoning- en niet-reasoning-modi normaal gesproden scheidt. Eenvoudiger gezegd: de goedkope modus begint te presteren als de dure modus—en soms beter.
De rekenkosten voor het genereren van het skill-document per domein bedragen 1 tot 3 dollar, zonder dat het model opnieuw hoeft te worden getraind.
Benchmarkresultaten
Het onderzoeksteam, onder leiding van Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi en Sumit Gulwani, evalueerde de aanpak op vier agentische benchmarks, waaronder ALFWorld en SpreadsheetBench-Verified.
Op ALFWorld behaalde de met skills versterkte GPT-5.4-mini een score van 0,787, terwijl de volledige reasoning-modus op 0,713 uitkwam. De goedkopere, snellere versie sloot de kloof niet alleen—ze overtrof die.
Over de benchmarks heen gebruikte het met skills uitgebreide model 2,7 tot 6 keer minder output-tokens dan de reasoning-modus. Minder tokens betekent ook snellere antwoorden, een praktisch voordeel voor interactieve agents waar latentie de gebruikerservaring bepaalt.
Voortbouwend op SkillOpt
De paper bouwt rechtstreeks voort op Microsofts SkillOpt-framework, dat in juni verscheen en agent-vaardigheden herformuleerde als trainbare parameters in plaats van statische modelgewichten. SkillOpt toonde een gemiddelde winst van 23,5 punten voor GPT-5.5 over zes benchmarks, waarmee de theoretische basis werd gelegd dat vaardigheden onafhankelijk van het onderliggende model kunnen worden geoptimaliseerd.
De nieuwe distillatiemethode maakt dat concept radicaal toegankelijker. Omdat skill-documenten gewoon markdown-bestanden zijn die via systeemprompts worden geïnjecteerd, werken ze met bestaande rollout-strategieën—geen aangepaste inferentie-infrastructuur, geen gespecialiseerde hardware en geen hertrainingsruns nodig.
Voor praktijkmensen blijven de open vragen hoe duurzaam gedestilleerde skills zijn naarmate onderliggende modellen worden bijgewerkt, en hoe de aanpak generaliseert buiten de geteste agentische domeinen—vragen die de benchmarkresultaten alleen nog niet beantwoorden.