NieuwsAandelenMicrosoft lanceert eigen AI-modellen en meldt GPU-kostenbesparingen tot 89% ten opzichte van OpenAI

Microsoft lanceert eigen AI-modellen en meldt GPU-kostenbesparingen tot 89% ten opzichte van OpenAI

Auteur: VentureBeat AI·

Belangrijkste punten

  • Microsoft AI heeft MAI-Image-2.5-Pro en MAI-Voice-2-Flash in public preview geïntroduceerd, gericht op tegengestelde uiteinden van de kwaliteits-snelheids-kostencurve voor respectievelijk premium beeldgeneratie en grootschalige spraaktoepassingen.
  • Interne implementatiemetrics laten zien dat Microsofts eigen modellen de GPU-kosten met maximaal 84% verlagen in PowerPoint vergeleken met OpenAI's GPT-Image-2 en met maximaal 89% in Dynamics 365 Contact Center.
  • Microsofts MAI-Code-1-Flash, verder getraind binnen een Excel-omgeving voor reinforcement learning, evenaart naar verluidt GPT-5.6 bij veelvoorkomende spreadsheettaken terwijl het draait op oudere Nvidia H100- en A100-GPU's.
  • CEO Satya Nadella stelde dat Microsoft begint met het routeren van verkeer in eigen producten naar zijn MAI-modellen wanneer die frontier-alternatieven evenaren of overtreffen, terwijl OpenAI- en Anthropic-modellen componenten blijven binnen het orkestratiesysteem.
  • Microsoft verpakt zijn interne methode voor modeloptimalisatie, hill-climbing genoemd, als commercieel product via Azure Foundry en Frontier Tuning, zodat zakelijke klanten gespecialiseerde modellen kunnen trainen op basis van hun eigen evaluaties.
Microsoft lanceert eigen AI-modellen en meldt GPU-kostenbesparingen tot 89% ten opzichte van OpenAI

Microsoft AI heeft woensdag twee nieuwe eigen modellen in public preview geïntroduceerd — MAI-Image-2.5-Pro, zijn beeldgenerator met de hoogste getrouwheid tot nu toe, en MAI-Voice-2-Flash, een spraakmodel dat is ontwikkeld voor grootschalige enterprise-workloads. Naast de lanceringen publiceerde het bedrijf productiedata over implementaties, waarmee het tot nu toe zijn krachtigste argument neerzet dat het zijn eigen producten kan aandrijven zonder afhankelijk te zijn van de frontier-modellen van OpenAI.

De aankondiging, afkomstig van het Superintelligence-team van Microsoft AI, komt ongeveer een jaar nadat het bedrijf zich eraan committeerde om intern doelgerichte modellen te bouwen. Ze bevat een ongebruikelijk concreet overzicht van waar die modellen inmiddels draaien: Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot en Azure. De boodschap aan zakelijke kopers — en impliciet aan OpenAI — is dat Microsofts zelfontwikkelde modellen de onderzoeksfase voorbij zijn en inmiddels productie-infrastructuur vormen voor miljoenen gebruikers.

"Each of these enhancements is a step toward the same goal: Microsoft products, powered by Microsoft models," stelde het bedrijf in zijn aankondigingsblog.

MAI-Image-2.5-Pro en MAI-Voice-2-Flash richten zich op tegengestelde uiteinden van de kostencurve

De twee nieuwe releases nemen bewust tegengestelde posities in op wat Microsoft de kwaliteits-snelheids-kostencurve noemt.

MAI-Image-2.5-Pro richt zich op het premiumsegment — hero-afbeeldingen, gedetailleerde bewerking en nauwkeurige tekstweergave binnen afbeeldingen, al lange tijd een bekend zwak punt van beeldgeneratiemodellen. Microsoft prijst het model op $5 per miljoen tekstinvoertokens, $8 per miljoen beeldinvoertokens en $106 per miljoen beelduitvoertokens. Het basismodel MAI-Image-2.5 stond recent op No. 2 voor beeldbewerking op Arena, het community-klassement dat is uitgegroeid tot een de facto scorebord voor generatieve media.

De creatieve sector lijkt dit op te merken. Rob Reilly, global chief creative officer bij reclamegigant WPP, noemde het Pro-model "a strong leap forward for GenMedia tools" in een verklaring die in Microsofts aankondiging was opgenomen, en voegde daaraan toe dat "Microsoft has firmly established itself among the leaders in generative AI."

MAI-Voice-2-Flash beweegt juist de andere kant op. Flash, voor het eerst getoond tijdens Microsofts Build-conferentie, draait twee keer zo snel als MAI-Voice-2 en kost 32% minder, met een prijs van $15 per miljoen tekens. Het is ontworpen voor de grote maar minder zichtbare markt van spraaktoepassingen met hoge volumes — callcenters, spraakagenten en realtime spraaksystemen waar latency en kosten per gesprek zwaarder wegen dan marginale winst in expressiviteit. Samen weerspiegelen de twee releases een strategie om modelfamilies te bouwen in plaats van één vlaggenschipmodel, omdat, zoals het bedrijf opmerkte, een creatieve studio die maximale getrouwheid nastreeft fundamenteel andere eisen heeft dan een klantenserviceorganisatie die dagelijks miljoenen gesprekken afhandelt.

Productiemetrics laten zien dat eigen modellen GPU-kosten tot 89% verlagen

De implementatiemetrics die Microsoft naast de modellanceringen publiceerde, lezen als een systematisch pleidooi om frontier-modellen van derde partijen in zijn productportfolio te vervangen.

Bing Image Creator draait nu van begin tot eind volledig op MAI-Image-2.5, de eerste keer dat de consumentenbeeldtool volledig door eigen technologie wordt aangedreven. In PowerPoint meldt Microsoft dat MAI-Image-2.5 de GPU-kosten met maximaal 84% verlaagt vergeleken met GPT-Image-2, het beeldmodel van OpenAI. In OneDrive, waar MAI-Image-2.5 nu de standaard is voor belangrijke scenario's voor beeldbewerking, meldt het bedrijf een stijging van 26% in opslagpercentages, ongeveer 25% lagere P95-latency en 2,5 keer hogere efficiëntie bij productieworkloads met gemiddelde benutting.

Aan de spraakkant drijft MAI-Voice-2-Flash nu Dynamics 365 Contact Center aan — gebruikt door klanten waaronder T-Mobile en EasyJet — waar Microsoft GPU-kostenverlagingen tot 89% claimt. Het model is ook geïntegreerd in Azure Voice Live voor ontwikkelaars die speech-to-speech-agenten bouwen.

Een bijzonder belangrijke implementatie bevindt zich in de zorg. Microsofts Dragon Copilot, gebruikt door 170.000 medische zorgverleners en verantwoordelijk voor de verwerking van 28 miljoen patiëntcontacten in het afgelopen kwartaal, draait nu op MAI-Transcribe-1.5 voor zijn meertalige workflow in 58 talen. Microsoft zegt dat interne evaluaties een relatieve vermindering van 50% laten zien in zowel transcriptie- als taalidentificatiefouten in de meeste talen — een belangrijke claim, aangezien transcriptiefouten in dit domein rechtstreeks in klinische notities kunnen doorwerken.

De 'hill-climbing'-strategie achter kleine modellen die GPT-5.6 in Excel evenaren

In een begeleidend bericht dat dezelfde dag werd gepubliceerd, lichtte Microsoft de methode achter deze resultaten toe — wat het bedrijf zijn "hill-climbing machine" noemt, een geïntegreerd vliegwiel van data, modellen en de product-"harness" daaromheen.

Het duidelijkste voorbeeld is MAI-Code-1-Flash, het lichte codeermodel dat in juni in GitHub Copilot werd gelanceerd. Microsoft zegt dat het model in VS Code ongeveer 10% hogere code-acceptatiepercentages behaalt dan GPT-5.4 Mini en Claude Haiku 4.5, terwijl het 10% minder mediane tokens gebruikt. Ontwikkelaarsretentie laat een vergelijkbaar patroon zien: gebruikers keerden over meerdere dagen 6% vaker terug dan met GPT-5.4 Mini en 11% vaker dan met Claude Haiku 4.5.

Microsoft nam vervolgens het checkpoint van MAI-Code-1-Flash en trainde het verder binnen een Excel-omgeving voor reinforcement learning, waarbij een codeermodel de tools en workflows van spreadsheet-kenniswerk werd aangeleerd. Het resultaat is volgens feedback van productiegebruikers een model dat voor de meest voorkomende Excel-taken op gelijke hoogte staat met GPT-5.6 — terwijl het klein genoeg is om te draaien op Nvidia's oudere H100- en zelfs A100-GPU's, in plaats van de nieuwste generatie accelerators te vereisen.

Dat hardwaredetail is relevant. Nu elk groot AI-bedrijf concurreert om toewijzingen van geavanceerde chips, verandert een model dat frontier-achtige kwaliteit levert op silicium van twee generaties oud de implementatie-economie fundamenteel. Het maakt ook de nieuwste hardware vrij — waaronder Microsofts inmiddels operationele GB200-cluster — voor training in plaats van inference-serving.

Satya Nadella's 'Frontier Diffusion'-manifest hertekent de relatie met OpenAI

Microsoft-CEO Satya Nadella plaatste de aankondigingen in een lange post op X met de titel "Frontier Diffusion & Control," die leest als een strategisch manifest. "We can now take saturated frontier capabilities and deliver them at scale and at lower cost through models optimized for high-usage products, while continuing to use frontier models for frontier needs," schreef Nadella, en voegde toe dat Microsoft "beginning to route traffic across our first-party surfaces to MAI whenever our models match or outperform frontier alternatives."

Nadella merkte zorgvuldig op dat "frontier models from OpenAI and Anthropic are part of the orchestration system alongside MAI," maar formuleerde ook een principe van modelonafhankelijkheid, door te stellen dat de evaluaties van een bedrijf "should continue to hill climb even when any given model has been removed." Door de harness, het geheugen, de context en de vaardigheden buiten het model te houden, zo betoogde hij, behoudt Microsoft controle.

De bredere context is belangrijk. Reuters meldde in april dat Microsofts exclusieve licentie op de technologie van OpenAI was omgezet in een niet-exclusieve regeling. The Information meldde afgelopen september dat Microsoft was begonnen Anthropic-modellen in sommige producten te verwerken. De aankondiging van woensdag maakt de driehoek compleet: Microsoft positioneert zichzelf als orkestrator, met frontier-modellen van partners als uitwisselbare componenten en eigen modellen die een steeds groter deel van het routinematige verkeer opnemen.

Microsofts stap weerspiegelt een breder patroon onder hyperscalers. Google vervangt AI van derde partijen geleidelijk door zijn eigen Gemini-familie in Workspace en Search, terwijl Amazon heeft geïnvesteerd in zijn Nova- en Titan-modellijnen voor AWS. De convergentie weerspiegelt het besef dat cloudproviders die ooit concurreerden om toegang tot de beste externe modellen te bieden, steeds meer inzetten op eigen modellen die nauw met hun infrastructuur zijn geïntegreerd om te bepalen wie de zakelijke AI-markt verovert.

Reacties van ontwikkelaars: enthousiasme en scepsis

De online reactie weerspiegelde zowel de aantrekkingskracht als de twijfels rond de strategie.

"I love when people use small models for niche tasks," schreef X-gebruiker @mavihsk in reactie op Nadella's post. "Why do I have to use the all-knowing model just to change my field in Excel?" Een andere gebruiker, @nabu_lines, vatte de pitch samen: "cost and performance both improve when you stop overusing the biggest model."

Anderen waren kritischer. "Microsoft is the worst when it comes to listening to user feedback," schreef ontwerper @designedbyabin, waarbij hij stelde dat het bedrijf "will lose the AI race because they repeatedly failed to understand user needs." Gebruiker @tokenoverflow gaf een drogere kritiek op de pitch rond modelonafhankelijkheid: "i want it keep hill climbing after removing microsoft."

De sceptici hebben een geldig punt: Microsofts zelfgerapporteerde metrics — acceptatiepercentages, opslagpercentages, GPU-besparingen — komen uit interne evaluaties en niet uit onafhankelijke benchmarks, en het bedrijf kiest zelf welke vergelijkingen het publiceert. Het ontbreken van externe validatie is een aandachtspunt, aangezien onafhankelijke evaluaties van organisaties als MLCommons of communitygedreven platforms als Arena de meeste MAI-modellen nog niet rechtstreeks hebben beoordeeld tegenover frontier-alternatieven onder productie-equivalente omstandigheden. Toch hangt de onderliggende logica van de strategie niet af van één enkel cijfer. Nadella's observatie dat software nu "real marginal cost for the first time" heeft, verklaart waarom Microsoft zich richt op tokens, GPU's en serving-kosten: wanneer AI-functies bij elke toetsaanslag draaien in een productportfolio met een miljard gebruikers, is een GPU-kostenreductie van 84% niet slechts een optimalisatie — het is het verschil tussen een levensvatbaar bedrijf en een geldput.

Microsoft maakt van zijn interne AI-draaiboek een Azure-product

Het laatste element van de strategie is dat Microsoft niet alleen de modellen verkoopt, maar het draaiboek zelf. Nadella positioneerde de hill-climbing-aanpak expliciet als "a template for every other AI native, SaaS, or Enterprise company." Microsoft verpakt de toolchain via Foundry en wat het Frontier Tuning noemt, waarmee ondernemingen gespecialiseerde modellen kunnen trainen op basis van hun eigen evaluaties en reinforcement learning-omgevingen. Daarmee verandert Microsoft zijn interne kostenbesparingsoefening in een Azure-product en geeft het zakelijke klanten een reden om hun AI-workloads op Microsofts cloud te draaien, zelfs als de onderliggende modellen uit andere bronnen komen.

De nadruk van het bedrijf op modellen die zijn getraind "on clean, traceable, enterprise-grade data, without distillation from third-party models" dient hetzelfde commerciële doel. In een sector die steeds meer onder toezicht staat vanwege de herkomst van trainingsdata — waaronder FTC-onderzoeken naar AI-partnerschappen en lopende auteursrechtzaken tegen meerdere modelontwikkelaars — gokt Microsoft erop dat zakelijke kopers, en rechtbanken, belang zullen hechten aan waar modelcapaciteiten vandaan komen.

Microsoft zegt dat het de hill-climbing-aanpak nu uitbreidt naar Copilot Chat, Outlook en PowerPoint. Beide nieuwe modellen zijn beschikbaar in public preview via Microsoft Foundry en de MAI Playground.

"None of this is an endpoint," schreef het bedrijf. "We're just getting started."

Zeven jaar geleden investeerde Microsoft meer dan $13 miljard in de verwachting dat OpenAI de toekomst van AI zou bouwen. De aankondiging van woensdag suggereert dat het bedrijf sindsdien een andere conclusie heeft getrokken: de toekomst van AI kan toebehoren aan wie de frontier bouwt, maar de winst gaat naar wie die alledaags maakt.