AktualnościMakroCursor uruchamia Cursor Router: klasyfikator na poziomie żądania zapewniający jakość kodowania modeli frontier przy kosztach niższych o 30–50%

Cursor uruchamia Cursor Router: klasyfikator na poziomie żądania zapewniający jakość kodowania modeli frontier przy kosztach niższych o 30–50%

Autor: MarkTechPost·

Najważniejsze informacje

  • Cursor Router jest klasyfikatorem na poziomie żądania, wytrenowanym na ponad 600 000 rzeczywistych żądań, który analizuje zapytanie, kontekst, złożoność zadania i domenę, aby przed wykonaniem skierować każde żądanie do najlepiej dopasowanego modelu AI.
  • Testy A/B online obejmujące miliony rzeczywistych żądań wykazały wydajność jakości frontier przy oszczędnościach kosztów rzędu około 60%, a trzy konta enterprise we wczesnym dostępie zgłosiły oszczędności od 30 do 50 procent w porównaniu z Opus 4.8.
  • Router uwzględnia pamięć podręczną zarówno podczas treningu, jak i oceny, co oznacza, że wszystkie raportowane oszczędności obejmują rzeczywisty koszt utraty cache występującej przy przełączaniu modeli w trakcie rozmowy, zamiast go pomijać.
  • Grok 4.5 jest obowiązkową, efektywną kosztowo opcją routingu, której nie można wykluczyć za pomocą list blokowanych modeli, a tryby Balance i Intelligence są rozliczane według zmiennej stawki modelu wybranego dla każdego routowanego żądania.
  • Koszt na commit dla zmierzonych trybów wyniósł $4.63 dla Auto Balance, $6.76 dla Auto Intelligence, $7.34 dla Opus 4.8 i $12.69 dla Fable 5, zapewniając porównanie kosztów oparte na rezultatach, wykraczające poza cenę za żądanie.
Cursor uruchamia Cursor Router: klasyfikator na poziomie żądania zapewniający jakość kodowania modeli frontier przy kosztach niższych o 30–50%

Cursor udostępnił Cursor Router ogólnie dla planów Teams i Enterprise. System jest klasyfikatorem na poziomie żądania, który analizuje każde przychodzące żądanie przed uruchomieniem jakiegokolwiek modelu, a następnie przekazuje je do modelu najlepiej dopasowanego do danego zadania. Według zespołu Cursor testy A/B online pokazują wydajność jakości frontier przy oszczędnościach kosztów wynoszących około 60%, podczas gdy trzy konta enterprise we wczesnym dostępie zgłosiły oszczędności na poziomie 30–50%.

Podstawowy problem, który rozwiązuje Cursor Router, dotyczy wzorca wydatków, a nie luki w możliwościach. Cursor podaje, że około 60% jego deweloperów używa jednego modelu jako codziennego narzędzia pracy. W rezultacie rutynowe zadania są wykonywane po cenach warstwy frontier, a wydatki na AI rosną szybciej niż poprawia się jakość wyników. To napięcie nie jest charakterystyczne wyłącznie dla Cursor; na rynku asystentów AI do kodowania — gdzie Cursor konkuruje z produktami takimi jak GitHub Copilot, Codeium i Tabnine — dostawcy mierzą się z tym samym wyzwaniem równoważenia dostępu do wielu modeli z kosztami inferencji przypadającymi na dewelopera. Cursor Router ma rozwiązać tę rozbieżność.

Jak działa klasyfikator

Cursor Router nie jest ani łańcuchem awaryjnym, ani mechanizmem ponawiania prób. To klasyfikator wytrenowany na ponad 600 000 rzeczywistych żądań, oceniany w teście A/B online obejmującym miliony rzeczywistych żądań i optymalizowany pod kątem satysfakcji użytkownika (AFC) jako sygnału nagrody.

Dla każdego żądania router analizuje cztery dane wejściowe: zapytanie, kontekst, złożoność zadania i domenę. Są one łączone z wyuczoną wiedzą o profilu zachowania każdego modelu. Cursor publikuje trzy reguły routingu wynikające z tej klasyfikacji:

  • Proste prace są kierowane do modeli najbardziej efektywnych kosztowo.
  • Aktualizacje UI są kierowane do modelu o najlepszym wyczuciu estetycznym.
  • Złożone problemy o długim horyzoncie są kierowane do modeli rozumowania frontier.

Trzecia reguła ma kluczowe znaczenie dla argumentu kosztowego. Oszczędności nie są osiągane przez obniżanie klasy trudnych problemów; wynikają z usunięcia rutynowej pracy z wyceny na poziomie frontier, przy jednoczesnym pozostawieniu najtrudniejszej warstwy bez zmian.

Warto zwrócić uwagę na istotny szczegół implementacyjny: Cursor Router uwzględnia pamięć podręczną zarówno podczas treningu, jak i oceny. Jest trenowany na zbiorze danych, w którym routing powoduje utraty trafień w cache, a raportowane oszczędności obejmują koszt tych utrat. Przełączanie modeli w trakcie rozmowy unieważnia cache promptu, a ten koszt jest realny — routery, które go ignorują, zawyżają swoje oszczędności. Cache promptów, który pozwala dostawcom ponownie wykorzystywać wcześniej przetworzony kontekst ze zniżką, stał się standardową funkcją obniżania kosztów oferowaną przez głównych dostawców modeli, w tym Anthropic, OpenAI i Google, przez co unieważnienie cache staje się istotnie kosztownym skutkiem ubocznym każdego systemu przełączania modeli.

Klasyfikator zaprojektowano również z myślą o szybkiej rotacji modeli. Cursor twierdzi, że router można aktualizować wraz z pojawianiem się nowszych modeli, co stanowi istotną zaletę na rynku, na którym granica możliwości przesuwa się co miesiąc. Ponieważ dostawcy, w tym Anthropic, OpenAI, Google i xAI, publikują zaktualizowane modele w nakładających się harmonogramach, nowe opcje mogą pojawić się, zanim zespoły zakończą ocenę obecnych.

Dlaczego testy A/B online zamiast ewaluacji offline

Cursor celowo nie wybrał ewaluacji offline jako głównej metody pomiaru. Firma uzasadnia to tym, że ewaluacje offline cierpią z powodu małych prób, oderwania od rzeczywistych wzorców użycia oraz trudności w sprowadzeniu sukcesu do ustandaryzowanej rubryki. Nie uwzględniają też kosztu utraty cache ponoszonego przy przełączaniu modeli.

Rzeczywiste decyzje routingowe zachodzą w ramach całej rozmowy, a nie pojedynczej tury. Deweloperzy piszą kod, zadają pytania uzupełniające, napotykają błędy i kontynuują pracę — często w ramach setek żądań w danym tygodniu. Router musi określić zarówno to, który model wybrać, jak i kiedy przełączać się między modelami.

Ocenę wspierają dwie metryki jakości:

  • Satysfakcja użytkownika: sukces agenta jest klasyfikowany na podstawie reakcji użytkowników. Przejście do kolejnej funkcji jest traktowane jako silny sygnał pozytywny; poprawianie agenta — jako silny sygnał negatywny.
  • Wskaźnik utrzymania kodu: odsetek kodu wygenerowanego przez agenta, który z czasem pozostaje w bazie kodu.

Zespół Cursor twierdzi, że przez ostatnie dziewięć miesięcy używał obu metryk do oceny każdego uruchomienia modelu i każdej poprawy harnessu. Metryki te istniały przed produktem, który obecnie służą do walidacji. Wskaźnik utrzymania kodu odzwierciedla nacisk na pomiar oparty na rezultatach — czy kod wygenerowany przez AI pozostaje w projekcie — zamiast na wskaźnikach ukończenia zadań, które mogą nie uwzględniać poprawek lub późniejszych awarii.

Trzy tryby i stojące za nimi liczby

Tryb Auto udostępnia teraz trzy ustawienia optymalizacji, które przesuwają użytkowników wzdłuż granicy Pareto koszt–inteligencja:

  • Auto Intelligence osiąga poziom zbliżony do Fable pod względem satysfakcji użytkownika przy kosztach dla zespołów niższych o około 60%. W porównaniu z Opus 4.8 podnosi satysfakcję o około 15% przy niemal tym samym koszcie.
  • Auto Balance plasuje się powyżej Opus 4.8 pod względem satysfakcji użytkownika przy koszcie niższym o około 36%. W porównaniu z GPT-5.6 Sol dostarcza porównywalną satysfakcję przy niższym poziomie wydatków.
  • Cost mode jest opisywany jako osiągający dobrą jakość, jednocześnie sięgając po najwyższą dostępną inteligencję i optymalizując wydatki na tokeny. Cursor nie opublikował danych A/B dotyczących jakości ani kosztów dla tego trybu.

Ponieważ koszt na żądanie pokazuje tylko część obrazu, Cursor zmierzył również koszt na commit:

Model / trybKoszt na commit
Auto Balance$4.63
Auto Intelligence$6.76
Opus 4.8$7.34
Fable 5$12.69

GPT-5.6 Sol dorównał kosztowi trybu Intelligence, ale zapewnił niższą satysfakcję użytkowników. Cursor nie opublikował dla niego dokładnej wartości kosztu na commit.

Wdrożenie i ograniczenia zakupowe

Cursor Router jest dostępny na desktopie, w wersji webowej, na iOS, w CLI oraz w Cursor SDK. W planach Teams jest włączony domyślnie. Administratorzy Enterprise mogą aktywować go z poziomu panelu.

Changelog określa zakres administracyjny: włączanie na poziomie zespołów i grup, ograniczenia dotyczące trybów optymalizacji, które mogą wybierać członkowie, konfigurowalny tryb domyślny oraz listy modeli dozwolonych i blokowanych. Dostępne są zarówno miękkie, jak i twarde opcje egzekwowania standaryzacji na trybie Auto. Model wybrany przez routing może być wyświetlany lub ukryty — domyślnie jest ukryty, więc zespoły oczekujące przejrzystości routingu muszą jawnie wyrazić na to zgodę.

Dwa ograniczenia są istotne dla planowania zakupów:

  1. Grok 4.5 jest wymaganą, efektywną kosztowo opcją routingu, co oznacza, że lista blokowanych modeli nie może zostać użyta do jego wykluczenia. Grok 4.5, wydany July 8, kosztuje $2/M za tokeny wejściowe i $6/M za tokeny wyjściowe, z szybką odmianą w cenie $4/M i $18/M.
  2. Tryby Balance i Intelligence są rozliczane według stawki modelu wybranego przez routing, więc koszt jednostkowy zmienia się przy każdej decyzji routingowej, zamiast ustalać się na płaskim poziomie za żądanie.

Kluczowe fakty

  • Cursor Router jest klasyfikatorem na poziomie żądania, wytrenowanym na ponad 600 000 rzeczywistych żądań i optymalizowanym pod kątem satysfakcji użytkownika (AFC).
  • Testy A/B online raportują wyniki jakości frontier przy oszczędnościach 60%; trzy konta enterprise we wczesnym dostępie zaoszczędziły 30–50% względem Opus 4.8.
  • Koszt na commit: $4.63 (Balance), $6.76 (Intelligence), wobec $7.34 (Opus 4.8) i $12.69 (Fable 5).
  • Koszty utraty cache wynikające z przełączania modeli są uwzględnione w raportowanych oszczędnościach, a nie wyłączone z kalkulacji.
  • Grok 4.5 jest obowiązkową opcją routingu, a tryby Balance i Intelligence są rozliczane według stawki modelu wybranego przez routing.

Źródła: wpis o uruchomieniu Cursor Router, changelog Cursor Router, ogłoszenie Grok 4.5 oraz @cursor_ai na X.