Google DeepMind Gemini 3.7 Flash na 20. miejscu w rankingu Agent Arena
Najważniejsze informacje
- •Agent Arena klasyfikuje modele AI pod kątem wydajności w zadaniach na żywo, wykorzystując dane z ponad 1,7 miliona sesji użytkowników.
- •Gemini 3.7 Flash awansował na 20. miejsce po odnotowaniu poprawy wyniku o 3,4%.
- •Dziewiętnaście modeli jest obecnie sklasyfikowanych wyżej niż Gemini 3.7 Flash w rankingu.
- •Google Gemini 3.5 Flash zajmuje 27. miejsce, podczas gdy Gemini 3.6 Flash jest na około 34. miejscu.
- •Gemini 3.7 Flash nie został oficjalnie wydany według stanu na połowę sierpnia 2026 r.

Google DeepMind Gemini 3.7 Flash awansował na 20. pozycję w rankingu Agent Arena, systemie klasyfikacji na żywo prowadzonym przez arena.ai, który ocenia modele AI pod kątem ich wydajności w wykonywaniu zadań w świecie rzeczywistym. Model odnotował poprawę wyniku o 3,4%, co umieściło go w rankingu mającym odzwierciedlać zachowanie modeli w praktycznych przepływach pracy, a nie w statycznych testach porównawczych.
Jak Agent Arena ocenia modele
W przeciwieństwie do konwencjonalnych rankingów, które opierają się na pytaniach quizowych lub standaryzowanych testach, Agent Arena klasyfikuje modele AI na podstawie orkiestracji narzędzi w świecie rzeczywistym oraz skuteczności ukończenia zadań. Platforma korzysta z danych z ponad 1,7 miliona sesji użytkowników i monitoruje wskaźniki takie jak halucynacje narzędziowe — sytuacja, w której model pewnie próbuje użyć nieistniejącego narzędzia lub nieprawidłowo stosuje dostępne — a także ogólne wskaźniki sukcesu.
Ponieważ ranking opiera się na danych z używania na żywo, zmiany mogą mieć znaczenie wykraczające poza pojedynczą aktualizację wyniku: mogą wskazywać, jak model radzi sobie, gdy musi wybierać narzędzia, odzyskiwać się po błędach i kończyć zadania w środowiskach przypominających wdrożenia agentów bardziej niż pytania w stylu egzaminu.
Porównanie generacji modeli Flash
Postęp w obrębie linii modeli Flash firmy Google uwypukla tempo iteracji modeli. Gemini 3.5 Flash zajmuje obecnie 27. miejsce z zaledwie 0,39% netto poprawy, podczas gdy Gemini 3.6 Flash plasuje się dalej, na około 34. miejscu.
Gemini 3.6 Flash został wydany 21 lipca 2026 r. Ta generacja modeli koncentrowała się na osiągnięciu 17% redukcji tokenów wyjściowych w porównaniu z poprzednikami.
Odwołania znalezione w zestawie SDK Google Python GenAI wskazują, że wariant 3.7 ma na celu dalsze zwiększenie efektywności tokenowej przy jednoczesnej integracji wydajności agentów multimodalnych. Umożliwiłoby to modelowi działanie na tekstach, obrazach i potencjalnie innych typach danych w ramach jednego przepływu pracy agenta. Według stanu na połowę sierpnia 2026 r. Gemini 3.7 Flash nie został jeszcze oficjalnie wydany.
Pozycja konkurencyjna
Przy 20. miejscu Gemini 3.7 Flash, 19 modeli obecnie go przewyższa w zadaniach agentów w świecie rzeczywistym. Nie ujawniono żadnej oficjalnej metodologii szczegółowo opisującej, jak obliczono wartość poprawy wynoszącą 3,4%. Punktacja Agent Arena jest dynamiczna — modele mogą awansować lub spadać w rankingu w miarę pojawiania się nowych konkurentów i gromadzenia dodatkowych danych z sesji użytkowników.