AI
AI na froncie: od lokalnych mocarzy po autonomicznych współpracowników
Nowe modele AI zaskakują: Fugu pokonuje benchmarki, Claude Tag wchodzi do Slacka, a GLM 5.2 działa lokalnie. Oto skrót najgorętszych newsów.
Sakana Fugu – multiagentowy system jako jeden model
Wyniki benchmarków pokazują, że Fugu Ultra osiąga 73,7 w SWE Bench Pro, 82,1 w TerminalBench 2.1 i 93,2 w LiveCodeBench, wyprzedzając takie modele jak Opus 4.8, Gemini 3.1 Pro czy GPT 5.5 w większości testów. W jakościowych przykładach Fugu Ultra rozwiązywał kostkę Rubika, generował działające mechaniczne modele CAD, a w ślepych szachach pokonał Stockfisha o sile 2100 Elo. Subskrypcja zaczyna się od 20 USD miesięcznie za Standard, a pay-as-you-go dla Fugu Ultra kosztuje 5 USD za milion tokenów wejściowych. Usługa nie jest dostępna w UE/EEA ze względu na prace nad zgodnością z GDPR.
Sakana Fugu — Multi-Agent System as a Model →
Datalab Lift – model 9B wyciągający strukturalny JSON z PDF-ów
Na własnym benchmarku Datalaba składającym się z 225 dokumentów Lift osiągnął 90,2% dokładności pól i 20,9% pełnej dokładności dokumentów, z medianą opóźnienia 9,5 sekundy. Wśród modeli samodzielnie hostowanych wyprzedził NuExtract3 (81,5%) i Qwen3.5-9B (76,32%), będąc około trzy razy szybszym od Gemini Flash 3.5. Wagi są objęte licencją OpenRAIL-M z modyfikacjami, umożliwiającą użycie badawcze, osobiste i startupom poniżej 5 mln USD finansowania. Instalacja przez pip, a CLI pozwala na prostą ekstrakcję. Model działa na kartach od H100 po T4.
Anthropic uruchamia Claude Tag – stały zespół AI w Slacku
Administratorzy mogą definiować osobne tożsamości Claude dla różnych kanałów, ustawiać limity wydatków na tokeny i przeglądać pełny dziennik działań. Claude Tag wchodzi na konkurencyjny rynek integracji Slacka, gdzie Salesforce, OpenAI, Perplexity i inne już oferują podobne rozwiązania. Anthropic planuje rozszerzyć Claude Tag poza Slacka na Microsoft Teams, e-mail i narzędzia do zarządzania projektami. W tle finansowym firma zebrała 65 miliardów dolarów w serii H przy wycenie 965 mld USD, a przychody Claude Code przekroczyły 2,5 mld USD.
Chiński GLM 5.2 działa lokalnie i przewyższa ChatGPT
Zaletą lokalnego działania jest bezpieczeństwo wrażliwych danych, które nie opuszczają prywatnego sprzętu. GLM 5.2 przewyższa ChatGPT w niektórych testach, choć wymaga potężnego sprzętu – standardowy PC z 24 GB VRAM to za mało. Model jest przykładem trendu, w którym zaawansowana AI nie musi oznaczać subskrypcji u dużego dostawcy, a deweloperzy mogą dostosowywać wagi do własnych potrzeb.
This new Chinese AI Is outperforming ChatGPT — and it runs locally →
Model Mythos od Anthropica znalazł luki w amerykańskich systemach rządowych
Informacja ta podkreśla rosnącą rolę zaawansowanych modeli AI w cyberbezpieczeństwie, ale także budzi obawy o możliwość autonomicznego wykorzystywania luk. Mythos, będący najnowszym modelem Anthropica, pokazuje, że AI może wspierać nawet najbardziej wrażliwe operacje rządowe. Dokładny zakres testów i rodzaj znalezionych podatności nie zostały ujawnione.
Anthropic’s Mythos model found vulnerabilities in classified US government systems, official says →