HeadFlash

AI

DeepSeek rzuca wyzwanie Opus 4.8 w testach agentowych

DeepSeek wypuszcza model wizyjny, Nvidia udowadnia wagę szkieletu, a OpenRouter notuje 14-krotny wzrost użycia tokenów przez agentów.

Posłuchaj

Wydanie opracowane przy pomocy sztucznej inteligencji. Tekst i lektor wygenerowane automatycznie.

DeepSeek prezentuje eksperymentalny model wizyjny V4-Flash-Vision-Exp

DeepSeek udostępnił V4-Flash-Vision-Exp, eksperymentalny model multimodalny, który dodaje rozumienie obrazów do dotychczasowych możliwości tekstowych. Według wewnętrznych benchmarków firmy, model niemal dorównuje Opus 4.8 w zadaniach agentowych, zachowując przy tym wydajność tekstową w zakresie rozumowania i wiedzy o świecie. DeepSeek pozycjonuje go pod aplikacje agentowe, współpracujące z różnymi frameworkami i łączące analizę wizualną z użyciem narzędzi. Model obsługuje formaty JPEG, PNG, GIF i WebP, a ich rozpoznawanie odbywa się na podstawie faktycznej zawartości pliku, nie nazwy czy deklarowanego typu MIME. Obrazy można przesyłać trzema sposobami: przez kodowanie Base64, publiczne adresy URL (do 32 MiB) lub nowe, darmowe API plików z limitem 64 MiB. Opcjonalne pole detail pozwala zmniejszyć obraz do 512 na 512 pikseli, oszczędzając tokeny. Każdy obraz kosztuje maksymalnie 384 tokeny, a pojedyncze żądanie może zawierać ich do 600. Ceny pozostały na poziomie V4-Flash. Model współpracuje z API Chat Completions i Responses od OpenAI oraz Messages od Anthropic. DeepSeek wydał też wersję 0.1.1 frameworka Harness, który wspiera nowy model od razu po instalacji.

Deepseek releases experimental Flash vision model that rivals Opus 4.8 on agent benchmarks →

Nvidia pokazuje, że szkiełko, a nie model, decyduje o skuteczności agentów

Nvidia opublikowała badania pokazujące, że szkielet, czyli oprogramowanie otaczające model AI odpowiedzialne za narzędzia, zarządzanie pamięcią i reguły, jest ważniejsze niż sam model w zadaniach długoterminowych. Używając własnego szkieletu z komponentem nadzorcy, badacze Nvidii osiągnęli 100 procent na benchmarku ARC-AGI-3 z modelem Claude Opus 5. Bez szkieletu ten sam model uzyskał 30 procent, co i tak było najlepszym wynikiem wśród wszystkich testowanych. Wiceprezes Nvidii Adel El Hallack porównał agenta do modelu wraz z rusztowaniem, które nazywa szkieletem, czyli zestawem narzędzi, runtime i bibliotek. Nadzorca działa jak dyrektor generalny, korygując agenta, gdy ten zbacza z kursu lub wchodzi w ślepą uliczkę. Nvidia zbudowała własny szkielet o nazwie Agentic Variation Operators, ale nie jest to produkt komercyjny; firma udostępnia otwarte komponenty pod marką Nemo. Badania OpenAI pokazały, że zmiana dwóch ustawień szkieletu potroiła wyniki ich modeli, ale żaden nie osiągnął 100 procent. Databricks opublikował z kolei analizę, według której zły szkielet może podwoić koszty. El Hallack podkreśla, że otwarte szkiełka pozwalają kontrolować więcej parametrów i są kluczowe dla rozwoju ekosystemu.

Nvidia just showed that the harness, not the AI model, is now the real hero →

Inherent chwali się agentem Faraday, który odtwarza wyniki badań naukowych

Londyńskie laboratorium Inherent, założone przez absolwentów Google DeepMind, ogłosiło, że jego agent Faraday przewyższył modele Anthropica i OpenAI w samodzielnym odtwarzaniu wyników opublikowanych prac naukowych, bez podawania odpowiedzi z góry. Firma wyszła z ukrycia kilka tygodni temu z zastrzykiem 50 milionów dolarów. Współzałożyciel Edward Hughes porównuje to zadanie do standardowego treningu naukowców, często zaczynającego się od replikacji. Faraday działa na modelu Qwen 3.6 z 27 miliardami parametrów i został zmierzony z Claude Opus 4.8 oraz GPT-5.5. Inherent stosuje uczenie przez wzmacnianie, stawiając na generalizację w różnych dziedzinach nauki. Faraday korzystał z GPT-5.5 Codex jako narzędzia kodującego. Firma zatrudnia kilkanaście osób w biurze w King’s Cross i planuje zwiększyć zatrudnienie do około 25 osób do końca roku. Hughes dodał głos do postulatów zniesienia garden leave, praktyki blokującej odejścia pracowników do konkurencji, która jego zdaniem daje amerykańskim startupom przewagę w rekrutacji.

Inherent, founded by DeepMind alumni, says its AI ‘teammate’ just outperformed Anthropic and OpenAI at replicating research →

Raport Guidelight: laboratoria AI nie mają planów na powstrzymanie zbuntowanego modelu

Organizacja Guidelight AI Standards oceniła pięć czołowych laboratoriów AI pod kątem gotowości do powstrzymania modelu wymykającego się spod kontroli, opierając się wyłącznie na publicznych planach. Najwyżej, bo na 3 z 5 punktów, oceniono OpenAI; najniżej Anthropica i Meta. Ocena sprawdzała m.in. logowanie i monitorowanie systemów, wstrzymywanie po wykryciu nieprawidłowości, audyty zewnętrzne oraz istnienie konkretnego planu reagowania na model próbujący przejąć kontrolę. Raport stwierdza, że najlepsze publiczne dowody wskazują na niewiele gotowych protokołów na wypadek zagrożenia. Były badacz bezpieczeństwa OpenAI Steven Adler przyznał, że zaskoczyło go, jak mało firmy mówią o postępowaniu w poważnym incydencie. Przedstawiciele Google i OpenAI argumentują, że raport nie oddaje pełni wewnętrznych praktyk. Meta odmówiła odpowiedzi, wskazując na istniejące ramy ryzyka. Eksperci prawni sugerują, że firmy mogą wstrzymywać się z ujawnianiem szczegółów z obawy przed roszczeniami o nieuczciwe praktyki rynkowe. W tle są nowe regulacje: kalifornijska SB 53 i nowojorska RAISE Act, a także federalny projekt AI Kill Switch Act. Guidelight nie znalazł dowodów, by Anthropic lub Meta miały plan reagowania na utratę kontroli.

Frontier AI labs still won’t say how they’d contain a rogue model →

Nowe badania: modele świata ignorujące ludzkie przekonania przewidują złe działania

Naukowcy opublikowali framework Mental World Modeling, który rozszerza klasyczne modele świata o zmienne mentalne, takie jak przekonania, uwaga, cele, emocje czy relacje społeczne. Przykład z kubkiem przeniesionym do szafki pod nieobecność osoby pokazuje, że czysto fizyczny model widzi poprawną scenę, ale przewiduje złą akcję; dopiero model śledzący przekonanie o lokalizacji kubka wyjaśnia faktyczne zachowanie. Każde działanie dzielone jest na nośnik fizyczny i ładunek mentalny, jak przepraszanie, oszukiwanie czy odrzucanie. Autorzy nie twierdzą, że symulują świadomość; stany mentalne to hipotezy z zachowania i kontekstu. Do testów zbudowano pipeline MENTIS i benchmark Menti-Bench z 448 scenami. Osiem modeli językowych, w tym GPT-5.6-Sol i Claude Opus 4.8, osiągnęło 63,3 punktu przy bezpośrednich odpowiedziach, 77,9 z samouzgodnieniem, a pełny pipeline 87,9; ludzie uzyskali 98,5. Najsłabszy model z MWM pobił najmocniejszy bez niego. Usunięcie kanału mentalnego obniżyło wyniki średnio o 12,1 punktu, a fizycznego o 16,5. Największy wpływ miało dostarczenie poprawnych przejść stanów, co wskazuje na symulację następnego stanu jako główne wąskie gardło. W scenach interpersonalnych poprawa wyniosła 26,4 punktu. Autorzy szacują, że około 80 procent pozostałej luki do ludzi wynika z błędów w pośrednich etapach, głównie w symulacji przejść.

World models that ignore human beliefs predict the wrong actions, new research shows →

Badanie wyjaśnia, dlaczego umiejętności pomagają agentom AI i kiedy zawodzą

Naukowcy z Princeton, UC San Diego i innych uczelni przeanalizowali, dlaczego agenci AI korzystają z umiejętności, czyli zwartych zestawów instrukcji opisujących kroki, kontrolę i typowe błędy. W kontrolowanych eksperymentach na 8135 testach okazało się, że umiejętności pomagają głównie przez zapewnienie niezawodnego procesu postępowania, a nie przez dostarczanie brakujących faktów. To tak zwane ugruntowanie proceduralne odpowiadało za 65,7 procent przypadków przewagi agenta z umiejętnością, podczas gdy bezpośrednie dostarczenie wiedzy pomogło tylko w 4,5 procent przypadków. Umiejętności redukują błędy wykonawcze, ale też wprowadzają nowe źródło błędów: w 10 procentach przypadków agent stosował przydatny scenariusz mechanicznie lub nieadekwatnie. Drugim wąskim gardłem jest wyszukiwanie właściwej umiejętności; gdy biblioteka rośnie z 5 do 100 wpisów, precyzja wyszukiwania spada z 29,6 do 3,3 procent. Naukowcy postulują traktowanie umiejętności jako cyklu życia i twierdzą, że lepsi agenci powstaną dzięki niezawodnym metodom tworzenia, wyszukiwania i stosowania umiejętności, a nie gromadzeniu większej liczby doświadczeń.

Study explains why AI agents benefit from “skills” and when they fail →

Netflix testuje model językowy jako zamiennik ręcznie budowanej logiki rekomendacji

Netflix przetestował system rekomendacji oparty na modelu językowym, nazwany GenRec, i raportuje lepsze wyniki niż w przypadku produkcyjnego silnika, przy ułamku danych treningowych. Obecny system opiera się na tysiącach ręcznie tworzonych cech, co utrudnia wdrażanie nowych typów treści, jak gry czy transmisje na żywo. Gotowe modele językowe okazały się nieodpowiednie, bo faworyzują popularne treści, zmyślają tytuły spoza katalogu i ignorują reguły biznesowe. GenRec jest trenowany w dwóch fazach: najpierw na danych Netflix, potem jako ranker rekomendacji. Historia oglądania jest zamieniana na zwykły tekst, a sygnały są filtrowane, by zmieścić się w oknie kontekstu. Model działa na vLLM, czytając dane wejściowe raz i oceniając wszystkich kandydatów w jednym przebiegu. Offline GenRec poprawił jakość rankingu o około 1,6 procent w porównaniu z produkcyjnym systemem, wymagając około 40 razy mniej oznaczonych przykładów. W czterotygodniowym teście A/B na około 10 procentach ruchu krótkoterminowy wskaźnik wzrósł o 0,115 procent, a długoterminowy o 0,006 procent; oba wyniki są statystycznie istotne. Netflix traktuje GenRec jako wczesny, ale obiecujący krok, nie planując na razie pełnej wymiany istniejącego systemu.

Netflix tests language model as alternative to hand-built recommendation logic →

Tajemniczy model Ox Alpha na OpenRouter: nikt nie wie, kto go zbudował

Anonimowy dostawca udostępnił za darmo model kodowania Ox Alpha na platformie OpenRouter, a żadna firma nie przyznała się do jego stworzenia. Model działa od 20 sierpnia, ma kontekst ponad miliona tokenów i przyjmuje tekst, obrazy i wideo. Wczesne wyniki na benchmarku DeepSWE wzbudziły zainteresowanie, ale po pełnym teście model wypadł mniej więcej na poziomie GPT-5.6-sol. Narzędzie modelprint, które identyfikuje anonimowe API, dopasowało Ox Alpha do GLM-5.3 w sześciu z dziewięciu prób, w tym we wszystkich czterech znormalizowanych licznikach tokenizacji. Chiński deweloper Z.ai wcześniej anonimowo testował GLM-5 pod nazwą Pony Alpha. Inni wskazują na zespół MiMo z Xiaomi. Tokenizer wskazuje też na kodowanie cl100k_base od OpenAI. OpenRouter twierdzi, że nie jest twórcą ani operatorem modelu. Przedsiębiorstwa wysyłają do niego kod, nie wiedząc, gdzie trafia. Użycie nie zwalnia; przez model przepłynęły miliardy tokenów od czwartku.

Nobody knows who built AI coding model Ox Alpha or where the code goes - SiliconANGLE →

Szary rynek w Chinach sprzedaje tokeny Claude za ułamek oficjalnej ceny

Mimo geoblokad, kontroli kart kredytowych i weryfikacji biometrycznej, w Chinach kwitnie szary rynek dostępu do modeli Anthropica przez tak zwane stacje przekaźnikowe. Chińscy deweloperzy kupują tokeny Claude za około 10 procent oficjalnej ceny, płacąc w juanach przez WeChat lub Alipay. Stacje przekaźnikowe to proxy API na serwerach poza Chinami, które przekazują żądania jako pochodzące z legalnej lokalizacji. Łańcuch dostaw jest modułowy: brokerzy kont masowo rejestrują konta, platformy SMS dostarczają zagraniczne numery, a specjaliści od inżynierii wstecznej badają metody wykrywania Anthropica. Operatorzy obniżają ceny, wykorzystując darmowe kredyty, zniżki edukacyjne czy dzielenie jednego planu na wielu użytkowników. Dochodzi też do podmiany modeli: proxy może cicho przekierować żądanie do tańszego modelu. Badacze z CISPA znaleźli powszechną podmianę modeli w 17 proxy. Największym zagrożeniem może być jednak monetyzacja danych o użyciu; każde żądanie przechodzące przez proxy jest potencjalnie widoczne dla operatora. Analitycy nie mają dowodów na systematyczne zbieranie i sprzedawanie tych danych, ale wskazują, że niskie ceny mogą być opłacalne właśnie dzięki sprzedaży logów. Ta infrastruktura była już używana w atakach destylacyjnych na dużą skalę; Anthropic, OpenAI i Google zaczęły współpracować przeciwko nieautoryzowanemu kopiowaniu modeli przez chińskich konkurentów.

How China’s gray market sells Claude tokens at a fraction of the price →

OpenRouter: użycie tokenów przez agentów AI wzrosło 14-krotnie

Analityk OpenRouter Peter Walker podał, że użycie tokenów przez agentów AI wzrosło 14-krotnie od 6 lutego 2025 roku, podczas gdy użycie przez ludzi wzrosło w tym samym okresie 2,8-krotnie. Ta data mogła być ostatnim dniem, kiedy ludzie konsumowali więcej tokenów niż agenci. Agenci pracują coraz bardziej autonomicznie i uruchamiają dodatkowe procesy AI. Prawie 70 procent użycia tokenów przez agentów pochodzi z buforowanych promptów, które są rozliczane po niższych stawkach, więc rzeczywiste koszty nie rosną tak szybko, jak surowe liczby. Konsumpcja tokenów przez agentów wzrosła z 0,51 biliona do 7,3 biliona od lutego 2025. OpenRouter skłania się ku modelom o otwartych wagach, które są mniej wydajne tokenowo, ale trend prawdopodobnie wygląda podobnie w głównych laboratoriach. Inflacja tokenów zaczęła się od modeli rozumujących, które myślą dłużej, nawet gdy nie jest to konieczne.

AI is becoming AI’s biggest customer as agentic token usage jumps 14x on OpenRouter →

Pilot Medicare z AI odmawia i opóźnia leczenie pacjentów w sześciu stanach USA

Pilotażowy program Medicare o nazwie WISeR Model, wdrożony przez Departament Zdrowia USA, odmawia i opóźnia opiekę pacjentom w sześciu stanach. Do programu przymusowo włączono Waszyngton, Arizonę, New Jersey, Ohio, Oklahomę i Teksas. Lekarze muszą przesyłać uzasadnienie leczenia do portalu, gdzie AI wybranych firm technologicznych ocenia, czy leczenie jest refundowane. Program obejmuje 15 procedur, w tym zastrzyki zewnątrzoponowe i artroskopię kolana. Pacjenci zgłaszają tygodniowe opóźnienia, mimo że system obiecuje decyzję w 72 godziny. 83-letni Keith Magnuson z Seattle trzykrotnie otrzymał odmowę zastrzyku, odkrywając, że decyzję podjęła AI. Lekarze mówią o czarnej skrzynce i rosnących kosztach. Senator Maria Cantwell podała, że pacjenci w Waszyngtonie czekają dwa do czterech razy dłużej. Firma Virtix, wybrana w tym stanie, tłumaczyła opóźnienia zbyt dużą liczbą żądań. CMS zapowiada działania naprawcze wobec uczestników z wysokim wskaźnikiem błędów. Pojawiają się obawy o wypaczone zachęty, bo wypłaty dla firm zależą częściowo od oszczędności z odrzuconych terapii. Eksperci zwracają uwagę, że program wdrożono bez zgody Kongresu, klasyfikując go jako dobrowolny dla firm, ale nie dla lekarzy.

AI is now deciding who gets healthcare in 6 US states – and it’s already harming patients →

Autor wirusowego narzędzia do usuwania znaków wodnych AI opowiada o reakcjach

Guillaume Meyer, paryski założyciel technologiczny, stworzył wirusowy projekt open source o nazwie Watermarks Remover w odpowiedzi na zapowiedź Anthropica o dodaniu niewidzialnego znaku wodnego do tekstów AI. Pierwszą wersję opublikował na GitHubie kilka godzin po rozpoczęciu badań. Jego post na X z 11 sierpnia zdobył ponad 2 miliony wyświetleń. Meyer argumentuje, że statystyczna metoda znakowania może generować fałszywe pozytywy i szkodzić ludziom; podaje przykład Grammarly, które oznaczałoby wszystko jako wygenerowane przez AI. Narzędzie działa przez sprawdzanie tekstu pod kątem znaku, generowanie drobnych wariantów, ponowne sprawdzanie i iterację, aż znak zostanie zakłócony. Meyer spędził nad projektem prawie cały czas od premiery. Przyznaje, że nie był gotowy na wirusową uwagę, nie mając wcześniej aktywnych kont na Facebooku czy Instagramie. Martwi się, że influencerzy promują projekt jako doskonały, choć wymaga poprawek, gdy Anthropic wypuści detektory. 99,9 procent komentarzy jest pozytywnych. Meyer podkreśla, że nie jest przeciwko oznaczaniu treści, ale przeciwko tej technice. Rozważa przekształcenie projektu w biznes, choć nie wie, czy jest to prawnie możliwe.

I created a viral AI watermark remover. I wasn’t ready for all the attention. →

Codzienny flash z techu

Flash w każdy dzień roboczy.

Pięć minut o AI, prywatności i bezpieczeństwie — krótki mail na każdy wybrany temat, z podcastem do tego.

Twoje nisze