AI
DeepSeek V4.1-Flash tnie pamięć agentów czterokrotnie
DeepSeek wypuszcza V4.1-Flash z czterokrotnie mniejszą pamięcią KV, OpenAI udostępnia GPT-Live-1 w API, a Clearview AI testuje InquiryIQ dla policji.
Wydanie opracowane przy pomocy sztucznej inteligencji. Tekst i lektor wygenerowane automatycznie.
DeepSeek V4.1-Flash redukuje pamięć agentów AI do jednej czwartej
DeepSeek 10 września 2026 roku o 04:00 UTC wypuścił V4.1-Flash — multimodalny model o 552 miliardach parametrów, zbudowany na czterech wzajemnie powiązanych rozwiązaniach architektonicznych, które razem zmniejszają aktywną pamięć podręczną klucz-wartość (KV cache) potrzebną długo działającym agentom AI do jednej czwartej tego, co wymagała poprzednia generacja V4-Flash. Premiera otwiera nową serię V4.1, będącą odrębną linią architektoniczną, a nie tylko przyrostową aktualizacją. Model osiąga globalny KV cache na poziomie 890 bajtów na token, czyli około jednej czwartej V4-Flash i mniej więcej 1/437 rozmiaru na token, jaki miał DeepSeek-V1 dwa lata wcześniej. Ponieważ opłaty za trafienia w cache podczas zadań agentowych zwykle stanowią większość kosztów wnioskowania, zmiana ta ma bezpośredni wpływ na ekonomię wdrożeń.
Cztery zmiany architektoniczne to podział na koder przyczynowy i dekoder, który reorganizuje 40 warstw Transformera w 20-warstwowy koder i 20-warstwowy dekoder, tak że podczas wstępnego przetwarzania tylko warstwy kodera obsługują pełny kontekst. Model aktywuje 8 miliardów parametrów na token przy przetwarzaniu wejścia i 16 miliardów przy generowaniu tekstu. Compressed Sparse Attention 2 (CSA2) zastępuje statyczną kompresję uwagi z V4 systemem współdzielenia cache, przypisującym każdej warstwie jeden z trzech trybów: Full, Reindex lub Reuse. Kwantyzacja FP4 przechowuje główny globalny KV cache w formacie 4-bitowym zamiast FP8, mniej więcej o połowę zmniejszając pamięć na wpis, a trening świadomy kwantyzacji zapobiega utracie dokładności. Czwarta zmiana całkowicie eliminuje trwałe przechowywanie stanu lokalnej uwagi okienkowej (SWA) na dyskach SSD — zamiast tego tymczasowa pula pamięci rozproszonej, czerpiąca 10 procent pamięci DRAM każdego serwera, przechowuje stan SWA przez krótkie okno użyteczności, a mechanizm SWA Bounded Replay odtwarza jedynie ostatnie 128 tokenów wejścia po wznowieniu sesji. Trwały zapis SSD dla KV cache spada do około jednej ósmej wymagań V4-Flash.
Model korzysta z routingu Mixture-of-Experts: każdy blok Transformera zawiera jednego wspólnego eksperta i 384 ekspertów routowanych, z czego tylko sześciu aktywuje się na token, co daje około 1,6 procent dostępnych ekspertów. Architektura V4.1 integruje też 196-miliardowy moduł pamięci warunkowej Engram z tablicami wyszukiwania n-gramów po około 16 milionów wpisów, które rezydują w pamięci hosta i są wstępnie pobierane podczas wnioskowania. Model trenowano na 45 bilionach tokenów, rozszerzając okno kontekstu z 64K do 1 miliona tokenów po przetworzeniu 34 bilionów tokenów. Natywne wsparcie multimodalne zapewnia 32-warstwowy koder wizyjny wstępnie trenowany na około 47 miliardach par obraz-tekst. Dostępna jest też ciągle regulowana siła rozumowania — liczba całkowita od 1 do 100 — a przejście z 25 na 100 podniosło średnie wyniki w ośmiu benchmarkach z 67,1 do 76,3 procent kosztem około 2,5-krotnego budżetu tokenów wyjściowych. API udostępnia trzy presety: Low (poziom 50), High (75) i Max (100). Na maksymalnym poziomie V4.1-Flash osiągnął 90,6 procent na Terminal-Bench 2.1, 74,2 procent na DeepSWE v1.1, 88,1 procent na CyberGym, 54,8 procent na AutomationBench i 31,8 procent na Agents’ Last Exam, a jego rating Codeforces wyniósł 3471, powyżej 3348 dla V4-Pro.
Raport techniczny ujawnia jednak istotne zastrzeżenie dotyczące benchmarków agentowych: ten sam punkt kontrolny V4.1-Flash uzyskał od 65,5 do 74,2 procent na DeepSWE v1.1 wyłącznie w zależności od tego, jakie środowisko agentowe go opakowało — różnica 8,7 punktu procentowego wynikała ze zmiany frameworku ewaluacyjnego, a nie modelu. Testowane środowiska to Claude Code, Codex, OpenCode oraz własne narzędzie DeepSeek. Podobne efekty pokazała niezależna analiza poprzedniej generacji V4-Flash, gdzie Artificial Analysis zmierzyło wyniki Terminal-Bench o 3–4 punkty poniżej wartości podawanych przez producenta. Pojedyncze punkty procentowe różnicy między modelami mieszczą się w szumie wprowadzanym przez wybór środowiska, a rzetelne porównanie wymaga identycznych warunków, których branża AI jeszcze nie ustaliła. DeepSeek przyznaje, że większe modele zamknięte zachowują przewagę w zadaniach wymagających wiedzy specjalistycznej i utrzymuje się luka multimodalna względem największych systemów własnościowych. Ceny API V4.1-Flash podzielono na okresy szczytowe i pozaszczytowe, przy czym stawki pozaszczytowe są o połowę niższe; godziny szczytu to 01:00–04:00 i 06:00–10:00 UTC w dni robocze. Od 14 września 2026 roku o 04:00 UTC cały ruch API do endpointu deepseek-v4-pro jest automatycznie przekierowywany na V4.1-Flash w jego stawkach, co czyni przejście obowiązkowym dla każdego dewelopera korzystającego z tego endpointu.
DeepSeek V4.1-Flash Cuts Agent Memory Costs Fourfold With New Architecture →
OpenAI udostępnia GPT-Live-1 w API — model mówi i słucha jednocześnie
OpenAI udostępniło deweloperom GPT-Live-1 jako API. Model mowy potrafi słuchać i mówić w tym samym czasie — cecha znana jako full-duplex — i działa już wewnątrz ChatGPT. Deweloperzy mogą łączyć go z różnymi modelami zaplecza w zależności od zadania, dopasowując głębokość rozumowania, szybkość i koszt do konkretnego zastosowania. Cena wynosi 0,05 dolara za minutę.
W benchmarkach OpenAI GPT-Live-1 osiąga 80,1 procent w testach interaktywności full-duplex, wobec 45,4 procent dla GPT-Realtime-2.1. Opóźnienie przejmowania tur spada do 0,8 sekundy z 1,4 sekundy, a dokładność wywoływania narzędzi rośnie do 87 procent z 60 procent. W benchmarku głosowego wsparcia bankowego GPT-Live-1 osiąga 32 procent wskaźnika zaliczeń, w górę z 12,4 procent dla poprzedniego modelu. Model dostarczany jest z dwunastoma nowymi głosami obejmującymi różne akcenty, dialekty i języki, a także zapewnia transkrypcje ASR i tekst odpowiedzi od razu po wyjęciu z pudełka.
Yelp wykorzystuje model do rezerwacji telefonicznych i według dyrektora technologicznego Alexa Levy’ego raportuje lepszą obsługę połączeń. Pełne szczegóły mają być dostępne w dokumentacji API. Premiera wzmacnia pozycję OpenAI na rynku głosowych interfejsów konwersacyjnych, gdzie liczy się nie tylko jakość rozumowania, ale też naturalność i szybkość wymiany zdań — a deklarowana elastyczność łączenia z modelami zaplecza pozwala deweloperom optymalizować koszty bez rezygnacji z niskich opóźnień.
OpenAI’s GPT-Live-1 API lets developers build apps that talk and listen at the same time →
Clearview AI testuje InquiryIQ — narzędzie dla policji do odkrywania życia online
Clearview AI testuje nieujawniony wcześniej prototyp o nazwie InquiryIQ, który miałby pozwolić organom ścigania wydobywać informacje o osobach zidentyfikowanych przez Clearview — ich kontakty, konta w mediach społecznościowych i inne dane. Prototyp testowano z modelem od xAI, twórcy Grok.
Clearview AI zasłynęło w 2020 roku, gdy zaczęło zgarniać ponad 3 miliardy zdjęć z internetu, aby zamieniać twarze w nazwiska dla policji i specjalistów ds. bezpieczeństwa. Nowe narzędzie ma pomóc organom ścigania uzupełniać szczegóły o osobie stojącej za nazwiskiem — kim jest, kogo zna, gdzie mieszka i co po sobie zostawiła w sieci.
Jeśli prototyp trafi do produkcji, oznaczałoby to rozszerzenie działalności Clearview z samej identyfikacji twarzy na kompleksowe profilowanie osób, co budzi poważne pytania o prywatność i nadzór. Firma nie ujawniła, na jakim etapie zaawansowania są testy ani kiedy ewentualnie narzędzie miałoby zostać wdrożone.
Clearview AI Is Testing an AI Tool That Would Let Cops Unearth Your Life Online →
Stary MacBook z lustrem, kamerą i agentem AI sam dostraja sterowniki AMD GPU
Deweloper Linuksa Justin Schroeder (@jpschroeder) udostępnił zdjęcie laptopa wykorzystującego informację zwrotną w czasie rzeczywistym podczas zadania dostrajania sterownika GPU AMD Radeon. Według Schroedera MacBook używa kamery internetowej, aby patrzeć na własny ekran odbity w lustrze i poprawiać wsparcie dla układów AMD Radeon w Omarchy. Maszyna najprawdopodobniej uruchamia agenta programistycznego, takiego jak Claude Code, który obserwuje własny ekran, aby oceniać wprowadzane zmiany w sterowniku GPU.
Ponieważ MacBook pracuje nad samym sobą, musi to być starszy model Intel Mac z układem AMD w środku, co pozwala agentowi kodującemu udoskonalać wsparcie sprzętowe Radeon i korzystać z wizualnej informacji zwrotnej z kamery. Szef Epic Games, Tim Sweeney, skomentował użycie AI humorystycznie, mówiąc, że ma to dla niego „wibracje czytania z ruchu warg HAL 9000”. HAL 9000 to superinteligentny komputer z filmu Kubricka „2001: Odyseja kosmiczna”, który czytał z ruchu warg astronautów spiskujących, by ograniczyć jego zakres działania.
Omarchy to dystrybucja Linuksa dostosowana „do ery agentów”, ze specjalistycznymi sterownikami i konfiguracjami dla użytkowników starszych Maców z procesorami Intel. Jej strona reklamuje błyskawiczną instalację i wbudowanych agentów, którzy potrafią debugować problemy, pozwalając użytkownikom „przepływać przez każdą zmianę, poprawkę czy kłopot”. Dystrybucja jest dostępna także dla Maców Apple Silicon i nowoczesnych pecetów x86, nadaje się na maszyny o niskiej specyfikacji, takie jak „ThinkPad X220 z 2011 roku z 2 GB RAM”, i jest rozpowszechniana na licencji MIT.