AI
GLM-5.3-Flash za ułamek ceny i bez Nvidii
Z.ai wypuszcza tani model GLM-5.3-Flash, Torvalds walczy z AI, a Google tnie ceny wideo.
Wydanie opracowane przy pomocy sztucznej inteligencji. Tekst i lektor wygenerowane automatycznie.
GLM-5.3-Flash: wydajność flagowców za 7,5 razy mniejszą cenę, działa bez GPU Nvidii
Chińskie Z.ai wypuściło GLM-5.3-Flash, pierwszy natywnie multimodalny model z serii GLM-5. Ma 320 miliardów parametrów, z czego 18 miliardów aktywnych, licencję MIT i okno kontekstowe na milion tokenów. W indeksie inteligencji Artificial Analysis uzyskał 57 punktów przy maksymalnym wysiłku rozumowania, tylko trzy punkty mniej niż większy GLM-5.3 i tyle samo co GPT-5.6 Terra oraz Muse Spark 1.2. Koszt zadania w tym indeksie to 0,09 dolara wobec 0,68 dolara dla GLM-5.3, czyli około 7,5 razy taniej. W API Z.ai cena wynosi 0,15 dolara za milion tokenów wejściowych i 0,50 dolara za milion tokenów wyjściowych, czyli nieco ponad 10 procent ceny GLM-5.3. Przed oficjalną premierą model testowano anonimowo jako ox-alpha na OpenCode i OpenRouter, gdzie stał się najpopularniejszym modelem tygodnia. Cały ten ruch obsłużyły chińskie chipy AI, a SemiAnalysis podaje, że model obsłużył 100 bilionów tokenów dziennie. Z.ai twierdzi, że jego wydajność sprzętowa i koszt na token są porównywalne z typowymi GPU Nvidii. SemiAnalysis traktuje to jako kolejny test mitu o moacie CUDA. Firma zbudowała własne oprogramowanie serwujące na bazie SGLang i podzieliła przetwarzanie na niezależnie skalowalne etapy, co według zespołu potroiło przepustowość w porównaniu z pierwszą próbą na tym samym sprzęcie. Agent oparty na GLM-5.3 pomagał przy optymalizacji.
GLM-5.3-Flash matches top models at a fraction of the cost, and runs without Nvidia →
Torvalds o sesji debugowania z AI: upierała się, że problem jest nierozwiązywalny
Twórca Linuksa Linus Torvalds opisał sesję debugowania z asystentem AI, który wielokrotnie zalecał poddanie się. Problem wymagał zmiany błędnego wywołania funkcji round_up na round_down, ale proces obejmował 24 łatki dodające informacje debugujące i 18 uruchomień jądra, by zawęzić źródło błędu. Torvalds podkreślił, że nie był to błąd składni ani zwykły bug, bo funkcja była technicznie poprawna, ale nie robiła tego, czego chciał. AI kilkakrotnie stwierdzało wprost, że problem jest niemożliwy i nierozwiązywalny, sugerując napisanie raportu zamiast dalszej pracy. Torvalds przypisał ostateczny sukces własnemu uporowi, mówiąc, że podejrzewa, iż te systemy były trenowane na ludziach, którzy nie są tak uparci jak on. Docenił jednak, że AI konsekwentnie dodawało kod debugujący i wiernie analizowało wyniki, gdy je do tego popychał, a na koniec pozwolił mu napisać komunikat commita.
Gemini Omni 1.1 Flash: tańsze generowanie wideo, dłuższe sceny i tryb 360p
Google wypuściło wersję 1.1 modelu wideo Gemini Omni Flash. Rozszerzanie scen analizuje teraz do dziesięciu sekund istniejącego wideo zamiast tylko ostatniej sekundy, co daje bardziej spójne wizualnie wyniki. Sceny można wydłużać o dziesięciosekundowe przyrosty aż do łącznie 40 sekund. Deweloperzy mogą przesłać do trzech sekund zewnętrznego materiału jako referencję stylu, by przenieść postaci lub wzorce ruchu, a także ustawić klatki początkowe i końcowe do tworzenia ruchów kamery między kluczowymi klatkami. Tryb roboczy 360p działa do 60 procent szybciej i kosztuje jedną trzecią ceny wersji 720p. Wideo można przeskalować do 1080p lub 4K. Ceny za sekundę to 0,03 dolara dla 360p, 0,10 dolara dla 720p, 0,15 dolara dla 1080p i 0,30 dolara dla 4K. Omni 1.1 jest dostępne przez Google AI Studio i dokumentację dla deweloperów.
Google’s Gemini Omni 1.1 Flash makes AI video generation cheaper and more flexible →
Badanie Wharton: agenci zakupowi AI są niespójni i podatni na manipulację
Naukowcy z Wharton School na Uniwersytecie Pensylwanii przetestowali, jak spójnie agenci zakupowi AI rekomendują produkty, gdy zmienia się proces wyszukiwania. Zbadali sześć modeli, od wariantów mini po modele graniczne, każąc im wybrać zegarek fitness z ustalonej siatki produktów. Użyli symulatora ACES, który pokazuje agentowi zrzut ekranu strony produktu, a agent analizuje obraz, opcjonalnie korzysta ze źródeł rekomendacji i wybiera produkt. Nawet bez źródeł zewnętrznych modele wykazywały różne preferencje bazowe. Gdy agent zobaczył jedno zewnętrzne źródło przed stroną produktu, rekomendacje zmieniały się dramatycznie. Wirecutter miał najsilniejszy wpływ: prawdopodobieństwo wyboru Fitbit Inspire 3 wzrosło o 90 punktów procentowych dla Claude Opus 4.8 i o 99 punktów dla Gemini 3.5 Flash. W drugim eksperymencie agenci widzieli kombinacje dwóch lub trzech źródeł, ale nie zrównoważyły one rekomendacji, a więcej źródeł zwiększyło zmienność. W trzecim badaniu agenci otrzymywali te same źródła w różnej kolejności, a wyniki się różniły — Gemini 3.1 Flash Lite był najbardziej wrażliwy na kolejność, z wahaniami od 2 do 56 punktów procentowych, podczas gdy Claude Haiku 4.5 pozostał stabilny na poziomie 41-42 punktów. W czwartym eksperymencie badacze dodali produkt obiektywnie lepszy na każdej mierzonej płaszczyźnie: smartwatch z Alexą za 29,99 dolara z oceną 5,0 i 430 recenzjami, podczas gdy inne kosztowały co najmniej 359 dolarów. Dodanie krótkich deklaracji pamięci użytkownika, jak uwielbiam wędrówki, przesuwało wybory kilku modeli w stronę droższych produktów mimo obiektywnie lepszej opcji. Dla kupujących oznacza to, że powierzenie AI zakupów nie gwarantuje spójnych ani optymalnych decyzji, a dla sprzedawców optymalizacja pod zakupy AI będzie trudniejsza niż tradycyjne SEO.
AI shopping agents aren’t ready to buy on your behalf, study finds →
Anthropic wprowadza standard MHS, by agenci AI sterowały fizycznym sprzętem
Anthropic zaprezentowało nowy standard sprzętowy Model Context Hardware, czyli MHS, zaprojektowany tak, by agenci AI mogli kontrolować fizyczne urządzenia. Firma zademonstrowała go na przykładzie modelu takiego jak Claude, który reguluje laser, sprawdza wyniki przez osobną kamerę i powtarza proces, by skalibrować system. MHS może też pozwolić modelowi na ustawianie ostrości mikroskopu, analizę wyników i automatyczne przesuwanie mikroskopu w celu kontynuowania eksperymentu. W nagraniu Claude rozumował, jak nakłonić ramię robota do podniesienia puszki aluminiowej bez wcześniejszego treningu w tym zakresie. Standard obejmuje ustandaryzowany system tagów kodujących fizyczne cechy urządzeń, takie jak waga i zakres ruchu ramienia robota, a także regulowane parametry, opcje pomiaru i wymuszone limity bezpieczeństwa. Tagi można zintegrować z plikiem referencyjnym, który dostarcza modelowi informacji o urządzeniu, którego wcześniej nie znał. Anthropic współpracuje z pierwszą grupą laboratoriów badawczych i producentów w okresie testów MHS, w tym z Amazon Web Services, Hugging Face, Raspberry Pi, Automata i Universal Robots. Plan zakłada, że MHS stanie się otwartym i niezależnym od agentów standardem integracji AI z systemami fizycznymi. W testach z partnerami naukowymi MHS skrócił czas integracji urządzeń, co pozwala szybciej iterować w warunkach eksperymentalnych.
Anthropic’s new hardware standard lets AI agents control the physical world →