HeadFlash

AI

Badania: kompresja kontekstu gubi polecenia użytkownika

Systemy AI przy kompresji tracą 83% ograniczeń sesji; biuro legislacyjne Izby Reprezentantów tonie w projektach ustaw pisanych przez AI.

Posłuchaj

Wydanie opracowane przy pomocy sztucznej inteligencji. Tekst i lektor wygenerowane automatycznie.

Naukowcy: kompresja kontekstu w AI gubi większość poleceń użytkownika

Naukowcy z Penn State zbadali, które szczegóły giną, gdy systemy AI kompresują kontekst rozmowy. Największe straty dotyczą ograniczeń sesji, czyli zasad narzuconych przez użytkownika, takich jak potwierdzanie zmian przed ich wprowadzeniem. Systemy kompresji skupiają się na ciągłości zadania, a poboczne warunki użytkownika są pomijane, co prowadzi do problemów z jakością i bezpieczeństwem, w tym nieautoryzowanych wywołań narzędzi i pomijania wymaganej weryfikacji.

Zestaw ewaluacyjny COMPINT pokazał, że średnio tylko 17 procent ograniczeń sesji przetrwa kompresję. Większość testowanych kompresorów działa gorzej niż brak kompresji, a zgodność z regułami po kompresji spada do poziomu bliskiego brakowi ograniczeń. Rozwiązaniem jest moduł oparty na Qwen3.5-9B, który wykrywa ograniczenia i dołącza je do podsumowania, osiągając ponad 90 procent skuteczności w trzech scenariuszach, bez konieczności treningu czy zmian w systemie kompresji. Zestaw COMPINT i moduł są dostępne na GitHubie.

AI systems quietly drop user instructions when they compress context →

Biuro legislacyjne Izby Reprezentantów przytłoczone projektami ustaw pisanych przez AI

Biuro Radcy Legislacyjnego Izby Reprezentantów zmaga się z lawiną projektów ustaw tworzonych przez AI, takich jak Claude i ChatGPT. Jak ujawnił Politico, pracownicy biura spędzają więcej czasu na poprawianiu tekstów wygenerowanych przez AI niż na pisaniu ich od zera. W 118. Kongresie biuro przygotowało 30 494 ustaw, czyli o 188 procent więcej niż faktycznie wprowadzonych, a liczba wniosków wzrosła o 72 procent w pierwszych 60 dniach obecnego Kongresu.

Eksperci wskazują, że AI nie rozróżnia subtelności prawnych, takich jak ulga podatkowa od odliczenia, i może wykluczać całe grupy z programów federalnych. Biuro testuje Microsoft Copilot, ale sami prawnicy nie mogą używać komercyjnych narzędzi AI. Mimo to żadna ustawa przegłosowana przez izby nie została w całości napisana przez AI, a korzystanie z tych narzędzi wciąż jest tematem tabu. Były szef biura Wade Ballou podkreśla, że AI nie zastąpi sztuki tworzenia prawa, a skala problemu może się jeszcze zwiększyć.

AI-drafted bills are swamping the House office that writes US laws →

JAMA: autonomiczna AI może być lepsza od lekarzy z asystą, nie wymuszajmy człowieka w pętli

Artykuł w czasopiśmie JAMA argumentuje, że autonomiczna AI wkrótce przewyższy połączenie lekarza z AI w rozumowaniu medycznym, wzywając regulatorów do niestanowienia obowiązkowego nadzoru człowieka. Autorzy, w tym bioetyk Ezekiel Emanuel i dyrektor generalny Curai Health Neal Khosla, wskazują, że w badaniach od 2024 roku sama AI dorównuje lub bije lekarzy w pięciu kluczowych zadaniach, a system Google AMIE uzyskał wyższe wyniki w symulowanych rozmowach.

Autorzy przewidują, że gdy maszyna wyraźnie wyprzedzi człowieka, lekarz sprawdzający jej pracę stanie się źródłem błędów. Metaanaliza 106 eksperymentów pokazała, że przy lepszej AI człowiek pogarsza wyniki, a w badaniu z prawdziwymi przypadkami GPT-4 sam osiągnął 92 procent, podczas gdy lekarze z tym samym modelem tylko 76 procent. Przyznają jednak ograniczenia: dowody pochodzą z symulacji, a procedury fizyczne pozostaną w rękach ludzi.

As AI beats doctors, regulators shouldn’t force a human into the loop, JAMA piece says →

ByteDance wbudował agenta w stylu Codex w klienta Doubao na PC

ByteDance zintegrował z klientem Doubao na PC funkcje agenta w stylu Codex, w tym przeglądarkę z logowaniem, sterowanie GUI, zdalne zadania z telefonu na komputer oraz chmurowe komputery. Doubao ma 382 miliony aktywnych użytkowników miesięcznie, co daje mu pierwszą pozycję wśród chińskich aplikacji AI. W testach agent sam porównał produkty na JD.com, tworzył ankiety na Tencent Surveys i wypełniał formularze, działając w pełni autonomicznie.

Klient oferuje łączniki do Feishu i Tencent Meeting, a także umiejętności pozwalające utrwalać sprawdzone procesy. Użytkownicy mogą planować powtarzalne zadania, a Seedance 2.5 dochodzi w pakiecie z limitami członkostwa. Autor testu radzi, by nie pozwalać agentom na automatyczne operacje na wrażliwych platformach, a GUI traktować jako ostateczność, preferując łączniki i interfejsy CLI.

ByteDance’s Doubao PC Client Has Quietly Become a Codex-Style Agent — GUI Control, Remote Tasks, and Cloud Computers →

Nowy benchmark Artificial Analysis porównuje API wyszukiwarek dla agentów AI

Artificial Analysis opublikował benchmark Search Index, mierzący jakość, koszt i szybkość dostawców API wyszukiwarek dla agentów AI. W pierwszej serii znalazły się Parallel, Exa, Firecrawl, You.com, Tavily, Keenable i Brave. Testy przeprowadzono z tym samym modelem GPT-5.6 Luna w ustandaryzowanym środowisku, gdzie agent wykonywał 25 prób na zadanie, a wyniki połączono z trzech benchmarków, w tym DeepSearchQA i BrowseComp.

Bez dostępu do wyszukiwarki model uzyskał 33 punkty, a z nią od 65 do 75. Lepsza jakość wyszukiwania obniża koszty, bo model zużywa mniej tokenów. Parallel Search zaawansowany zmniejszył zużycie tokenów o ponad 40 procent, a całkowity koszt spadł z 0,11 do 0,084 dolara. Szybkość pojedynczego zapytania nie zawsze przekłada się na szybsze wyniki, a najlepszy stosunek kosztów do wydajności osiągają Parallel, Firecrawl i Parallel w trybie turbo.

New benchmark ranks search APIs for AI agents on quality, cost, and speed →