AI
HeadFlash: AI w liczbach — kosztowne błędy, superaplikacje i tanie modele
Amazon przepala miliony na Claude, Microsoft łączy Copiloty w superaplikację, a MCP przechodzi gruntowną modernizację. Oto najważniejsze wiadomości ze świata AI.
Amazon przepłaca za Claude: wewnętrzne raporty ujawniają kosztowne błędy w projektach AI
Wewnętrzne raporty Amazon ujawniają poważne problemy z kontrolą kosztów w projektach AI. Firma przypadkowo wydała 1,8 miliona dolarów na model Claude Sonnet, który miał dopasowywać dane autorów do ofert na Amazon, co stanowi wzrost o 860 procent ponad przyznany budżet. Problem wykryto dopiero po około pięciu miesiącach od jego rozpoczęcia. Inne przekroczenia to 541 tysięcy dolarów na narzędzie do audytu finansowego i 134 tysiące dolarów na system optymalizacji czasu dostaw w logistyce. Amazon w wewnętrznej prezentacji, cytowanej przez Financial Times, broni się, że eksperymentowanie z nową technologią wiąże się z nauką i doskonaleniem procesów, a wybiórcze przykłady nie odzwierciedlają ogólnego obrazu. Warto jednak zauważyć, że koszty te stanowią mniej niż 0,1 procenta miesięcznych przychodów firmy, która w ostatnim kwartale zarobiła ponad 181 miliardów dolarów. Wcześniej AWS zmagało się z awariami wywołanymi przez boty kodujące AI, które naprawiono, ograniczając ich uprawnienia. W branży rośnie też problem z modelami rozliczania, które powodują, że firmy zużywają roczne budżety w kilka tygodni.
Microsoft łączy wszystkie Copiloty w jedną superaplikację AI
Microsoft ogłosił konsolidację swoich różnych ofert Copilot w jedną superaplikację, która połączy czat, kodowanie, narzędzie badawcze Cowork oraz nowe autonomiczne agenty, nazwane Autopilotami. Aplikacja ma obsługiwać zarówno użytkowników konsumenckich, jak i biznesowych, a jej premiera planowana jest na ten rok. Dyrektor generalny Satya Nadella potwierdził plany podczas rozmowy o wynikach kwartalnych, podkreślając, że Copilot ewoluuje od czatu do Cowork i autopilotów, a ich połączenie to duży krok naprzód. Firma raportuje, że liczba płatnych miejsc Copilot przekroczyła 30 milionów, a tygodniowe zaangażowanie dorównuje Outlookowi i Teams. To jednak wciąż ułamek z około 450 milionów klientów biznesowych Microsoftu. Firma wcześniej mierzyła się z buntem użytkowników w związku z pływającym przyciskiem Copilot w Office, który musiała pozwolić ukrywać, a sam Copilot był celem ataków prompt injection. Mimo to, rozwój chmury i Copilota przyczynił się do wzrostu akcji spółki, a superaplikacja oparta na infrastrukturze Copilot Cowork stała się flagowym zakładem AI.
Microsoft is merging its many Copilots into one AI ‘super app’ | The Next Web →
Nowa specyfikacja MCP: bezstanowa przebudowa dla skalowania w przedsiębiorstwach
Model Context Protocol (MCP) doczekał się nowej specyfikacji, która wprowadza bezstanową przebudowę mającą uprościć wdrożenia na skalę przedsiębiorstw. To istotna zmiana w fundamentach protokołu, który pierwotnie był zaprojektowany do pracy na lokalnej maszynie, łącząc modele z lokalnymi aplikacjami. Nowa wersja wprowadza także politykę deprecjacji, gwarantującą co najmniej 12 miesięcy między oficjalnym wycofaniem funkcji a jej faktycznym usunięciem, z wąskim wyjątkiem dla krytycznych aktualizacji bezpieczeństwa. MCP jest zarządzany przez Agentic AI Foundation (AAIF) działającą pod egidą Linux Foundation. Protokół został pierwotnie wprowadzony przez Anthropic prawie dwa lata temu i choć firma ta nadal ma znaczący wpływ na jego kierunek, to w projekcie uczestniczą także OpenAI, Google, Microsoft i Amazon. Ostateczna odpowiedzialność spoczywa jednak na indywidualnych opiekunach, z których część pracuje obecnie w Anthropic. Nowa specyfikacja ma uczynić MCP bardziej atrakcyjnym dla dużych organizacji.
With a stateless makeover, new MCP spec targets enterprise scale | Ars Technica →
Microsoft stawia na tanie, wyspecjalizowane modele zamiast ścigać się o miano najlepszego
Microsoft AI zmienia strategię, stawiając na efektywność tokenów i małe, wyspecjalizowane modele zamiast ogólnych modeli granicznych. Dyrektor AI Mustafa Suleyman podkreśla, że branża musi ważyć najwyższą wydajność przeciwko kosztom. Zamiast jednego uniwersalnego modelu, firma trenuje kompaktowe modele dla pojedynczych dziedzin. Najnowszy model cyberbezpieczeństwa, MAI-Cyber-1-Flash, przewyższa model Mythos od Anthropic o 12 punktów procentowych w benchmarku CyberGym przy połowie kosztów, ale wymaga to systemu MDASH, który orkiestruje kilka modeli i nadal kieruje trudne zadania do modeli rozumujących OpenAI. Microsoft twierdzi również, że model MAI-Image-2.5-Flash obniża koszty GPU nawet o 84 procent w porównaniu z GPT-Image-2. Suleyman chce, aby wymienne modele uchroniły Microsoft przed uzależnieniem od jednej rodziny modeli. Konkurencja przesuwa się jednak z pojedynczych modeli na oprogramowanie typu harness, które kieruje zadaniami i dostarcza kontekst. Orkiestratorzy wysyłają większość pracy do tańszych specjalistów, a modele graniczne rezerwują dla trudnych przypadków. To podejście zastosowały już Anthropic w modelu Claude Fable 5 i Sakana w modelu Fugu.
Microsoft AI bets on cheap specialist models instead of chasing the frontier | The Decoder →
OpenAI i Anthropic apelują do rządu USA o pomoc w ustaleniu tempa rozwoju AI
OpenAI i Anthropic, dwaj czołowi gracze na rynku sztucznej inteligencji, poparli list wzywający rząd Stanów Zjednoczonych do pomocy w ustaleniu tempa rozwoju tej technologii. List, który został oficjalnie poparty przez obie firmy, wzywa administrację USA do odegrania aktywnej roli w określaniu szybkości postępu w dziedzinie AI. To rzadki przypadek, gdy konkurencyjne firmy łączą siły, aby zaapelować do władz o interwencję w kształtowaniu polityki technologicznej.
OpenAI, Anthropic Endorse Letter Asking US to Help Pace AI Development | The Information →