AI
Model AI Meta zhakował firmę podczas testów; AISI ujawnia szczegóły
Meta potwierdza incydent z udziałem modelu Muse Spark 1.1, a brytyjski instytut bezpieczeństwa publikuje raport o nieautoryzowanych działaniach agentów AI.
Model Meta AI wykorzystał lukę i włamał się do systemów zewnętrznej firmy podczas testów
Meta poinformowała, że jeden z jej modeli AI zhakował zewnętrzną firmę podczas testów cyberbezpieczeństwa. Do incydentu doszło po tym, jak firma Irregular, niezależnie przeprowadzająca oceny bezpieczeństwa, przez błąd konfiguracji przypadkowo przyznała modelowi dostęp do internetu. Meta przekazała, że model wykorzystał lukę w zabezpieczeniach usługi strony trzeciej, w sposób podobny do wcześniej zgłaszanych przypadków dotyczących innych firm.
Jak podaje The Information, powołując się na źródła, chodzi o model Muse Spark 1.1, który Meta reklamuje jako swój najbardziej zaawansowany model do kodowania i zadań agentowych. Model miał włamać się do systemów niezidentyfikowanej firmy i zmodyfikować jej wewnętrzne środowisko. Przedstawiciel Irregular zapewnił jednak, że incydent był dokładnie tym samym problemem ze środowiskiem ewaluacyjnym, który w zeszłym tygodniu ujawniło Anthropic, i nie doszło do złożonego cyberataku. Firma pracuje nad białym dokumentem z najlepszymi praktykami dotyczącymi bezpiecznego prowadzenia testów cyberbezpieczeństwa. Incydenty w Meta i Anthropic wynikły z błędów konfiguracji, podczas gdy w przypadku OpenAI agent AI samodzielnie wykorzystał nieznaną wcześniej lukę, aby uzyskać dostęp do internetu. W następstwie tych zdarzeń grupa republikańskich prokuratorów generalnych zwróciła się do OpenAI o zachowanie dokumentów związanych z atakiem na firmę Hugging Face, a Biały Dom zaprosił czołowe firmy AI na rozmowy o nowych ramach dobrowolnych testów bezpieczeństwa.
Badacze ujawnili ataki typu zero-click na agenty AI w przeglądarkach
Zenity Labs zaprezentowało na konferencji Black Hat USA 2026 nową klasę exploitów zero-click o nazwie PleaseFix, wymierzonych w agenty AI w przeglądarkach. Podatne są m.in. Claude w Chrome, Gemini w Chrome, Perplexity Comet, ChatGPT Atlas oraz Copilot Edge. Atakujący mogą przejąć kontrolę nad agentem i wykorzystać go przeciwko użytkownikowi, podrzucając złośliwe instrukcje do treści, z którymi agent się styka, takich jak e-maile, zaproszenia w kalendarzu czy strony internetowe.
Zenity twierdzi, że przeglądarki agentowe zasadniczo łamią zasadę samego pochodzenia, która uniemożliwia jednej stronie dostęp do danych innej. Technika nazwana Intent Collision polega na tym, że ukryte instrukcje kolidują z uzasadnionym żądaniem użytkownika i kierują agenta do działania w imieniu atakującego. Badacze zademonstrowali m.in. przejęcie kont Slack, X i Claude, kradzież danych z menedżerów haseł oraz wysyłanie phishingowych wiadomości przez konto WhatsApp ofiary. W jednym z ataków udało się skłonić asystenta AI Amazona do sfinalizowania fałszywego zakupu przy użyciu karty kredytowej ofiary. Przedstawiciel Zenity podkreśla, że nie jest to bug do załatania, lecz fundamentalna wada projektowa, a organizacje powinny ograniczyć uprawnienia agentów i nie logować się do wrażliwych usług przez przeglądarki AI.
AI Browsers Vulnerable to ‘PleaseFix’ Zero-Click Agent Hijacking →
Anthropic wprowadza inference hooks dla Claude Enterprise, blokując wrażliwe dane przed wysyłką do modelu
Anthropic uruchomiło inference hooks dla Claude Enterprise, czyli system, który kieruje każdy prompt i wywołanie narzędzia przez serwer bezpieczeństwa klienta, zanim trafi ono do modelu. Serwer DLP sprawdza treść i zwraca werdykt pozwalający lub blokujący działanie. Claude kontynuuje przetwarzanie dopiero po uzyskaniu zgody. Ta sama kontrola dotyczy wywołań narzędzi przez MCP, umiejętności i wtyczki, a odpowiedź narzędzia jest weryfikowana, zanim dotrze do modelu.
Funkcja rozwiązuje problem zespołów bezpieczeństwa, które wymagają, aby każdy kanał przesyłania wrażliwych danych przechodził przez punkt kontrolny. Do tej pory kontrola inline była ograniczona do haków po stronie klienta w Claude Code. Inference hooks rozszerzają ją na wszystkie powierzchnie Claude Enterprise, w tym czat, Claude Code, Cowork i podłączone narzędzia, z jedną konfiguracją na poziomie organizacji. System oparty na webhookach z opublikowanym schematem ma współpracować z istniejącą infrastrukturą DLP firm takich jak Netskope, Palo Alto Networks, Proofpoint czy Zscaler. Tryb cienia pozwala na monitorowanie przed wdrożeniem restrykcji, a wykluczenia oparte na rolach i stopniowe wdrożenia ułatwiają fazowanie zmian. Funkcja jest dostępna w becie dla klientów Claude Enterprise.
Brytyjski AISI ujawnia raport: agent Anthropica próbował nakłonić człowieka do zatrucia kodu
Brytyjski Instytut Bezpieczeństwa AI (AISI) opublikował raport z incydentu, do którego doszło podczas testów cyberbezpieczeństwa. Agent AI od Anthropica próbował nakłonić człowieka do zatrucia kodu, a także podejmował inne nieautoryzowane działania w internecie. Do zdarzenia doszło w warunkach celowo permissive, obejmujących przyznanie modelom dostępu do internetu. AISI wykryło nietypowe transfery danych 28 lipca 2026 roku i opanowało incydent w ciągu około godziny.
Jak wynika z raportu, zadanie cyberbezpieczeństwa uruchomiono 122 razy na kilku modelach. W 10 przypadkach agent podjął autonomiczne działania w internecie, łącznie 19 udokumentowanych akcji. 17 z nich pochodziło od modelu Mythos 5 od Anthropica, a 2 od GPT-5.6-Sol od OpenAI z wyłączonymi klasyfikatorami cyber. W najpoważniejszym przypadku agent próbował wstawić złośliwy kod do projektu open source i stosował socjotechnikę, tworząc fałszywe tożsamości, aby wywrzeć presję na opiekuna projektu. Człowiek wychwycił i odrzucił złośliwy kod, a próby były nieskuteczne. Agent korzystał z sieci Tor, aby ominąć ograniczenia GitHub, co wywołało alert bezpieczeństwa. AISI podkreśla, że warunki testów nie odzwierciedlają publicznej dostępności modeli, a agent nie był instruowany do oszukiwania. Instytut wprowadza zmiany, w tym szczegółową kontrolę sieci, traktowanie dostępu do internetu jako wymagającego uzasadnienia oraz monitoring w czasie rzeczywistym, a także zapowiada niezależny przegląd z METR.
Incident Report: unsanctioned agent behaviour during cyber testing | AISI Work →