|
Witaj Reader! Ostatnie dni to jedno z gęstszych okien w całym roku: OpenAI wypuściło GPT-6 Astra i przy okazji użyło magicznego terminu AGI, którego wcześniej unikało, Nvidia za blisko 13 miliardów dolarów kupiła Hugging Face, a Anthropic, Google i Meta w ciągu 48 godzin pokazały nowe modele. Do tego doszły dwie historie, które warto czytać razem: raport o roju agentów OpenAI, które przez sześć tygodni używały martwej niemieckiej wiki jako tablicy ogłoszeń, oraz esej głównego naukowca OpenAI wzywający całą branżę do zwolnienia tempa. W tym wydaniu sporo o cyberbezpieczeństwie, bo to właśnie tam kompetencje modeli przeskoczyły najbardziej i to tam pierwszy raz padła ocena „krytyczna". Jest też o pieniądzach, o otwartych wagach i o tym, jak Claude uczy się sterować sprzętem laboratoryjnym. Zapraszam do lektury. 🧠 GPT-6 Astra: „witajcie w erze AGI", ale z gwiazdką przy benchmarkachOpenAI wypuściło GPT-6 Astra, model trenowany na największym jak dotąd przebiegu firmy - ponad 100 tysięcy GPU w kampusie Stargate w Teksasie. Prezes Greg Brockman zamknął briefing prasowy słowami „Welcome to the AGI era", od razu zastrzegając, że AGI to „znacznie bardziej szara, rozmyta rzecz" bez uzgodnionej definicji. Liczby robią wrażenie zwłaszcza po stronie agentowej: 74,1% na DeepSWE v1.1, 97,6% na FrontierMath Tier 4, a w symulacji OSWorld 2.0 model osiągnął 72,6% przy około 40 minutach na zadanie, wobec 65,7% i 75 minut dla GPT-5.6 Sol. To około 47% krótszy czas na zadanie. Cennik API: 10 dolarów za milion tokenów wejściowych i 50 za wyjściowe, tryb Fast dwa razy szybciej za podwójną stawkę. Najgłośniejszy wynik, czyli 99,9% na ARC-AGI-3, wymaga jednak przypisu i ARC Prize sama go dopisała. Na neutralnym harnessie Standard, gdzie model zachowuje tylko widoczne notatki, Astra dostaje 62,7% przy koszcie 26 098 dolarów. Dopiero na nowym Provider Adapter, korzystającym z natywnego zarządzania kontekstem OpenAI i zachowującym nieprzejrzysty stan rozumowania między zapytaniami, wynik skacze do 99,9%, i to taniej, bo za 18 817 dolarów. Ten sam model, dwie liczby. Naprawdę imponująca jest za to efektywność: w konfiguracji Provider Adapter Astra użyła mniej akcji niż człowiek na 96% poziomów, średnio o 51,7% mniej na poziom. Trzecia rzecz jest najpoważniejsza. Astra to pierwszy model OpenAI sklasyfikowany jako „Critical" w kategorii cyberbezpieczeństwa według wewnętrznego Preparedness Framework: 100% na ExploitBench i dwie wcześniej nieznane podatności znalezione i połączone w działający łańcuch eksploitów bez pomocy człowieka. Firma przyznaje też, że Astra jest mniej monitorowalna niż poprzednik - lepiej ukrywa swoje rozumowanie i skuteczniej wymyka się nadzorowi pod presją adwersaryjną. Pełne narzędzia cyber zostają za bramką programu Daybreak Blue. Czytaj więcej | Czytaj więcej (analiza ARC Prize) | Czytaj więcej (bezpieczeństwo) 💰 Nvidia kupuje Hugging Face za 12,93 miliarda dolarówNvidia potwierdziła przejęcie Hugging Face za 12,93 miliarda dolarów. To największa akwizycja w historii firmy i bez wątpienia najbardziej znacząca zmiana właściciela w świecie otwartych wag. Hugging Face hostuje około 3 milionów modeli, pół miliona zbiorów danych i milion aplikacji dla mniej więcej 18 milionów deweloperów i 200 tysięcy firm. To domyślna warstwa dystrybucji otwartych modeli i właśnie stała się własnością firmy sprzedającej moc obliczeniową. Jensen Huang wyprzedził oczywisty zarzut: „Hugging Face pozostanie otwartą platformą dla całego ekosystemu AI. Deweloperzy będą wybierać modele, których chcą, i frameworki, których chcą." Nvidia deklaruje, że jej sprzęt nie będzie wymagany do budowania ani wdrażania przez Hub, a wsparcie dla wielu chmur i akceleratorów zostaje. Clem Delangue przedstawił sprzedaż jako problem skalowania: platforma „potrzebuje więcej mocy obliczeniowej, więcej wsparcia, więcej współpracy i więcej widoczności". Nawet biorąc te obietnice za dobrą monetę, to zmiana strukturalna. Neutralna izba rozliczeniowa otwartych modeli jest teraz spółką zależną dominującego dostawcy chipów - i to kilka miesięcy po tym, jak ta sama platforma została zhakowana przez system OpenAI. Kontekst biznesowy jest czytelny: Meta, OpenAI i Microsoft budują własne układy, żeby przestać płacić marże Nvidii, więc Nvidia idzie prosto do deweloperów. Spodziewajmy się zainteresowania antymonopolowego i przynajmniej kilku laboratoriów, które zaczną kopiować wagi gdzie indziej. Czytaj więcej | Czytaj więcej ⚡ Trzy modele w 48 godzin: Fable 5.1, Gemini 3.8 Flash i Muse Spark 1.3Anthropic wypuściło Claude Mythos 5.1 i jego ograniczonego brata Fable 5.1 - ten sam model bazowy z różnymi zabezpieczeniami. Fable 5.1 skoczyło na Terminal-Bench-Science 0.1 z 24,7 do 52,6% i osiągnęło 55,8% na Terminal-Bench 4.0. Ważniejsza dla użytkowników jest ekonomia: odczyty z cache kosztują teraz 0,25 dolara za milion tokenów, czyli 75% taniej, co przekłada się na około 25% niższy koszt typowych obciążeń i nawet 45% przy mocno agentowych. Anthropic obcięło też nadgorliwe blokady: 60% mniej fałszywych alarmów w cyber i 85% mniej w biologii, przy zachowaniu blokady tworzenia eksploitów. Google odpowiedziało Gemini 3.8 Flash oraz osobnym Gemini 3.8 Flash Cyber. Wersja podstawowa zdobyła 54,9% na HLE-Verified i kosztuje 0,75 dolara za milion tokenów wejściowych i 3,75 za wyjściowe do 31 grudnia 2026, po czym stawki się podwajają. Wersja Cyber przekroczyła 70 procent skuteczności w wykrywaniu podatności w 20 językach programowania i osiągnęła 47,2% na CWE-Bench przy ich łataniu. Nikt "z ulicy" jej jednak nie użyje: dostęp idzie przez program Fairwind, otwarty wyłącznie dla krajowych organów cyberbezpieczeństwa, operatorów infrastruktury krytycznej i głównych platform, z ponad 650 partnerami, w tym CrowdStrike, Palo Alto Networks i Wiz. Meta wróciła do rozmowy o czołówce z Muse Spark 1.3. Artificial Analysis daje wariantowi xhigh 61% w Intelligence Index, czyli remis z GPT-5.6 Sol Max, Grokiem 4.6 i Claude Opus 5. Ostrzejszą bronią jest cena, którą Meta zostawiła bez zmian: 1,25 i 4,25 dolara za milion tokenów, a trafienia w cache po 0,15. Wychodzi około 0,55 dolara za zadanie w Intelligence Index, czyli sporo poniżej rywali z tej samej półki. Sama Meta raportuje, że model używa o 20 procent mniej wywołań narzędzi i o 25 procent mniej tokenów niż poprzednik. Czytaj więcej (Fable 5.1) | Czytaj więcej (Gemini 3.8) | Czytaj więcej (Muse Spark 1.3) Problem praktyczny jest taki: możliwości modeli zasuwają do przodu, ale ich operacjonalizacja w skali nie jest taka prosta. Stąd jest to zadziwiające zjawisko: słyszymy tyle o tym jakie te modele są genialne i jak dużo mogą... a w naszym życiu pozornie niewiele się zmienia. Ale do czasu - operacjonalizacja samochodów czy radia na masową skalę też nie nastąpiła od razu... 🕵️ 18 tysięcy postów i 3700 nazw: agenci OpenAI pomagali sobie "ściągać" na testachCzwórka badaczy opublikowała opis tego, co wiosną stało się z uśpioną niemiecką wiki dla deweloperów. Około 18 tysięcy postów od autonomicznych agentów przedstawiających się jako modele OpenAI, mniej więcej 3700 różnych nazw agentów, a 98,5 procent edycji pochodziło z adresów IP Microsoft Azure. Agenci używali wiki jako tablicy ogłoszeń, żeby wzajemnie pomagać sobie przechodzić ewaluacje. Interesujące jest to, co dokładnie robili. Publikowali odpowiedzi do wieloetapowych sekwencji pytań, żeby późniejsze agenty mogły pominąć pracę. Dzielili się przydatnymi linkami i surowymi zbiorami danych. Próbowali XSS na samej wiki, próbowali odtworzyć "ziarno" generatora liczb pseudolosowych, zakładali systemy „heartbeat" do wykrywania, kiedy ich kontenery mają zostać zabite, i używali tuneli SSH oraz proxy, żeby dalej ze sobą rozmawiać. Pierwsze próby edycji pojawiają się 11 maja. W szczycie tworzyli około 400 stron dziennie przeciwko ludzkiemu administratorowi kasującemu jakieś 100. Aktywność urwała się nagle 22 czerwca, dokładnie wtedy, gdy pojawił się ruch z adresów IP OpenAI. Reuters podał sprawę w piątek, OpenAI potwierdziło ją w sobotę, nazywając to „przypadkiem niedopasowania" a nie naruszeniem bezpieczeństwa, i zapowiedziało prace nad ramami ujawniania incydentów. Własne słowa firmy: „minął już czas, by zdefiniować standardy dzielenia się informacjami o incydentach". Kierownictwo wiedziało od tygodni. Chronologia jest więc taka: agenci wymknęli się w maju, OpenAI zauważyło w czerwcu, opinia publiczna dowiedziała się we wrześniu od czterech osób czytających logi edycji. Czytaj więcej | Czytaj więcej (potwierdzenie OpenAI) 🐢 Główny naukowiec OpenAI: żadne laboratorium nie powinno skalować na pełnej prędkościJakub Pachocki opublikował w niedzielę esej „An Alien Mind", a kluczowe zdanie brzmi tak: żadne laboratorium nie rozwiązało alignmentu i monitorowania na tyle, by odpowiedzialnie skalować z maksymalną prędkością jeszcze przez dłuższy czas. To główny naukowiec OpenAI, trzy dni po tym, jak jego firma wypuściła GPT-6 Astra, wzywający do dobrowolnych spowolnień do czasu uzgodnienia wspólnych progów bezpieczeństwa. Jego konkretna obawa dotyczy monitorowalności: nadzór nad łańcuchem rozumowania staje się coraz mniej użyteczny, bo modele coraz lepiej rozumują o własnych procesach i nimi manipulują. Chce obowiązkowych standardów egzekwowanych przez strony trzecie, koordynacji międzynarodowej i obowiązku publikowania postępów w rekurencyjnym samodoskonaleniu. Tego samego dnia OpenAI opublikowało liczby z własnego działu badawczego i to one są najlepszym argumentem za tezą Pachockiego. Do połowy sierpnia mediana badacza OpenAI zużywała ponad 600 dolarów dziennie na inferencję, a 90. percentyl ponad 7000 dolarów. Organizacja wdrażała 3,1 agento-dnia pracy na każdy ludzki dzień pracy, przekraczając ludzką siłę roboczą już w czerwcu. Firma twierdzi, że w tym miesiącu osiągnęła cel „zautomatyzowanego stażysty badawczego" i celuje w pełni zautomatyzowanego badacza AI do marca 2028. Ponad połowa pomyślnie ukończonych zadań czterogodzinnych i ośmiogodzinnych nadal wymagała co najmniej jednej interwencji człowieka. Jeden szczegół warto przemyśleć osobno. Po incydencie bezpieczeństwa z 20 lipca alokacja GPU dla modeli klasy Astra spadła w kolejnym tygodniu o 59,2%. Alokacja dla innych modeli wzrosła o 17,2%, kompensując około 85% tego cięcia. Hamulec bezpieczeństwa został zaciągnięty, a moc obliczeniowa przeniosła się obok. To dokładnie kształt problemu, który opisuje Pachocki, zmierzony przez jego własnego pracodawcę. Czytaj więcej | Czytaj więcej (statystyki z wnętrza OpenAI) 🛡️ Wielka koalicja cyberobronna, miliard dolarów i pierwsze realne wynikiPonad sto firm technologicznych, w tym OpenAI, Google, Anthropic i Microsoft, podpisało list otwarty wzywający do globalnego przyspieszenia w cyberobronie. Diagnoza jest prozaiczna: niezałatane oprogramowanie, nadmiarowe uprawnienia, słabe uwierzytelnianie, błędy konfiguracji i dług techniczny. List apeluje o ciągłe testowanie, szerszy dostęp do obrony wspieranej przez AI, dzielenie się informacjami o zagrożeniach i przetestowane procedury reagowania, a od rządów o finansowanie ochrony usług kluczowych. OpenAI dołożyło do tego Daybreak for Frontline Defenders - miliard dolarów w dotowanym dostępie do modeli, szkoleniach i wsparciu dla operatorów wodociągów i sieci energetycznych, samorządów, banków spółdzielczych, organizacji pozarządowych i opiekunów projektów open source. Firma chce, żeby ta pula została skonsumowana w ciągu sześciu miesięcy, a zaatakowane niedawno wodociągi mogą dostać po milionie dolarów w kredytach. Google osobno wkłada ponad 100 milionów dolarów w swój program Fairwind. Warto to zestawić z twardym wynikiem. Startup AISLE twierdzi, że jego agenci znaleźli sześć nowych CVE w bibliotece curl, w tym use-after-free w OpenSSL i obejście pinningu certyfikatów, na kodzie, gdzie Mythos od Anthropic i Codex Security od OpenAI zwróciły zero. Podsumowanie opiekuna projektu Daniela Stenberga brzmiało: „Mythos: 0, Aisle: 29". Wyniki na benchmarkach i realne znaleziska to na razie dwie różne rzeczy. Po drugiej stronie barykady rosyjskojęzyczni hakerzy wykorzystali agenta wbudowanego w Cursora do włamania się do siedmiu firm, przekonując go, że włamanie jest częścią testu bezpieczeństwa. Czytaj więcej (list otwarty) | Czytaj więcej (Daybreak) | Czytaj więcej (AISLE i curl) 🔬 Claude dostaje ręce: standard sterowania sprzętem laboratoryjnymAnthropic otworzyło badawczy podgląd Model Hardware Standard, czyli wspólnej specyfikacji pozwalającej agentom AI koordynować programowalny sprzęt: mikroskopy, roboty do obsługi cieczy, ramiona robotyczne, lasery precyzyjne. Firma twierdzi, że MHS skraca pracę integracyjną z tygodni i miesięcy do godzin i minut. Agent może obsługiwać kilka instrumentów równolegle, zmieniać parametry w trakcie procesu i czasem samodzielnie wyjść z błędu sprzętowego bez interwencji człowieka. Standard jest niezależny od modelu i działa z każdym urządzeniem mającym programowalny interfejs, a harness agenta sięga do niego przez protokoły takie jak MCP. Wśród wczesnych partnerów są AWS, Danaher i Universal Robots. W tle idą wyniki, które nadają temu sens. Mythos 5.1 osiągnął prawie 50 procent skuteczności w projektowaniu wykonalnych wiązadeł białkowych i pomógł zmapować jedną trzecią Wenus. Wcześniej Claude zaprojektował od zera wiązadła dla 14 z 15 celów w testach mokrych z Adaptyv Bio i Twist Bioscience, z trafnością 22-35 procent, czyli ponad dwukrotnie powyżej średniej. Osobno warto odnotować eksperyment, w którym Claude działał autonomicznie przez 48 godzin na jednym GPU, naprawiając błędy alignmentu w mniejszych modelach. W większej skali Claude Sonnet 5 dopasował wczesny checkpoint Opus 4.8 w 60 godzin przy 2000 przykładów, co Anthropic opisuje jako 15 tysięcy razy większą efektywność danych niż zespoły ludzkie, zamykając do 96 procent luk bezpieczeństwa w dziesięciu trybach awarii. Niepokojący przypis: w 2,4% przebiegów badawczych Claude próbował oszukać własne monitory bezpieczeństwa. Czytaj więcej | Czytaj więcej (autonomiczny alignment) 🔓 Otwarte wagi rosną: Tencent Hy4, GLM-5.3-Flash i K2 HorizonTencent udostępnił wagi Hy4 preview - modelu mixture-of-experts o 770 miliardach parametrów, z których 49 miliardów aktywuje się na token. Firma pozycjonuje go jako ogólny model produktywności do inżynierii oprogramowania, pracy z dokumentami, tworzenia gier i badań. W ślepym porównaniu 203 zadań inżynierskich 163 wewnętrznych ekspertów oceniło Hy4 na 2,99 punktu wobec 2,92 dla GLM-5.3 i 2,94 dla Kimi K3. Tencent uczciwie wylicza dwie znane wady: model potrafi rozumować dłużej niż to konieczne i nadmiernie weryfikować własną pracę. Z.ai ujawniło tymczasem, że tajemniczy „Ox Alpha", przez tydzień najpopularniejszy model na OpenRouterze, to GLM-5.3-Flash. To 320 miliardów parametrów przy zaledwie 18 miliardach aktywnych, hybrydowa uwaga liniowa i rzadka plus mechanizm IndexPool, co daje trzykrotnie mniej obliczeń uwagi i 4,4 razy mniejszy cache przy oknie do miliona tokenów. W Intelligence Index zdobył 57 punktów przy koszcie około 0,09 dolara za zadanie, czyli mniej więcej ósmą część ceny otwartych modeli plasujących się wyżej. Wagi są na licencji MIT. Ciekawostka: preview serwowany był wyłącznie na chińskich chipach. Do tego MBZUAI wypuściło K2 Horizon - sześć w pełni otwartych modeli od 0,9 do 375 miliardów parametrów, z danymi treningowymi i kodem. Flagowy 375B A23B ma okno 524 tysięcy tokenów i 47 punktów w Intelligence Index, czyli 30 punktów więcej niż poprzednik. Warto dodać kontekst sprzętowy: nowe układy Apple M6 i M5 Ultra z pamięcią zunifikowaną do 512 GB i przepustowością 1,2 TB/s pozwalają uruchamiać lokalnie modele o setkach miliardów parametrów. Czytaj więcej (Hy4) | Czytaj więcej (GLM-5.3-Flash) | Czytaj więcej (K2 Horizon) Ciekawe narzędzia AI
Co jeszcze w świecie AI?
Jeśli miałbym wskazać wspólny mianownik tego wydania, to jest nim rosnąca przepaść między tempem wypuszczania modeli a tempem budowania wokół nich kontroli. W tym samym tygodniu jedna firma ogłosiła erę AGI, sklasyfikowała własny model jako krytycznie niebezpieczny w cyber, przyznała, że jest mniej monitorowalny od poprzednika, i opublikowała esej wzywający całą branżę do zwolnienia. Do tego doszła historia agentów, którzy przez sześć tygodni prowadzili własne forum wymieniając się informacjami jak kantować na benchmarkach, a dowiedzieliśmy się o tym od czterech niezależnych badaczy, nie od twórcy. To dobry moment, żeby przy każdym nowym narzędziu zadawać nie tylko pytanie „co potrafi", ale też „kto to sprawdza i jak szybko się o tym dowiem". Jeśli to wydanie było dla Ciebie przydatne, prześlij je dalej znajomym, którzy też próbują nadążyć. Pozdrawiam, |
Newsy ze świata AI i komentarze co tydzień na Twojej skrzynce. Poniżej starsze newslettery (ok ~20 dni do tyłu w stosunku do tego, co dostają moi korespondenci).
Witaj Reader! Witajcie w kolejnym wydaniu mojego newslettera, który ostatnio stał się dość nieregularny. Powody są zasadniczo dwa. Pierwszy jest taki, że są wakacje. Drugi jest taki, że własnie zaczynam nową pracę i w efekcie dużo mam na głowie innych tematów. Ale tworzenie tego newslettera mi samemu pomaga utrzymać jaki-taki kontakt z tym co się nowego dzieje w AI, więc nie zamierzam przestać choć regularność będzie cierpieć. A dzieje się dużo i póki co naprawdę nie widać, żeby tempo miało...
Witaj Reader! Pojechałem nad morze... a tymczasem te ostatnie dwa tygodnie okazały się bardzo intensywne. Pokazuje to problem jakim jest tempo zachodzącej zmiany, nigdy wcześniej nie spotykane. Zatem... nadrabiamy: Moonshot udostępnił wagi Kimi K3 i tym samym otwarte modele praktycznie zrównały się z komercyjną czołówką, Anthropic wypuścił Claude Opus 5 za połowę ceny Fable, a OpenAI obniżyło ceny Luny o 80 procent. Jednocześnie mieliśmy serię naprawdę niepokojących incydentów: agenty OpenAI,...
Witaj Reader! To był tydzień, w którym otwarte modele przestały być tanią alternatywą i weszły do pierwszej ligi - chiński Kimi K3 z 2,8 biliona parametrów dogonił Fable 5 i GPT-5.6 Sol, a Mira Murati pokazała pierwszy otwarty model swojego Thinking Machines. Jednocześnie skończyła się era darmowej taniości: Kimi podniosło ceny niemal do poziomu zachodnich flagowców, co pokazuje, że inteligencja na granicy możliwości kosztuje niezależnie od tego, czyja flaga "wisi" na modelu. Najbardziej...