|
Witaj Reader! Pojechałem nad morze... a tymczasem te ostatnie dwa tygodnie okazały się bardzo intensywne. Pokazuje to problem jakim jest tempo zachodzącej zmiany, nigdy wcześniej nie spotykane. Zatem... nadrabiamy: Moonshot udostępnił wagi Kimi K3 i tym samym otwarte modele praktycznie zrównały się z komercyjną czołówką, Anthropic wypuścił Claude Opus 5 za połowę ceny Fable, a OpenAI obniżyło ceny Luny o 80 procent. Jednocześnie mieliśmy serię naprawdę niepokojących incydentów: agenty OpenAI, Anthropic, Meta i Moonshot kolejno wymykały się ze swoich środowisk testowych, co skłoniło ponad 1100 badaczy z czołowych laboratoriów do publicznego apelu o spowolnienie automatyzacji badań nad AI. Ale są też pozytywy: nieopublikowany jeszcze model Astra pomógł rozwiązać dziesięć otwartych problemów matematycznych, Claude znalazł lukę w kandydacie na postkwantowy standard kryptograficzny, a AI zaprojektowała od zera szesnaście działających wirusów. Do tego Google przetasowało kierownictwo DeepMind, a Meta weszła do gry o agentów kodujących z własnym, zamkniętym modelem. Przejdźmy do szczegółów: 🔓 Kimi K3 z otwartymi wagami: 2,8 biliona parametrów do pobraniaMoonshot AI udostępnił wagi Kimi K3, tworząc największy otwarty model w historii: 2,8 biliona parametrów całkowitych, 16 z 896 ekspertów aktywnych na token, kontekst miliona tokenów i natywne rozumienie obrazu. Model zajął trzecie miejsce w Artificial Analysis Intelligence Index z wynikiem 57 punktów, ustępując tylko Claude Fable 5 (60) i GPT-5.6 Sol (59), a przy tym prowadzi w AutomationBench i zadebiutował na szczycie Code Arena WebDev. Koszt zadania to około 0,95 dolara, czyli mniej niż u obu konkurentów. Techniczne nowinki, które to umożliwiły, Moonshot opublikował jako referaty z kodem: Kimi Delta Attention (liniowa uwaga w trzech z czterech warstw, redukująca zużycie pamięci do 75 procent przy milionie tokenów) oraz Attention Residuals, gdzie każda warstwa uczy się selektywnie sięgać do wyjść wcześniejszych warstw. Razem dały około 2,5-krotnie efektywniejszy trening niż w poprzedniej generacji. Uruchomienie modelu wymaga jednak 1,4 TB pamięci na wagi w formacie MXFP4, więc "self-hosting" to póki co zadanie dla poważnych graczy. Alibaba odpowiedziała Qwen3.8-Max, modelem o 2,4 biliona parametrów (95 miliardów aktywnych), którego wagi mają zostać udostępnione, ale według Reutersa duzi komercyjni użytkownicy będą musieli negocjować umowy o podziale przychodów. Czyżby era całkowicie darmowych otwartych modeli klasy frontier może się kończyć? Czytaj więcej | Czytaj więcej (Qwen3.8-Max) | 🚨 Agent OpenAI włamujący się do Hugging Face to nie był jedyny taki przypadekW poprzednim wydaniu pisałem o incydencie z agentem od OpenAI, który włamywał się do HuggingFace. Później okazało się, że ten sam agent złamał też konto klienta w Modal Labs, a Anthropic po audycie 141 tysięcy własnych sesji testowych przyznał, że trzy jego modele przez błąd konfiguracji partnera testowego dostały się do systemów trzech realnych organizacji. Ciekawe jest zróżnicowanie reakcji: najstarszy Opus 4.7 kontynuował atak, Mythos 5 przekonywał sam siebie że to nadal symulacja, a najnowszy model badawczy się zatrzymał. Do listy dołączył też Meta Muse Spark 1.1 oraz otwarty Kimi K3, który wyszedł z sandboxa AI Security Institute, by pobrać rozwiązania benchmarku z GitHuba. Wracamy więc do kwestii tego jak trenować "moralność" w modelach? Czytaj więcej (incydenty Anthropic) | Czytaj więcej (Kimi K3) ⏸️ 1100 badaczy z czołowych laboratoriów prosi rząd o spowolnienie AIPonad 1100 pracowników OpenAI, Anthropic, Google DeepMind, Meta, Microsoft, Mistral i Thinking Machines podpisało list otwarty "Pacing the Frontier", w którym proszą rząd USA o wsparcie międzynarodowych wysiłków na rzecz stworzenia narzędzi technicznych i regulacyjnych pozwalających świadomie kontrolować tempo automatyzacji badań nad AI. To jakościowa różnica wobec słynnego apelu o sześciomiesięczną pauzę z 2023 roku: tym razem inicjatywa wychodzi od ludzi wewnątrz laboratoriów, a ich konkretną obawą jest rekursywne samodoskonalenie, czyli moment gdy modele zaczną same pisać eksperymenty, uruchamiać ewaluacje, analizować porażki i proponować ulepszenia. Sam Altman poparł petycję. Kilka dni później OpenAI zrobiło coś bez precedensu: zatrzymało prace nad Astrą, które nie spełniają nowo zaostrzonych wymogów bezpieczeństwa, bo wstępne ewaluacje sugerują, że model może osiągnąć najwyższą kategorię ryzyka cyberbezpieczeństwa. Chodzi o potencjalną zdolność do autonomicznego znajdowania i wykorzystywania poważnych, nieznanych luk w oprogramowaniu przy minimalnym udziale człowieka. Rozwój Astry przenoszony jest do izolowanych środowisk z ograniczonymi sieciami, a firma planuje testy z agencjami rządowymi i wybranymi organizacjami bezpieczeństwa. Do zespołu bezpieczeństwa dołączył laureat Medalu Fieldsa Jacob Tsimerman. W tle Biały Dom pracuje z OpenAI, Anthropic, Google i Metą nad dobrowolnymi ramami testowania modeli przed wydaniem, z 30-dniowym przeglądem w zabezpieczonych środowiskach. Co znamienne, modele z otwartymi wagami mają być z tego wyłączone, bo urzędnicy uznali, że ograniczenia po wydaniu są nieskuteczne. Czytaj więcej | Czytaj więcej (pauza w pracach nad Astrą) 🧮 AI zaczyna robić prawdziwą naukę: dziesięć problemów matematycznych, luka kryptograficzna i szesnaście nowych wirusówWewnętrzna wersja Astry wygenerowała nowe wyniki dla dziesięciu problemów, które nie doczekały się postępu od co najmniej dekady, z zakresu geometrii wielowymiarowej, teorii kodowania, teorii grup, złożoności kwantowej, kryptografii kratowej i kombinatoryki. Wśród rezultatów jest konstrukcja grup niesoficznych, nowe ograniczenia na upakowanie sfer oraz wyniki związane z kryptografią postkwantową. Ludzie przygotowali argumenty jako manuskrypty, a Astra sformalizowała każdy dowód w Lean, gdzie oprogramowanie weryfikuje logikę krok po kroku. Koszt tokenów dla wszystkich dziesięciu rozwiązań to według OpenAI około 2000 dolarów przy cenach API Sola. Warto dodać, że badacz Anthropic zreplikował pięć z tych dziesięciu dowodów za pomocą Claude Fable w ciągu 24 godzin, bez dostępu do internetu ani specjalnych promptów. Claude Mythos Preview pod nadzorem człowieka znalazł nowy atak na HAWK, kandydata na postkwantowy standard podpisów cyfrowych NIST, obniżając szacowany koszt wykradzenia klucza z 2 do potęgi 150 do maksymalnie 2 do potęgi 108. Autorzy HAWK wycofali swoją propozycję z konkursu następnego dnia po weryfikacji, uznając że proste poprawki uczyniłyby ją niekonkurencyjną. Cała praca zajęła około 60 godzin i 100 tysięcy dolarów w kosztach API. Co ciekawe, przy pierwszym podejściu jeden agent uznał atak za niewykonalny, a drugi znalazł sposób. Najbardziej poruszający wynik przyszedł ze Stanforda i Arc Institute, gdzie genomowy model językowy zaprojektował od zera kompletne genomy wirusowe. Z około 300 zsyntetyzowanych projektów szesnaście okazało się żywe i skutecznie infekowało bakterie docelowe, a kilka pokonało naturalny wirus, na którym bazowały. Wirusy atakują wyłącznie bakterie, w tym lekooporne E. coli, i nie mogą zaszkodzić ludziom, zwierzętom ani roślinom, a dane treningowe celowo pozbawiono wirusów ludzkich i zwierzęcych. Metoda jest jednak już publiczna, co naukowcy z Johns Hopkins skomentowali stwierdzeniem, że pytanie nie brzmi już czy AI potrafi projektować genomy wirusowe, ale czy da się to robić bez umożliwiania szkód. Czytaj więcej (matematyka) | Czytaj więcej (kryptografia) | Czytaj więcej (wirusy) 🏆 Claude Opus 5: prawie tak dobry jak Fable, za połowę cenyAnthropic wypuścił Claude Opus 5, który natychmiast objął prowadzenie w Artificial Analysis Intelligence Index z wynikiem 61 punktów, wyprzedzając Claude Fable 5 (60) i GPT-5.6 Sol (59). Cena API pozostała na poziomie Opusa 4.8, czyli 5 dolarów za milion tokenów wejściowych i 25 za wyjściowe, a średni koszt zadania wynosi 2,03 dolara wobec 2,75 dla Fable. Model dostał kontekst miliona tokenów, tryb Fast działający około 2,5 razy szybciej za podwójną cenę oraz pięć poziomów rozumowania. Najbardziej spektakularny wynik to ARC-AGI-3, test mierzący jak efektywnie agenty uczą się reguł w grach, których nigdy nie widziały: Opus 5 uzyskał 30,2 procent, czyli prawie czterokrotność następnego modelu. Andrej Karpathy dał mu budżet miliona tokenów (około 10 dolarów) i pierwszy akapit Władcy Pierścieni, a model przez dwie godziny wygenerował proceduralny świat 3D w JavaScripcie liczący 5500 linii kodu. Bardzo istotny jest też wynik bezpieczeństwa: w trybie Auto Opus 5 zredukował skuteczność ataków przez wstrzykiwanie promptów w przeglądarce do zera na 129 wektorach testowych. Anthropic zmienił też politykę fallbacków: pytania o biologię, chemię i nauki o życiu nie powodują już przełączenia na słabszy model, a codzienna praca defensywna jak skanowanie kodu pod kątem luk jest dozwolona. Od 14 sierpnia tryb Auto w Claude Code staje się domyślny dla planów Pro, Max i Team, zastępując potwierdzanie każdego kroku klasyfikatorem blokującym destrukcyjne akcje. W testach na 1053 użytkownikach wyłapał 89 procent niebezpiecznych komend wobec 13,6 procent u ludzi cierpiących na zmęczenie zatwierdzaniem, a zespoły korzystające z tej funkcji dostarczały o 25 procent więcej pull requestów. Czytaj więcej | Czytaj więcej (analiza wyników) | Czytaj więcej (tryb Auto) Zatwierdzanie każdej zmiany już od kilku miesięcy jest fikcją. Nikt realnie tego nie robi poza absolutnie core-owymi obszarami w krytycznych systemach. Obecnie good practice: bierze się inny model i każe mu sprawdzić kod każdej zmiany przez merge PR-a. 💸 Koniec ery tokenmaxxingu, początek prawdziwej wojny cenowejOpenAI obniżyło cenę GPT-5.6 Luny o 80 procent, do 0,20 dolara za milion tokenów wejściowych i 1,20 za wyjściowe, oraz Terry o 20 procent. Firma tłumaczy to zyskami efektywnościowymi, w tym optymalizacją kodu inferencyjnego wykonaną przez samego GPT-5.6 Sol, co obniżyło koszty serwowania o 20 procent. Efekt jest dramatyczny: Luna na maksymalnym rozumowaniu osiąga wyniki flagowego GPT-5.4 z marca przy około jednej trzynastej ceny tokenów. DeepSeek odpowiedział zaktualizowanym V4-Flash, który przy 284 miliardach parametrów (13 aktywnych) uzyskał 50 punktów w Intelligence Index, wyprzedzając własny, większy V4-Pro. Koszt zadania to 0,03 dolara, czyli mniej niż u porównywalnie inteligentnej Luny, a wagi są dostępne na licencji MIT i wersja skwantyzowana do 3 bitów działa na maszynie ze 110 GB pamięci. Model osiągnął 82,7 procent na Terminal-Bench 2.1. Firma zapowiedziała jednak, że ceny API "znacząco" wzrosną, bo popyt przerósł infrastrukturę. Meta poszła jeszcze dalej, wprowadzając tier Contributor, gdzie tokeny są tańsze o 92 i 95 procent w zamian za zgodę na wykorzystanie promptów i odpowiedzi do trenowania przyszłych modeli. To już nie decyzja cenowa, a decyzja o tym, co robi się z danymi firmy. Jednocześnie Andrew Ng ogłosił z ulgą, że idea "tokenmaxxingu", czyli zachęcania firm do zużywania jak największej liczby tokenów, w końcu umiera. Microsoft wprowadził wewnętrzne budżety tokenowe i powiedział inżynierom wprost, że tokenmaxxing nie jest tym, co optymalizują. Amazon przypadkowo wydał 1,8 miliona dolarów na Claude przy trywialnym zadaniu programistycznym, przekraczając budżet o 860 procent. Rada Ng jest prosta: instrumentuj swoje aplikacje tak, by znać koszt zapytania, i projektuj architekturę tak, by nie być zablokowanym u jednego dostawcy. Czytaj więcej | Czytaj więcej (DeepSeek V4-Flash) | Czytaj więcej (Microsoft o tokenmaxxingu) 🏥 ChatGPT zmienia się dla użytkowników: zdrowie, nielimitowane rozmowy i suwak rozumowaniaOpenAI uruchomiło w USA ChatGPT Health, funkcję łączącą się z Apple Health oraz obsługiwanymi dostawcami dokumentacji medycznej. Po udzieleniu zgody ChatGPT może porównywać wyniki badań w czasie, wyjaśniać zmiany, podsumowywać dokumentację i wiązać dane o snie, aktywności i ćwiczeniach z zadawanymi pytaniami. Firma podaje, że ponad 300 milionów osób tygodniowo zadaje ChatGPT pytania zdrowotne. Dane z połączonej dokumentacji nie będą używane do trenowania modeli ani targetowania reklam, ale eksperci ds. prywatności zwracają uwagę na istotny haczyk: gdy dokumentacja opuszcza system szpitalny i trafia do aplikacji konsumenckiej, przestaje ją chronić HIPAA. Równolegle OpenAI przebudowało dostęp do modeli. GPT-5.6 Luna staje się domyślnym modelem dla użytkowników Free i Go z nielimitowanymi rozmowami tekstowymi oraz przyciskiem Think, a subskrybenci Plus i Pro dostali suwak pozwalający wybrać, ile rozumowania ma zużyć ChatGPT. Zaktualizowany Sol daje bardziej bezpośrednie odpowiedzi i według wewnętrznych testów OpenAI na promptach finansowych, medycznych i prawnych o 68 procent rzadziej zawiera co najmniej jeden błąd faktograficzny niż GPT-5.5 Instant. Warto przy tym zauważyć, że są to wyniki własnych ewaluacji firmy, a nie niezależnych benchmarków. Nowe dane OpenAI z ponad 800 tysięcy wiadomości pokazują ciekawe zjawisko: 43,5 procent zapytań specyficznych dla zawodu dotyczy zadań przypisanych do innego zawodu. Handlowiec analizuje dane zamiast czekać na analityka, marketer debuguje stronę zamiast pytać inżynierię. Zadania robocze wyprzedziły już poszukiwanie informacji ponad dwukrotnie. Czytaj więcej | Czytaj więcej (aktualizacja Sola i darmowy dostęp) | Czytaj więcej (jak świat używa ChatGPT do pracy) 🦿 Gemini Robotics 2: jeden mózg dla dowolnego robotaGoogle DeepMind zaprezentowało Gemini Robotics 2, model koordynujący całe ciało humanoida, a nie tylko ramiona i tors. Demonstracje pokazują roboty chodzące, przykucające, wyciągające się i manipulujące obiektami w jednym płynnym ruchu. Robot Apptronik Apollo 2 używał pięciopalczastych dłoni do wybierania produktów z półek, zamykania plastikowych torebek, wiązania worków na śmieci i wykręcania żarówek. System dzieli się na trzy części. Gemini Robotics ER 2 zajmuje się planowaniem wyższego poziomu: interpretuje polecenie, rozumie otaczającą przestrzeń, dzieli długie zadania na kroki i potrafi koordynować więcej niż jednego robota. Model on-device działa lokalnie bez stałego połączenia z internetem, adaptuje się do robotów o różnych kształtach i zestawach sensorów w ciągu godzin na podstawie mniej niż 200 przykładów, co redukuje opóźnienia i pozwala robotowi pracować przy braku dostępu do chmury. DeepMind wprowadziło też ASIMOV-Agentic, benchmark mierzący czy agenty robotyczne wybierają bezpieczne działania podczas dłuższych zadań, w tym czy wiedzą kiedy się zatrzymać i zapytać człowieka. Zabezpieczenia obejmują detekcję osób w pobliżu i automatyczne zatrzymanie niebezpiecznego ruchu. To wciąż demonstracje badawcze, bez ogłoszonych cen ani daty ogólnej dostępności, a wydajność poza kontrolowanymi warunkami testowymi pozostaje nieudowodniona. 🛠️ Meta wchodzi do gry o agentów kodujących z zamkniętym Muse CodeMeta wypuściła Muse Code, terminalowego agenta kodującego napędzanego nowym modelem Muse Spark 1.2, co jest jej najpoważniejszym wejściem do kategorii, którą dotąd obserwowała z boku. To istotna zmiana strategii: przez lata historia Mety dla deweloperów opierała się na otwartym Llamie z ponad miliardem pobrań, a Muse Code i Muse Spark są w pełni zamknięte i własnościowe. Agent utrzymuje trwałe sesje w tle, które kumulują kontekst zamiast startować od zera przy każdym zadaniu, a przy większych zleceniach rozdziela pracę na równoległe sub-agenty działające w izolowanych worktree. Każde wywołanie modelu, uruchomienie narzędzia, zatwierdzenie i edycja trafiają do lokalnego dziennika zdarzeń przed wykonaniem, co czyni sesje dokładnie odtwarzalnymi i odpornymi na restart. Dzięki tej trwałości Meta uruchamiała sesje przekraczające tysiąc wywołań narzędzi trwające do 24 godzin przy optymalizacji kerneli GPU. Wbudowane umiejętności to /plan (planowanie z bramką zatwierdzenia), /grill (testowanie planu pod obciążeniem) i /goal. Muse Spark 1.2 uzyskał 54 punkty w Intelligence Index, 82,9 procent na Terminal-Bench 2.1 (wobec 86,7 dla Claude Code z Opusem 5) i wszedł na granicę Pareto koszt-inteligencja przy 0,40 dolara za zadanie. Model jest sześć punktów poniżej Claude Opus 5 przy około jednej szóstej kosztu, a wskaźnik halucynacji spadł z 38 do 28 procent głównie przez agresywne odmawianie odpowiedzi przy niepewności. Czytaj więcej | Czytaj więcej (analiza cenowa) Ciekawe narzędzia AI
Sierpień w branży AI zdecydowanie nie przypomina sezonu ogórkowego. Obserwujemy fascynujący moment przejścia - od zachwytów nad tym, jak ładnie modele potrafią pisać, do twardej inżynierii systemów, w których AI rozwiązuje realne problemy naukowe, ale też wymaga bardzo rygorystycznych zabezpieczeń. Jeśli uważasz, że to zestawienie informacji pomoże komuś z Twoich znajomych lub współpracowników lepiej zorientować się w tym, co obecnie dzieje się na froncie technologicznym, prześlij mu ten newsletter. Trzymajcie się chłodno w te upalne dni! Pozdrawiam, |
Newsy ze świata AI i komentarze co tydzień na Twojej skrzynce. Poniżej starsze newslettery (ok ~20 dni do tyłu w stosunku do tego, co dostają moi korespondenci).
Witaj Reader! Ostatnie dni to jedno z gęstszych okien w całym roku: OpenAI wypuściło GPT-6 Astra i przy okazji użyło magicznego terminu AGI, którego wcześniej unikało, Nvidia za blisko 13 miliardów dolarów kupiła Hugging Face, a Anthropic, Google i Meta w ciągu 48 godzin pokazały nowe modele. Do tego doszły dwie historie, które warto czytać razem: raport o roju agentów OpenAI, które przez sześć tygodni używały martwej niemieckiej wiki jako tablicy ogłoszeń, oraz esej głównego naukowca OpenAI...
Witaj Reader! Witajcie w kolejnym wydaniu mojego newslettera, który ostatnio stał się dość nieregularny. Powody są zasadniczo dwa. Pierwszy jest taki, że są wakacje. Drugi jest taki, że własnie zaczynam nową pracę i w efekcie dużo mam na głowie innych tematów. Ale tworzenie tego newslettera mi samemu pomaga utrzymać jaki-taki kontakt z tym co się nowego dzieje w AI, więc nie zamierzam przestać choć regularność będzie cierpieć. A dzieje się dużo i póki co naprawdę nie widać, żeby tempo miało...
Witaj Reader! To był tydzień, w którym otwarte modele przestały być tanią alternatywą i weszły do pierwszej ligi - chiński Kimi K3 z 2,8 biliona parametrów dogonił Fable 5 i GPT-5.6 Sol, a Mira Murati pokazała pierwszy otwarty model swojego Thinking Machines. Jednocześnie skończyła się era darmowej taniości: Kimi podniosło ceny niemal do poziomu zachodnich flagowców, co pokazuje, że inteligencja na granicy możliwości kosztuje niezależnie od tego, czyja flaga "wisi" na modelu. Najbardziej...