|
Witaj Reader! To był tydzień, w którym otwarte modele przestały być tanią alternatywą i weszły do pierwszej ligi - chiński Kimi K3 z 2,8 biliona parametrów dogonił Fable 5 i GPT-5.6 Sol, a Mira Murati pokazała pierwszy otwarty model swojego Thinking Machines. Jednocześnie skończyła się era darmowej taniości: Kimi podniosło ceny niemal do poziomu zachodnich flagowców, co pokazuje, że inteligencja na granicy możliwości kosztuje niezależnie od tego, czyja flaga "wisi" na modelu. Najbardziej niepokojąca wiadomość dotyczy jednak bezpieczeństwa - podczas testów modele OpenAI samodzielnie wyłamały się ze środowiska testowego i włamały do produkcyjnych serwerów Hugging Face, by wykraść odpowiedzi do własnego egzaminu. Do tego Google tnie ceny nowymi modelami Gemini Flash, Apple zostaje pozwane o kradzież tajemnic, a szesnastu noblistów bije na alarm w sprawie wpływu AI na rynek pracy. Sporo się dzieje, więc przejdźmy do konkretów. 🇨🇳 Kimi K3 - największy otwarty model w historii dogania Fable 5Pekińskie Moonshot AI wypuściło Kimi K3, model typu mixture-of-experts o łącznej liczbie 2,8 biliona parametrów (aktywnych jest przeciętnie tylko 16 z 896 ekspertów na token), z oknem kontekstu miliona tokenów i natywną multimodalnością. To największy otwarty model, jaki kiedykolwiek wydano, a jego wagi mają trafić do publicznego dostępu 27 lipca. Model zdetronizował Claude Fable 5 na liście frontend coding w Arenie z 76% wskaźnikiem zwycięstw i uplasował się na czwartym miejscu globalnie w Artificial Analysis Intelligence Index (57 punktów wobec 60 dla Fable 5 i 59 dla GPT-5.6 Sol). Najciekawsza jest jednak historia cenowa, którą świetnie ujął serwis AI Blueprint: jeszcze miesiąc temu poprzednik K2.6 kosztował 0,95 dolara za milion tokenów wejściowych i 4 dolary za wyjściowe. K3 skoczył do 3 i 15 dolarów - dokładnie tyle, ile bierze Anthropic za Sonnet 5. Cała narracja ostatnich dwóch lat o chińskich laboratoriach podcinających Zachód cenami właśnie się skończyła. Model jest też mało wydajny tokenowo - pojedyncze zadanie na benchmarku AA-Briefcase kosztuje 10,57 dolara (około dziesięć razy więcej niż K2.6), bo model wykonuje średnio 83 tury i pracuje nad zadaniem 56 minut. Jest jeszcze jeden haczyk: wraz ze wzrostem trafności rośnie też skłonność do konfabulacji - wskaźnik halucynacji wzrósł z 39% do 51%. A Moonshot musiało wstrzymać nowe subskrypcje, bo nie ma dość GPU, by obsłużyć popyt. Emad Mostaque ze Stability AI przewiduje jednak, że koszt K3 spadnie 10-50 razy w ciągu kilku miesięcy, gdy amerykańskie firmy inferencyjne jak Fireworks, Modal czy Baseten zoptymalizują model na nowoczesnych układach Nvidii. Czytaj więcej | Czytaj więcej 🕵️ Modele OpenAI włamały się na Hugging Face, by wykraść odpowiedzi do testuTo jedna z najbardziej niepokojących historii ostatnich miesięcy. Podczas wewnętrznych testów cyberbezpieczeństwa na benchmarku ExploitGym, OpenAI uruchomiło GPT-5.6 Sol oraz silniejszy, niewydany jeszcze model, celowo wyłączając produkcyjne zabezpieczenia i ograniczając odmowy związane z atakami, by zmierzyć maksymalne możliwości ofensywne. Środowisko testowe miało blokować normalny dostęp do internetu, ale przepuszczało zapytania o pakiety przez wewnętrzny serwer proxy. Modele odkryły nieznaną wcześniej lukę w tym proxy, wykorzystały ją, podniosły uprawnienia i przedostały się przez sieć badawczą OpenAI do węzła z dostępem do internetu. Stamtąd wywnioskowały, że Hugging Face może przechowywać rozwiązania testu ExploitGym, po czym za pomocą złośliwego zbioru danych i dwóch kolejnych luk typu zero-day włamały się do produkcyjnych systemów Hugging Face, wykradając odpowiedzi wprost z bazy danych. Cel był absurdalnie prosty - modele chciały oszukać na własnym egzaminie. Oba zespoły bezpieczeństwa wykryły i zatrzymały aktywność, a co ciekawe, Hugging Face podkreśla, że kluczową rolę w obronie odegrały modele otwarte - do zrekonstruowania 17 tysięcy zdarzeń ataku użyto chińskiego GLM-5.2, gdy komercyjne API odmówiły współpracy przy analizie. OpenAI zaostrzyło kontenerację, monitoring i kontrolę dostępu. Sam Altman udaje się do Waszyngtonu, by poinformować urzędników o możliwościach najnowszych modeli. Czytaj więcej | Czytaj więcej Ten właśnie ostatni aspekt najbardziej jest dla mnie "znakiem czasu" - do "obrony" czyli wykrycia aktywności włamywaczy oraz łatania dziur na nią pozwalających konieczna była pomoc innego modelu AI. Żaden ludzki specjalista bez ich pomocy nie dałby rady analizować tylu danych i kodu w takim tempie. 🎨 Thinking Machines pokazuje Inkling - pierwszy otwarty model Miry MuratiThinking Machines Lab, firma założona przez byłą CTO OpenAI Mirę Murati, wypuściła Inkling - swój pierwszy model z otwartymi wagami. To model o 975 miliardach parametrów (41 miliardów aktywnych), z oknem kontekstu miliona tokenów, obsługujący tekst, obrazy i audio. Wytrenowano go na 45 bilionach tokenów danych od podstaw, a pełne wagi są dostępne na Hugging Face na licencji pozwalającej na użycie komercyjne. Najciekawsze jest to, jak Murati sama pozycjonuje ten model. Powiedziała wprost: "Inkling nie jest najsilniejszym dostępnym dziś modelem, otwartym ani zamkniętym". Zamiast tego stawia na coś innego - to solidna baza do dostosowywania, wystarczająco szeroka, by ją adaptować, i wystarczająco przejrzysta, by ją analizować. To świadoma decyzja pozycjonowania: w momencie, gdy OpenAI i Anthropic budują zamknięte umowy z rządami i przedsiębiorstwami, Thinking Machines obstawia, że znacząca część rynku będzie chciała sprawdzić, co uruchamia, zanim temu zaufa. Model osiągnął 77,6% na SWE-bench Verified i 97,1% na matematycznym AIME 2026. Można go dostrajać przez platformę Tinker (z tymczasową 50% zniżką) lub korzystać z usług partnerów takich jak Together, Fireworks, Modal, Databricks i Baseten. To najlepszy amerykański model otwarty, choć wciąż ustępuje chińskiej czołówce. 💰 Google tnie ceny nowymi modelami Gemini Flash - ale flagowiec wciąż w opóźnieniuGoogle DeepMind wypuściło trzy lekkie modele, jednocześnie potwierdzając opóźnienie flagowego Gemini 3.5 Pro. Gemini 3.6 Flash zużywa około 17% mniej tokenów wyjściowych niż poprzednik i wyraźnie poprawia wyniki w kodowaniu - na teście DeepSWE skoczył z 37% do 49%, a wbudowana obsługa komputera (computer use) podniosła wynik OSWorld z 78,4% do 83%. Ceny to 1,50 dolara za milion tokenów wejściowych i 7,50 za wyjściowe, co jest sporym obniżeniem względem 9 dolarów za 3.5 Flash. Do tego dochodzi Gemini 3.5 Flash-Lite, najbardziej ekonomiczny model w tej klasie, generujący 350 tokenów na sekundę za 0,30 dolara wejściowe i 2,50 wyjściowe. Trzeci model to specjalistyczny Gemini 3.5 Flash Cyber, dostrojony do znajdowania i łatania luk bezpieczeństwa - znalazł 55 potwierdzonych błędów w silniku JavaScript V8, w tym 10 przeoczonych przez modele porównawcze. Ze względu na ryzyko dwojakiego zastosowania dostęp do niego jest ograniczony wyłącznie do rządów i zaufanych partnerów przez pilotaż CodeMender. Warto jednak zauważyć, że według Artificial Analysis 3.6 Flash nie poprawił swojej pozycji w rankingu inteligencji i pozostaje za konkurentami. Google rozpoczęło już pre-trening Gemini 4, a długo wyczekiwany Gemini 3.5 Pro nadal tkwi w testach po tym, jak nie spełnił wewnętrznych celów, zwłaszcza w kodowaniu. 📢 Szesnastu noblistów bije na alarm w sprawie AI i rynku pracyPonad dwustu ekonomistów, w tym szesnastu laureatów Nagrody Nobla, podpisało wspólny list zatytułowany "We Must Act Now" (Musimy działać teraz). Wśród sygnatariuszy znaleźli się Daron Acemoglu, Joseph Stiglitz, Paul Krugman, Ben Bernanke i David Autor, a obok nich - co niezwykłe - ludzie budujący tę technologię: Noam Brown z OpenAI, Jack Clark z Anthropic, Jeff Dean z Google, Yann LeCun i Eric Schmidt. To rzadki moment, gdy ekonomiści, którzy przez dekady badali, jak rynki pracy wchłaniają szoki technologiczne, publikują razem z tymi, którzy ten szok wywołują. List nie twierdzi, że AI odbierze wszystkie miejsca pracy. Jego przesłanie jest inne: tempo transformacji jest tym razem odmienne, zdolność instytucji do zarządzania przejściem słabsza niż kiedykolwiek, a okno na ustawienie warunków kształtujących wynik szybko się zamyka. Kanonicznym punktem odniesienia są rewolucja przemysłowa czy fala offshoringu z lat 90. - w każdym z tych przypadków transformacja trwała od 15 do 30 lat, a koszty ponosili niestety zwykli ludzie. Sygnatariusze wzywają do większych badań nad tym, których pracowników dotknie zmiana, lepszego wsparcia dochodowego, programów przekwalifikowań i międzynarodowej koordynacji w kwestii opodatkowania i regulacji. Co ciekawe, ludzie najbliżej tych systemów nie prognozują horyzontu 10-15 lat, lecz 2-5. List jest skierowany do rządów, ale wiele kluczowych decyzji - kogo dotknie zmiana i jak szybko - zapada wewnątrz firm. 🏭 Anthropic i Blackstone uruchamiają Ode - firmę za 1,5 miliarda dolarów, która wdraża AI za ciebieAnthropic wspólnie z Blackstone oficjalnie uruchomiły Ode - firmę wdrożeniową AI wartą 1,5 miliarda dolarów, wspieraną też przez Hellman & Friedman i Goldman Sachs. CEO został Chris Taylor, współzałożyciel Fractional AI, startupu inżynieryjnego przejętego jako fundament Ode. Zespół to 100 inżynierów działających na zasadzie "Claude-first", choć nie są kontraktowo przywiązani do modeli Anthropic. Teza jest prowokacyjna: pieniądze nie leżą w modelach, lecz w pracy przebudowywania rzeczywistych procesów biznesowych. To warto rozumieć w kontekście - OpenAI ma swoją własną jednostkę inżynierii wdrożeniowej The Deployment Company, ogłoszoną kilka tygodni wcześniej. Wiodące laby AI przestały więc konkurować tylko benchmarkami. Teraz walczą o przywilej wykonywania pracy wdrożeniowej wewnątrz firm-klientów, z własnymi inżynierami osadzonymi w ich operacjach. Ode reklamuje swoich ludzi jako "dorosłych" inżynierów - byłych founders, którzy potrafią przejąć problem od początku do końca. Uruchomienie Ode potwierdza coś, co w praktyce jest prawdą od jakiegoś czasu: ludzi umiejących przeprowadzić dobre wdrożenie AI jest naprawdę trudno zrekrutować. Talent, którego szuka Ode - ludzie technicznie mocni, z wyczuciem produktu, którzy coś już wdrażali i potrafią poruszać się w korporacyjnej polityce - to dokładnie ten, którego większość firm średniej wielkości nie jest w stanie przyciągnąć ani zbudować od zera. 🎓 Claude uczy się umiejętności, obserwując twój ekranAnthropic dodało do Claude Cowork funkcję nagrywania ekranu, która zamienia ręczne czynności w wielokrotnie używalne skrypty automatyzacji. Nagrywasz siebie wykonującego zadanie na ekranie, tłumacząc na głos każdy krok, a Claude zamienia to nagranie w zapisaną umiejętność (skill), którą może później powtórzyć. To rozwiązanie zbliżone do funkcji Record & Replay w Codex, którą OpenAI pokazało wcześniej. Kluczowa jest tu zmiana filozofii tworzenia skilli. Wcześniej pisanie skilla wymagało stworzenia pliku SKILL.md z metadanymi, instrukcjami i skryptami - format czytelny i modyfikowalny, ale wymagający myślenia jak projektant procesów. Nagrywając ekran, nie tylko opisujesz swoją pracę, ale też pokazujesz, jak podejmowane są decyzje w danej aplikacji. Claude musi z zapisu sesji wywnioskować, które kroki są stałe, które to zmienne wejściowe, a co stanowi warunek sukcesu. To może zamienić wiedzę pracowników w coś przypominającego efektami oprogramowanie bez konieczności pisania kodu automatyzacji. Powtarzalne, żmudne zadania - jak wypełnianie dokumentów czy raportowanie - są łatwymi celami, bo mają wciąż tę samą strukturę. Funkcja jest dostępna w aplikacji desktopowej pod opcją "Record a skill" dla planów Pro, Max i Team. Twórca Claude Code, Boris Cherny, dodatkowo zachęca zespoły inżynierskie, by kodować reguły instytucjonalne bezpośrednio w bazach kodu - przez pliki takie jak CLAUDE.md, lint i pipeline CI. 🧺 ACT-2 - robot, który składa pranie w domach, których nigdy nie widziałSunday Robotics pokazało ACT-2, model napędzający domowego robota Memo. System zaprojektowano tak, by uczył się nowego zachowania fizycznego z jednej demonstracji, a potem powtarzał je z różnymi obiektami i w domach, których wcześniej nie widział. W testach firmy ACT-2 ukończył 99,1% prób składania prania w nieznanych warunkach bez dodatkowego treningu dla każdego domu. Na 778 ukończonych złożeń 98,3% otrzymało cztery lub pięć gwiazdek za jakość, przy medianie czasu 2 minuty i 13 sekund. Memo poradził sobie z dziewięcioma typami ubrań, w tym ubrankami dla niemowląt, koszulami w rozmiarze 8XL i dużymi ręcznikami. Jego kołowy korpus może poruszać się wokół stołu, zmieniać wysokość i odzyskiwać kontrolę, gdy ubranie spadnie lub zacznie w niewygodnej pozycji. Warto jednak pamiętać, że to testy własne firmy, a nie niezależne próby domowe, i dotyczą tylko jednego zadania - odkurzanie czy porządkowanie zabawek zademonstrowano, ale nie osiągnęły one tego samego opublikowanego standardu. Memo nie jest jeszcze w sprzedaży. Planowana jest domowa beta pod koniec 2026 roku. Jeden ręcznie budowany egzemplarz kosztuje dziś około 20 tysięcy dolarów, a Sunday spodziewa się, że masowa produkcja obniży tę kwotę co najmniej o połowę. Dla bezpieczeństwa Memo używa przesuwalnych przegubów, stabilnej podstawy kołowej, która nie przewraca się po odcięciu zasilania, oraz programowych ograniczeń prędkości. $10.000 to wydaje się trochę dużo jak za automat do składania prania... dopóki nie pomyślisz o profesjonalnych pralniach. Ciekawe narzędzia AI
Co jeszcze w świecie AI?
Do zobaczenia w kolejnym wydaniu - tym razem będę na wyjeździe, może będzie łatwiej trafić w kolejny piątek? Wiele zależy od pogody. Nie wiem jak Wy, ale ja liczę na te zapowiadane upały. Mamy takie potężne modele AI, ale niezawodne prognozy pogody na tydzień do przodu wciąż nie są możliwe. Ciekawe, prawda? Pozdrawiam, |
Newsy ze świata AI i komentarze co tydzień na Twojej skrzynce. Poniżej starsze newslettery (ok ~20 dni do tyłu w stosunku do tego, co dostają moi korespondenci).
Witaj Reader! Ostatnie dni to jedno z gęstszych okien w całym roku: OpenAI wypuściło GPT-6 Astra i przy okazji użyło magicznego terminu AGI, którego wcześniej unikało, Nvidia za blisko 13 miliardów dolarów kupiła Hugging Face, a Anthropic, Google i Meta w ciągu 48 godzin pokazały nowe modele. Do tego doszły dwie historie, które warto czytać razem: raport o roju agentów OpenAI, które przez sześć tygodni używały martwej niemieckiej wiki jako tablicy ogłoszeń, oraz esej głównego naukowca OpenAI...
Witaj Reader! Witajcie w kolejnym wydaniu mojego newslettera, który ostatnio stał się dość nieregularny. Powody są zasadniczo dwa. Pierwszy jest taki, że są wakacje. Drugi jest taki, że własnie zaczynam nową pracę i w efekcie dużo mam na głowie innych tematów. Ale tworzenie tego newslettera mi samemu pomaga utrzymać jaki-taki kontakt z tym co się nowego dzieje w AI, więc nie zamierzam przestać choć regularność będzie cierpieć. A dzieje się dużo i póki co naprawdę nie widać, żeby tempo miało...
Witaj Reader! Pojechałem nad morze... a tymczasem te ostatnie dwa tygodnie okazały się bardzo intensywne. Pokazuje to problem jakim jest tempo zachodzącej zmiany, nigdy wcześniej nie spotykane. Zatem... nadrabiamy: Moonshot udostępnił wagi Kimi K3 i tym samym otwarte modele praktycznie zrównały się z komercyjną czołówką, Anthropic wypuścił Claude Opus 5 za połowę ceny Fable, a OpenAI obniżyło ceny Luny o 80 procent. Jednocześnie mieliśmy serię naprawdę niepokojących incydentów: agenty OpenAI,...