[AI] Claude Opus 4.8 pisze 80% kodu Anthropic, Microsoft uniezależnia się od OpenAI, a Tesla wypuszcza robotaxi bez kierowcy


Witaj Reader!

Miniony świąteczny tydzień przyniósł sygnały, które razem układają się w jeden obraz: AI przestaje być eksperymentem, a zaczyna być infrastrukturą.

Anthropic ujawnił, że Claude generuje już 80% kodu trafiającego do produkcji w samej firmie a Microsoft pokazał własny model frontier wytrenowany od zera na własnym krzemie. Powracają też trudne pytania: Bain & Company stwierdza, że wdrożenia AI działają technicznie, ale obiecane oszczędności nie pojawiają się w bilansach, a Anthropic publicznie apeluje o globalną pauzę nad rozwojem AI ze względu na ryzyko rekurencyjnego samodoskonalenia modeli.

Dużo się działo - zapraszam do lektury.

🤖 Claude Opus 4.8 i dynamiczne workflow zmieniają zasady gry w programowaniu

Anthropic wypuścił Claude Opus 4.8 w cenie identycznej jak poprzednik, ale z istotnymi ulepszeniami. Model jest około czterokrotnie mniej skłonny do "zamiatania pod dywan" błędów we własnym kodzie i częściej otwarcie przyznaje, że czegoś nie wie - co w praktyce oznacza większą wiarygodność w długotrwałych zadaniach. Wprowadzono też pięciostopniową kontrolę "wysiłku" (od Low do Max oraz ultracode), pozwalającą decydować, ile mocy obliczeniowej model ma przeznaczyć na zadanie. Fast Mode jest teraz 2,5x szybszy i trzykrotnie tańszy od poprzednich wersji.

Najważniejsza nowość to "dynamic workflows" w Claude Code. Zamiast jednego agenta pracującego sekwencyjnie, Claude pisze skrypt orkiestracyjny w JavaScript, który uruchamia do 16 równoległych subagentów (maksymalnie 1000 na sesję), sprawdza ich wyniki, atakuje słabe miejsca i iteruje aż do konwergencji. Twórca runtime'u Bun, Jarred Sumner, użył tej funkcji do przepisania całego projektu z języka Zig na Rust - 750 000 linii kodu, 99,8% testów przechodzących, 11 dni od pierwszego commita do merge. To oczywiście tylko demo niemniej robiące wrażenie, bo to jest projekt, który niedawno planowano by na kwartały.

W niezależnym benchmarku GDPval-AA mierzącym realne zadania agentowe, Opus 4.8 osiągnął 1890 punktów - o 137 więcej niż 4.7 i o 121 więcej niż następny w kolejce model.

​Czytaj więcej | Czytaj więcej (dynamic workflows)​

💼 Anthropic: 80% kodu w produkcji pisze już Claude, ostrzeżenie o rekurencyjnym samodoskonaleniu

Anthropic ujawnił, że w maju 2026 ponad 80% kodu trafiającego do produkcji w samej firmie napisał Claude, a średnia produktywność inżyniera wzrosła ośmiokrotnie w porównaniu do lat 2021-2024. Claude Opus 4.6 potrafi już samodzielnie pracować nad zadaniem przez 12 godzin, a wewnętrzny Claude Mythos Preview - przez ponad 16 godzin. W odizolowanych testach optymalizacji kodu treningowego AI, Mythos osiągnął 52-krotne przyspieszenie - dla porównania, doświadczony inżynier zwykle uzyskuje 4-krotne w 4-8 godzin.

Anthropic opublikował również ostrzeżenie, że obserwuje "wczesne oznaki rekurencyjnego samodoskonalenia" w obecnych systemach i nazywa to "potencjalnie najważniejszą kwestią bezpieczeństwa na pograniczu AI w nadchodzącej dekadzie". Firma wzywa do globalnej koordynacji laboratoriów AI nad mechanizmem "awaryjnego hamulca" - uzgodnionych warunków, które wymuszałyby pauzę w rozwoju. To rzadki moment, w którym lider rynkowy publicznie mówi, że tempo postępu może zacząć przekraczać tempo, w jakim ludzie potrafią je kontrolować.

Jednocześnie w tym samym tygodniu Anthropic złożył poufny dokument S-1 w SEC, otwierając drogę do IPO przy wycenie 965 miliardów dolarów, po rundzie finansowania 65 mld w Serii H.

​Czytaj więcej | Czytaj więcej (S-1)​

🪟 Microsoft uniezależnia się od OpenAI - własny model frontier na własnym krzemie

Na konferencji Build 2026 Microsoft pokazał siedem własnych modeli MAI wytrenowanych od zera, bez destylacji z modeli OpenAI. Flagowy MAI-Thinking-1 to model rozumujący z 35 miliardami aktywnych parametrów (Mixture-of-Experts) i kontekstem 256K tokenów, działający na własnym chipie Maia 200 (Microsoft deklaruje 1,4x lepszą wydajność na wat niż NVIDIA GB200). W niezależnych ślepych testach raterzy mieli preferować jego odpowiedzi od Claude Sonnet 4.6, a na SWE-Bench Pro dorównuje Claude Opus 4.6. Pozostałe modele to MAI-Image-2.5 (już zintegrowany z PowerPointem), MAI-Code-1-Flash (w GitHub Copilot), MAI-Transcribe-1.5 (43 języki, 5x szybszy od konkurencji), MAI-Voice-2 i inne.

Strukturalna zmiana jest istotniejsza niż same benchmarki. Microsoft kontroluje teraz cały stos - od krzemu (Maia 200), przez modele (MAI), runtime (Foundry), po dystrybucję (Microsoft 365 i GitHub). Dla CIO oznacza to, że pytanie "jak bardzo jesteśmy narażeni, jeśli OpenAI zmieni ceny" zyskało nową, czysto microsoftową odpowiedź.

Firma zaprezentowała też Surface RTX Spark Dev Box (1 petaflop AI, 128 GB pamięci, zdolny lokalnie uruchamiać modele do 120 mld parametrów), system Microsoft Execution Containers do bezpiecznego izolowania agentów AI oraz Frontier Tuning - "treningowe siłownie" dla modeli dopasowanych do konkretnych workflow firmowych.

​Czytaj więcej​

Po niesmaku jaki pozostał mi z prób korzystania z Microsoft Copilot rok temu (na popsutym przez MS GPT 4) nie mam chwilowo ochoty na testowanie MAI. Ale może ktoś z Was się nim "bawił"? Chętnie się dowiem jakie są Wasze wrażenia.

🏥 Microsoft i Mayo Clinic budują dedykowany model AI dla medycyny

Microsoft i Mayo Clinic ogłosiły wspólną pracę nad modelem AI wytrenowanym wyłącznie na danych medycznych - dokumentacji pacjentów, badaniach naukowych i wiedzy klinicystów słynnego szpitala. To odpowiedź na rosnący problem: dziesiątki milionów ludzi używa już ChatGPT i podobnych narzędzi do pytań zdrowotnych, ale uniwersalne modele uczone na szerokich danych z internetu często udzielają nieprecyzyjnych lub wręcz niebezpiecznych odpowiedzi. Mayo Clinic w przeszłości publicznie ostrzegała przed informacjami zdrowotnymi z chatbotów ogólnego przeznaczenia.

Model będzie własnością Mayo Clinic, a docelowo ma napędzać zarówno narzędzia dla klinicystów, jak i asystenta zdrowotnego dostępnego dla pacjentów przez portal szpitala. Może też poprawić jakość odpowiedzi Microsoft Copilot na pytania medyczne. CEO Mustafa Suleyman ostrzegł jednak, że doprowadzenie modelu do poziomu wystarczającej dokładności do zastosowań klinicznych zajmie "wiele lat" - na początku będzie testowany wyłącznie przez personel Mayo.

​Czytaj więcej​

To projekt warty obserwowania, bo medycyna jest jednym z obszarów, w którym specjalizowane modele oparte na unikalnych, wysokiej jakości danych mogą zyskać realną przewagę nad ogólnymi LLM-ami. Z drugiej strony warto zauważyć, że mamy do czynienia z systematycznym ograniczaniem wszelkich podejść do medycyny innych niż sterowane przez "big pharma" i LLM-y tego rodzaju mogą być tu świetnym narzędziem, by proces ten domknąć. Dlaczego to byłoby złe to temat na osobny dłuższy artykuł, ale ogólnie zwiększanie uniformizacji w złożonym systemie zmniejsza odporność tegoż systemu.

📊 Bain: technologia działa, ale obiecane oszczędności nie pojawiają się w bilansach

Bain & Company opublikował raport, który podsumowuje jednym zdaniem: "Technologia zadziałała. Wartość nie nadeszła." Większość wdrożeń enterprise AI działa zgodnie z projektem, modele robią to, co miały robić, ale prognozowane oszczędności kosztów nie pojawiają się w wynikach finansowych w obiecanych terminach. Bain interpretuje to jako problem prognoz, nie technologii - business case'y były zbyt optymistyczne, a nie sama AI niewystarczająca. Wątek osiągnął ponad 450 tysięcy wyświetleń w mediach społecznościowych.

To ma praktyczne konsekwencje dla każdego, kto prowadzi wewnętrzne projekty AI. Działający pilot, który nie spełnia oryginalnego modelu oszczędności, jest zwykle traktowany przez dział finansowy jako porażka - choć powinien być traktowany jako sukces techniczny, w oparciu o który należy zbudować inny case wartości (przychody, jakość, retencja). Zespoły, które przeforsują budżet na drugą rundę, to te, które same zmienią ramy oceny zanim zrobi to dyrektor finansowy. W tym samym czasie ankieta BCG pokazuje, że firmy często marnują uzyskane zyski wydajności, bo brakuje im jasnej strategii, gdzie te oszczędności realokować.

​Czytaj więcej​

Po latach spędzonych na zajmowaniu się próbami usprawniania procesów w firmach z pomocą różnych fajnych metod mam na ten temat inne zdanie: wielkie firmy są inherentnie nieefektywne i marnotrawne, wprowadzenie AI do bezsensownych procesów i głupich projektów nie zmieni tego. Jednak konstrukcja tychże firm jest optymalna dla obecnego modelu społeczno-ekonomicznego i aby nastąpiła istotna poprawa konieczna byłaby jego przebudowa - i to fundamentalna, poczynająca się od pytania: czy celem ekonomii jest ciągły wzrost zysków? I czy ciągły wzrost zysków jest w ogóle możliwy?

🚗 Tesla uruchamia robotaxi w Austin - bez kierowcy w pojeździe

Dyrektor AI Tesli Ashok Elluswamy potwierdził, że firma uruchomiła w obszarze Austin (stolica Teksasu) komercyjną usługę robotaxi, w pełni automatycznych taksówek bez ludzkiego operatora w pojeździe. Drugi dzień działania przebiegł bez incydentów, w realnym ruchu komercyjnym, a nie w zamkniętej pętli testowej. Waymo prowadzi podobną usługę w San Francisco od lat, ale potrzebowała na to dekady i kosztownej strategii opartej na małych geofencingach.

Tesla twierdzi, że osiąga ten sam efekt przy innej strukturze kosztów i na większym obszarze. To znacząca zmiana - jeśli liczby przewozów na incydent okażą się akceptowalne, regulatorzy w kolejnych miastach mogą pójść za przykładem Austin. To także sygnał dla całej branży autonomicznych pojazdów: tempo wdrożeń komercyjnych może przyspieszyć. Najważniejsza miara do śledzenia w nadchodzących kwartałach to liczba incydentów na milion mil (kilometrów) - to ona zdecyduje, czy ten model się skaluje.

​Czytaj więcej​

Już od pewnego czasu przewiduję, że w ciągu około dwóch dekad możemy doczekać zakazu prowadzenia samochodów przez ludzi poza torami wyścigowymi i jakimiś skansenami dla aut zabytkowych.

🎨 Gemini 3.5 Flash i Gemma 4 12B - Google idzie w multimodalność i lokalność

Google na konferencji I/O 2026 zaprezentował Gemini 3.5 Flash z istotnymi zmianami: wprowadza konfigurowalne poziomy rozumowania, zachowanie kontekstu rozumowania między turami i mocno poprawione możliwości agentowe. W benchmarku APEX-Agents-AA (zadania z bankowości inwestycyjnej, konsultingu i prawa korporacyjnego) Gemini 3.5 Flash zajął pierwsze miejsce z 47,1% trafności, prawie 10 punktów procentowych przed GPT-5.5. Ceny i tempo generowania (204 tokeny na sekundę) czynią go atrakcyjnym dla aplikacji o niskiej latencji - choć Google "Flash" przestaje oznaczać "tani", bo niektóre testy pokazują, że jest droższy niż Gemini 3.1 Pro.

W tym samym tygodniu Google wypuścił też Gemma 4 12B - otwartoźródłowy multimodalny model, który mieści się w 16 GB pamięci typowego laptopa. Ciekawą zmianą architektoniczną jest rezygnacja z osobnych enkoderów dla obrazu i dźwięku - sygnały trafiają bezpośrednio do głównego modelu LLM przez lekkie warstwy projekcji. To pierwszy średni model Google z natywnym przetwarzaniem dźwięku, pozwalający na transkrypcję, formatowanie i tłumaczenie offline. Wydany na licencji Apache 2.0, dostępny w Hugging Face i Kaggle - dobry wybór dla zespołów, które chcą uruchamiać AI lokalnie bez wysyłania danych do chmury.

​Czytaj więcej (Gemini 3.5 Flash) | Czytaj więcej (Gemma 4)​

Ważne. Niemniej czekam na Gemini 4, bo Google znów zaczął odstawać od czołówki.

Ciekawe narzędzia AI

  • ​Codex Plugins and Sites - OpenAI rozszerza Codex poza programowanie. Wtyczki dla ról (data analytics, sales, design, equity investing) i funkcja Sites pozwalająca tworzyć interaktywne aplikacje z bazą danych dostępne przez URL.
  • ​Runway MCP - Runway dodał wsparcie MCP, pozwalając generować obrazy i wideo bezpośrednio w Claude, ChatGPT, Cursor i innych narzędziach bez przełączania kontekstu.
  • ​ElevenLabs Music v2 - nowy model AI do tworzenia muzyki potrafiący komponować dłuższe utwory z dynamicznymi zmianami gatunków w jednym kawałku.
  • ​Factory Router - warstwa automatycznie wybierająca najlepszy model dla danego zadania, z deklarowanym obniżeniem kosztów o około 25%.
  • ​Wandesk - open source’owy desktop AI z dostępem do lokalnych aplikacji i pamięcią na urządzeniu.

Co jeszcze w świecie AI?

  • Alphabet (Google) zebrał rekordowe 85 miliardów dolarów w sprzedaży akcji (z Berkshire Hathaway jako głównym inwestorem za 10 mld), by sfinansować inwestycje infrastrukturalne w AI na poziomie 180-190 miliardów dolarów. Czytaj więcej​
  • UE złagodziła wymogi AI Act - opóźnione zostały terminy zgodności dla systemów wysokiego ryzyka oraz uproszczono część obowiązków dla małych firm. Czytaj więcej Pytanie czy nie za późno?
  • NVIDIA przedstawiła Cosmos 3 - otwarty multimodalny model fundamentowy łączący język, wideo, dźwięk i akcje robotyczne, oraz Nemotron 3 Ultra (550 mld parametrów MoE) zoptymalizowany dla długodystansowych agentów. Czytaj więcej​
  • Robinhood otworzył platformę dla agentów AI - użytkownicy mogą podłączać zewnętrzne agenty do handlu akcjami przez serwer MCP, a Interactive Brokers zintegrował Claude do analizy portfela i przygotowywania zleceń. Czytaj więcej​
  • Anthropic NSA: według doniesień Financial Times, kilkoro inżynierów Anthropic jest "forward-deployed" w NSA, by pomagać agencji wykorzystywać Claude Mythos do ofensywnych operacji cybernetycznych. Czytaj więcej Zero zdziwień, prawda?
  • Użytkownicy GitHub Copilot doświadczają szoku cenowego. Czytaj więcej​
  • OpenAI Foundation uruchomił grant 250 milionów dolarów na pomoc pracownikom i gospodarkom w nawigowaniu zmian wywołanych AI oraz Stargate Michigan - kampus data center o mocy 1 GW. Czytaj więcej​
  • SoftBank ogłosił inwestycję 75 miliardów euro w budowę centrów danych AI we Francji o łącznej mocy 5 GW - z fazą pierwszą za 45 mld w regionie Hauts-de-France. Czytaj więcej
  • Salesforce w pierwszym w historii kwartale z przychodami 11,1 mld dolarów ujawnił, że platforma Agentforce przetworzyła 28,6 biliona tokenów (wzrost 152% kwartał do kwartału). Czytaj więcej​
  • Badacze bezpieczeństwa pokazali atak prompt injection przez audio, w którym pozornie normalny dźwięk może manipulować zachowaniem asystenta Gemini. Czytaj więcej​
  • WhaleSpotter wykorzystuje kamery termiczne i AI, by wykrywać wieloryby w czasie rzeczywistym i ostrzegać statki przed kolizjami z nimi. Czytaj więcej​

To wydanie pokazuje, że krajobraz AI rozwija się (jeśli tak można powiedzieć) w kilku kierunkach jednocześnie. Modele stają się bardziej autonomiczne i wiarygodne (Claude Opus 4.8, dynamic workflows, robotaxi Tesli), wielcy gracze coraz mocniej kontrolują cały stos (Microsoft z MAI, Google z Gemma 4), a jednocześnie pojawiają się publiczne ostrzeżenia od samych liderów branży o granicach, które trzeba ustalić zanim będzie za późno (Anthropic o rekurencyjnym samodoskonaleniu).

W tle widać też ekonomiczną rzeczywistość: raport Bain pokazuje, że technologia działa, ale korzyści się nie pojawiają a zmiana sposobu rozliczeń i podnoszenie cen przez laby szukające przychodów prowadzi do "szoku cenowego" dla użytkowników.

Jeśli to wydanie było dla Ciebie wartościowe, prześlij je znajomym, którzy też próbują nadążyć za tym, co dzieje się w AI. Do następnego tygodnia!

Pozdrawiam,
Andy

PS. W przyszłym tygodniu będę przez kilka dni w Warszawie. Jeśli ktoś ma ochotę pogadać na żywo to dajcie znać.

Newsletter o AI od Andy Brandt

Newsy ze świata AI i komentarze co tydzień na Twojej skrzynce. Poniżej starsze newslettery (ok ~20 dni do tyłu w stosunku do tego, co dostają moi korespondenci).

Read more from Newsletter o AI od Andy Brandt

Witaj Reader! Ostatnie dni to jedno z gęstszych okien w całym roku: OpenAI wypuściło GPT-6 Astra i przy okazji użyło magicznego terminu AGI, którego wcześniej unikało, Nvidia za blisko 13 miliardów dolarów kupiła Hugging Face, a Anthropic, Google i Meta w ciągu 48 godzin pokazały nowe modele. Do tego doszły dwie historie, które warto czytać razem: raport o roju agentów OpenAI, które przez sześć tygodni używały martwej niemieckiej wiki jako tablicy ogłoszeń, oraz esej głównego naukowca OpenAI...

Witaj Reader! Witajcie w kolejnym wydaniu mojego newslettera, który ostatnio stał się dość nieregularny. Powody są zasadniczo dwa. Pierwszy jest taki, że są wakacje. Drugi jest taki, że własnie zaczynam nową pracę i w efekcie dużo mam na głowie innych tematów. Ale tworzenie tego newslettera mi samemu pomaga utrzymać jaki-taki kontakt z tym co się nowego dzieje w AI, więc nie zamierzam przestać choć regularność będzie cierpieć. A dzieje się dużo i póki co naprawdę nie widać, żeby tempo miało...

Witaj Reader! Pojechałem nad morze... a tymczasem te ostatnie dwa tygodnie okazały się bardzo intensywne. Pokazuje to problem jakim jest tempo zachodzącej zmiany, nigdy wcześniej nie spotykane. Zatem... nadrabiamy: Moonshot udostępnił wagi Kimi K3 i tym samym otwarte modele praktycznie zrównały się z komercyjną czołówką, Anthropic wypuścił Claude Opus 5 za połowę ceny Fable, a OpenAI obniżyło ceny Luny o 80 procent. Jednocześnie mieliśmy serię naprawdę niepokojących incydentów: agenty OpenAI,...