[AI] AI chemik w laboratorium, GLM-5.2 i nowa pamięć agentów


Witaj Reader!

Mimo szoku jakim było wyłączenie Fable 5 na polecenie rządu amerykańskiego w ostatni weekend branża nie zwalnia. Chiński Z.ai wypuszcza mocny otwarty model dostępny za1 ułamek ceny pokazując, że jest alternatywa dla wiodących amerykańskich labów.

Z kolei OpenAI pokazuje niemal autonomicznego chemika a Claude dostaje funkcje, które mają ułatwić wdrażanie agentów w organizacjach. Do tego dochodzi temat pamięci i wiedzy agentów - Google, Perplexity i badacze akademiccy coraz wyraźniej pokazują, że samo "większe okno kontekstu" nie rozwiąże problemu.

Przejdźmy do szczegółow.

🚫 Rząd USA wyłącza Fable 5 - dalszy ciąg...

Saga wokół najlepszych modeli Anthropic trwa. Jak pamiętacie tydzień temu na polecenie rządu USA Anthropic wyłączył Claude Fable 5 i Mythos 5 dla wszystkich użytkowników na świecie - włącznie z płacącymi klientami korporacyjnymi, partnerami rządowymi i badaczami z aktywnymi zadaniami. To pierwszy w historii przypadek, gdy amerykańska dyrektywa eksportowa sięgnęła do wnętrza laboratorium AI i wyłączyła działający model. Z pełnej treści listu jaki otrzymało Anthropic (która wyciekła na Reddit) wynika, że modele uznano za potencjalne zagrożenie bezpieczeństwa narodowego podlegające jurysdykcji BIS, a ograniczenie obejmuje "osoby zagraniczne" nawet przebywające na terenie USA - udostępnienie im modelu liczy się jako "domniemany eksport". Według doniesień The Information bezpośrednim katalizatorem był telefon CEO Amazona Andy'ego Jassy'ego do kogoś z rządu USA.

Toczy się już spór o sens tej decyzji. Wielu komentatorów twierdzi, że panika na rynku jest przesadzona i Fable wróci do użytku w ciągu dni, gdy Anthropic wdroży bramkę zgodności. Inni uważają, że spełnienie warunków rządu USA (gwarancja, że nie da się obejść zabezpieczeń) nie jest technicznie możliwe. Precedens jest jednak tym, czego się nie cofnie: jeśli rząd raz użył dyrektywy eksportowej wobec wiodącego modelu, to opcja ta zostaje "na stole" przy każdej kolejnej premierze.

Andrew Ng z DeepLearning.AI nazwał to "momentem, którego nie da się odzobaczyć" i wskazał, że wydarzenie gwałtownie przyspiesza wysiłki firm i państw na rzecz zapewnienia sobie dostępu do AI, którego nikt nie może odebrać.

​Czytaj więcej (esej Andrew Nga) | Czytaj więcej (treść listu sekretarza Lutnicka do Anthropic)​

I tu wraca temat tego: a co z naszym krajem? Czy Bielik wystarczy?

👨‍💻 GLM-5.2: otwarte wagi, milion tokenów kontekstu i mocne wyniki w kodowaniu

Chińskie Z.ai (wcześniej Zhipu AI) wypuściło GLM-5.2 - model o 753 miliardach parametrów, zaprojektowany specjalnie pod długie, agentowe zadania inżynierii oprogramowania. Model ma stabilne okno kontekstu na poziomie 1 miliona tokenów i został udostępniony na licencji MIT, co oznacza, że firmy mogą go pobierać, modyfikować, hostować i komercyjnie wykorzystywać bez typowych ograniczeń licencyjnych zamkniętych platform.

Technicznie najciekawsza jest optymalizacja IndexShare, która zmniejsza koszt obliczeń przy długim kontekście, oraz tryby rozumowania "High" i "Max", pozwalające wybierać między szybkością a głębszą analizą. W benchmarkach GLM-5.2 wypada bardzo mocno: na SWE-bench Pro osiągnął 62,1, przebijając podane wyniki GPT-5.5, a na FrontierSWE uzyskał 74,4%, czyli poziom bliski Claude Opus 4.8. API kosztuje według VentureBeat 1,40 dolara za milion tokenów wejściowych i 4,40 dolara za wyjściowe, znacznie mniej niż wiele zachodnich modeli frontier.

Dla firm to istotne nie tylko z powodu ceny. Otwarty, lokalnie hostowalny model tej klasy jest atrakcyjny dla organizacji, które chcą ograniczyć zależność od jednego dostawcy, chronić kod źródłowy i mieć większą kontrolę nad dostępnością infrastruktury AI. GLM-5.2 nie musi być najlepszy we wszystkim, ale pokazuje, że mocne modele do długich zadań programistycznych przestają być wyłącznie domeną zamkniętych API.

​Czytaj więcej | wypróbuj​

Jeżeli chińskie darmowe modele staną się realną konkurencją za ułamek ceny (a do tego nie podlegającą kaprysom rządu USA) to jakie jest uzasadnienie idących w miliardy dalszych kosztów topionych w OpenAI i innych? A dodatkowo, ponoć ten model został wytrenowany bez użycia w ogóle chipów NVidia...

🧪 OpenAI pokazuje niemal autonomicznego chemika

OpenAI, we współpracy z Molecule.one, podłączyło GPT-5.4 do systemu Maria - agentowej platformy chemicznej z dostępem do zautomatyzowanego laboratorium. Model dostał otwarty cel: poprawić jedną z ważnych klas reakcji w chemii medycznej. System generował propozycje badawcze, projektował eksperymenty, analizował dane i sugerował kolejne kroki, a ludzie wybierali najlepsze hipotezy, korygowali szczegóły oraz weryfikowali wyniki.

Najciekawszy wynik dotyczy reakcji Chan-Lam coupling dla primary sulfonamides, czyli trudnej, ale bardzo użytecznej klasy reakcji przy tworzeniu wiązań w związkach podobnych do leków. GPT-5.4 wskazał TEMPO jako zaskakujący dodatek poprawiający reakcję. W dwóch cyklach Maria Lab uruchomiła 10 080 reakcji, a zoptymalizowane warunki poprawiły wydajność dla 88% testowanych kwasów boronowych i 83% sulfonamidów. Średnia wydajność wzrosła z 16,6% do 25,2%, a ręczne eksperymenty w skali laboratoryjnej potwierdziły poprawę dla 11 z 14 par substratów.

To nie znaczy, że AI samodzielnie prowadzi już program badawczy od początku do końca. Pokazuje jednak coś bardzo ważnego: model może zaproponować nietrywialną hipotezę, przejść przez dużą liczbę eksperymentów i dostarczyć wynik, który ludzkim chemikom pozostaje ocenić. OpenAI równolegle pokazało LifeSciBench, benchmark dla modeli pracujących nad realnymi zadaniami z nauk biologicznych, więc wyraźnie buduje narrację wokół AI jako narzędzia do przyspieszania nauki, a nie tylko pisania tekstu i kodu.

​Czytaj więcej | Czytaj więcej​

🩺 Midjourney wkracza w medycynę: skaner całego ciała w 60 sekund

Słynna z generowania obrazów Midjourney ogłosiła zaskakujący zwrot w stronę profilaktycznej opieki zdrowotnej, tworząc dywizję Midjourney Medical. Jej pierwszym produktem jest Midjourney Scanner - ultradźwiękowa maszyna do skanowania całego ciała, mająca dostarczać jakość obrazu zbliżoną do MRI w mniej niż 60 sekund (dla porównania tradycyjny MRI trwa 60-90 minut). Pacjent zanurza się w płytkim basenie z wodą, gdzie pierścień 500 000 czujników działa jak echolokacja delfina, emitując fale dźwiękowe mapujące mięśnie, tłuszcz, kości i organy w szczegółowej mapie 3D - bez szkodliwego promieniowania i pól magnetycznych.

Urządzenie powstało we współpracy z Butterfly Network, wykorzystując 40 modułów "Ultrasound-on-Chip" i dwa petaflopy mocy obliczeniowej. Początkowe skany skupią się na mapowaniu kompozycji ciała, co nie wymaga ścisłego dopuszczenia FDA. Midjourney planuje otworzyć pierwsze spa wyposażone w skaner na Union Square w San Francisco do końca 2027 roku. CEO David Holz ma ambitny cel: 50 000 skanerów na świecie do 2031 roku, by dzięki wczesnemu obrazowaniu uniknąć 30% wszystkich zgonów i obniżyć koszty opieki zdrowotnej o połowę. Warto pamiętać, że Midjourney jest rentowny od startu i nigdy nie pozyskał kapitału venture.

​Czytaj więcej​

Właśnie się niedawno zastanawiałem co się dzieje z MidJoruney, którego "gwiazda" jako lidera w generowaniu obrazów wyraźnie przygasła, a który zarazem był jedynym poważnym labem AI, który nie brał żadnych pieniedzy od venture capital. A tu proszę, taki newsik... bardzo ciekawa koncepcja swoją koncepcja, oby się sprawdziła bo szybsza i tańsza diagnostyka to podstawa lepszego leczenia (dużo lepiej się leczy ja się wie co jest nie tak!).

🛠️ Cursor buduje własny stos dla programowania z agentami

Cursor zapowiedział Origin, własną usługę hostingu repozytoriów, która ma wystartować jesienią i jest już dostępna w formie listy oczekujących. To wygląda jak pierwszy krok w stronę alternatywy dla GitHuba, zaprojektowanej pod pracę z agentami, a nie wyłącznie pod klasyczne repozytoria kodu. W tym samym czasie Cursor pokazał też pomysły na płynniejsze przechodzenie między agentami lokalnymi i chmurowymi oraz zapowiedział model mający robić więcej niż tylko kodowanie.

Ta informacja nabiera większej wagi w kontekście doniesień o przejęciu Anysphere, firmy stojącej za Cursorem, przez SpaceX. Według źródeł branżowych Cursor ma stać się częścią znacznie większej strategii infrastrukturalnej, obejmującej nie tylko IDE, ale też własne modele i środowiska dla agentów. Jeśli narzędzie, którego używa zespół programistyczny, staje się jednocześnie platformą modelową, systemem wersjonowania i warstwą automatyzacji, decyzje zakupowe przestają dotyczyć tylko wygody edytora.

Dla deweloperów praktyczny wniosek jest prosty: warto śledzić, czy Cursor pozostanie neutralną warstwą nad różnymi modelami, czy będzie coraz mocniej promował własny ekosystem. Origin może być ciekawym produktem, ale też sygnałem, że rynek narzędzi programistycznych z AI zmienia się z "edytor plus chatbot" w pełne środowiska pracy dla ludzi i agentów.

​Czytaj więcej | Czytaj więcej | zapisz się na waiting list na Origin

🧩 Claude ułatwia firmowe wdrażanie agentów i współdzielenie pracy

Anthropic dodał do Claude Code obsługę artifacts, czyli żywych, interaktywnych stron tworzonych z pełnego kontekstu sesji. Taki artifact może być opisem incydentu, podsumowaniem pull requestu, dashboardem, checklistą wydania albo wizualnym wyjaśnieniem systemu. Strona aktualizuje się w tym samym linku, ma historię wersji i może być udostępniana zespołowi w organizacji.

To rozwiązuje bardzo praktyczny problem: agent może wykonać dużo pracy, ale zespół nadal potrzebuje zrozumiałego, wspólnego widoku tego, co się wydarzyło. Jeśli Claude Code analizuje logi, znajduje podejrzane commity i buduje hipotezę źródła awarii, artifact może stać się miejscem, do którego zagląda cały zespół, zamiast słuchać ustnego "co znalazł agent". Funkcja jest dostępna w becie dla planów Team i Enterprise.

Druga nowość dotyczy zarządzania konektorami MCP w firmach. Claude wprowadza enterprise-managed authorization, startując od Okta, dzięki czemu administrator może raz skonfigurować dostęp do konektorów dla całej organizacji, a użytkownicy otrzymują je automatycznie przy logowaniu. To ważne, bo MCP staje się praktyczną warstwą integracji agentów z narzędziami pracy, a bez centralnego zarządzania uprawnieniami szybko robi się z tego nowe źródło chaosu bezpieczeństwa.

​Czytaj więcej | Czytaj więcej​

🗂️ Pamięć agentów: Google stawia na OKF a Perplexity na Brain

Google opublikowało Open Knowledge Format, czyli otwartą specyfikację opisywania wiedzy organizacyjnej w prostym formacie: katalog plików Markdown z metadanymi YAML. Każdy plik opisuje pojedynczy koncept, na przykład tabelę w bazie danych, metrykę biznesową, endpoint API albo playbook operacyjny. Minimalizm jest tu celowy: jedyne obowiązkowe pole to type, a reszta ma być czytelna zarówno dla ludzi, jak i agentów.

Dlaczego to ważne? Bo agenci w firmach bardzo często nie zawodzą dlatego, że model jest za słaby, tylko dlatego, że wiedza organizacyjna jest rozproszona między wiki, kodem, dashboardami, komentarzami, arkuszami i głowami kilku osób. OKF próbuje stworzyć neutralną warstwę, którą różne systemy mogą zapisywać i czytać bez wiązania się z jedną platformą. Google dostarcza też przykładowy agent wzbogacający dane BigQuery i wizualizator grafu wiedzy.

Perplexity idzie w podobnym kierunku od strony produktu, pokazując Brain - pamięć agenta, która śledzi nie tylko preferencje użytkownika, ale też przebieg pracy, błędy, poprawki i źródła prowadzące do ślepych uliczek. Według Perplexity Brain poprawia trafność odpowiedzi o 25% i recall o 16% w zadaniach z historią.

Z kolei badanie AgingBench z UT Austin przypomina, że pamięć agentów potrafi się psuć: kompresja, interferencja podobnych faktów, nieaktualne dane i operacje konserwacyjne mogą sprawić, że agent odpowiada pewnie, ale błędnie.

​Czytaj więcej | Czytaj więcej

Kolejny news jest na tyle ciekawe, że choć dotyczy tego samego tematu - pamięci - postanowiłem potraktować go szerzej.

🧠 Dlaczego agenci AI "starzeją się" i zapominają

Naukowcy z University of Texas at Austin opublikowali badanie wyjaśniające zjawisko, które frustruje wielu użytkowników agentów AI: model "out of the factory" jest świetny, ale po kilku sesjach jego trafność spada. Profesor Atlas Wang nazywa to "starzeniem się agenta" - długie okna kontekstowe i bufory pamięci stają się obciążeniem, bo agent pamięta zbyt wiele, zbyt wiele rzeczy konkuruje o jego uwagę, a pamięć po prostu staje się niedokładna. Zespół stworzył benchmark AgingBench symulujący długotrwałe wdrożenia agentów i przetestował 14 modeli (m.in. GPT-4o, Opus-4.7, DeepSeek) w ponad 400 przebiegach.

Badacze opisali cztery główne sposoby, w jakie AI zapomina.

  • "Starzenie kompresyjne": agent decyduje, co zapamiętać, zanim wie o co zostanie zapytany, więc dokładne liczby i nazwy zostają zastąpione mglistymi podsumowaniami (np. "bierzesz dzienny lek" zamiast "50 mg metoprololu dwa razy dziennie").
  • "Starzenie interferencyjne": poprawny fakt pozostaje, ale rosnący stos podobnych wpisów sprawia, że agent wyciąga niewłaściwy (np. wysyła mail do Johna Smytha zamiast Johna Smitha).
  • "Starzenie rewizyjne": agent przegapia aktualizację i odpowiada na podstawie nieaktualnych danych.
  • "Starzenie konserwacyjne": rutynowe czyszczenie czy zmiana promptu psuje coś, co agent wcześniej wiedział.

Co kluczowe - nie było jednoznacznego zwycięzcy - żaden z badanych modeli nie był wyraźnie lepszy od pozostałych, a samo dodawanie pamięci problemu nie rozwiązuje.

​Czytaj więcej | zobacz benchmark​

🧭 DeepMind opisuje cztery drogi od AGI do superinteligencji

Google DeepMind opublikował 60-stronicowy tekst "From AGI to ASI", w którym porządkuje możliwe ścieżki od ogólnej sztucznej inteligencji do superinteligencji. Autorzy definiują AGI jako system osiągający medianę ludzkiego poziomu w większości zadań poznawczych, a ASI jako coś znacznie dalej idącego: system przewyższający dziesiątki tysięcy najlepszych ekspertów współpracujących przez dekadę nad jednym problemem.

W dokumencie pojawiają się cztery scenariusze: dalsze skalowanie modeli, przełom algorytmiczny poza obecnym paradygmatem transformerów, rekurencyjne samodoskonalenie oraz kolektywna inteligencja wielu agentów. DeepMind wskazuje też bariery, które mogą spowolnić ten proces: ścianę danych, koszty energii i infrastruktury oraz problem tworzenia naprawdę nowych abstrakcji, a nie tylko rekombinowania znanych wzorców.

Ten raport jest ciekawy nie dlatego, że daje jednoznaczną prognozę, lecz dlatego, że pokazuje, jak jedna z najważniejszych organizacji badawczych porządkuje własne myślenie o najbliższych latach. Dla osób budujących produkty na AI ważny jest też drugi wątek z badań Google: "faithful uncertainty", czyli próba nauczenia modeli uczciwego komunikowania niepewności, zamiast pewnych halucynacji albo nadmiernych odmów.

​Artykuł | streszczenie​

🎙️ OpenAI szykuje bardziej naturalny głos i rozwija automatyzację Codex

Według TestingCatalog OpenAI przygotowuje dla ChatGPT Voice architekturę GPT-Bidi-1, czyli dwukierunkowy model audio, który ma jednocześnie słuchać i mówić. Chodzi o usunięcie jednego z największych problemów obecnych asystentów głosowych: sztucznych pauz, zacinania się przy przerwaniu wypowiedzi i konieczności czekania na pełną turę rozmowy. Nowa architektura ma mieć tryby High, Medium i Instant, pozwalające wybrać między głębszym rozumowaniem a niższą latencją.

Równolegle OpenAI rozwija Codex jako środowisko automatyzacji pracy na komputerze i w przeglądarce. Źródła opisują trzy interfejsy: Computer Use do sterowania aplikacjami przez kliknięcia i klawiaturę, rozszerzenie Chrome do pracy na zalogowanych stronach oraz odizolowaną przeglądarkę do debugowania i testowania. Spinać ma to mechanizm Appshots, który zmienia aktywność ekranową w kontekst dla agenta.

Ciekawa jest też nowa metoda testowania wdrożeń: Deployment Simulation. OpenAI przepuściło 1,3 miliona historycznych, zanonimizowanych rozmów przez nadchodzące systemy, aby wykrywać podatności i zjawiska typu "evaluation awareness", czyli sytuacje, w których model zachowuje się inaczej, bo rozpoznaje, że jest testowany. To pokazuje, że walka o jakość modeli coraz częściej odbywa się nie tylko w benchmarkach, ale w symulacji rzeczywistych interakcji użytkowników.

​Czytaj więcej | Czytaj więcej​

💼 Agenci AI zaczynają działać w regulowanych finansach

Broadridge LTX dodało do swojej platformy handlu obligacjami korporacyjnymi agentów AI w aplikacji BondGPT. Według opisu agenci mogą budować zlecenia, wybierać dealerów, wysyłać zapytania o wycenę i automatycznie wykonywać część transakcji w ramach parametrów ustawionych przez tradera. To nie jest zwykły chatbot do analizy rynku, ale agent wykonujący konkretne czynności w realnym workflow handlowym.

To ważny sygnał, bo rynek obligacji jest znacznie mniej uporządkowany informacyjnie niż rynek akcji, więc AI może mieć tu szczególnie dużą wartość w wyszukiwaniu danych, porównywaniu warunków i obsłudze procesu. Jednocześnie finansowe zastosowania agentów będą pod ogromną presją regulacyjną: instytucje muszą wiedzieć, kto podjął decyzję, na jakiej podstawie, z jakimi limitami i jak można to odtworzyć po fakcie.

W podobnym kierunku idzie Coinbase, które według AI Ready zarejestrowało agenta AI jako doradcę inwestycyjnego podlegającego SEC. Jeśli takie rozwiązania się przyjmą, branża finansowa może stać się jednym z pierwszych miejsc, gdzie agenci AI będą mieli formalną, regulowaną tożsamość, a nie tylko status narzędzia używanego przez człowieka.

​Czytaj więcej | Czytaj więcej​

Ciekawe narzędzia AI

  • ​Vercel Drop - pozwala wdrożyć stronę lub aplikację przez przeciągnięcie pliku, folderu albo ZIP-a do przeglądarki.
  • ​Prometheus by Firecrawl - generuje i utrzymuje kod do scrapowania w TypeScript na podstawie opisu danych w języku naturalnym.
  • ​Ponytail - plugin dla agentów, który wymusza pisanie minimalnego, natywnego kodu zamiast dokładania niepotrzebnych zależności.

Co jeszcze w świecie AI?

  • ChatGPT dostał Scheduled Tasks, czyli możliwość ustawiania przypomnień, cyklicznych zadań i monitorowania internetu bez każdorazowego promptowania. Czytaj więcej​
  • xAI wypuściło Grok Imagine Video 1.5 z lepszą fizyką ruchu, szybszym generowaniem i organizacją projektów w folderach. Czytaj więcej​
  • Anthropic rozbudował Claude Design o pamięć systemu wizualnego marki, bezpośrednią edycję na canvasie i integracje z narzędziami kodowania. Czytaj więcej​
  • Wycieknięte audytowane finanse OpenAI za 2025 rok pokazują 13,07 miliarda dolarów przychodu przy 34 miliardach kosztów, w tym 10,59 miliarda zapłacone Microsoftowi za infrastrukturę. Czytaj więcej​
  • Noam Shazeer, współlider Gemini i współautor architektury Transformer, odchodzi z Google do OpenAI - dwa lata po tym, jak Google wydało 2,7 miliarda dolarów, by sprowadzić jego zespół z powrotem. Czytaj więcej​
  • Udział ChatGPT w rynku po raz pierwszy spadł poniżej 50%, lądując na poziomie 46,4%. Czytaj więcej​
  • Nowe badanie MIT wykazało, że autonomiczni agenci kodujący zwiększyli liczbę commitów o 180%, ale liczba faktycznych wydań wzrosła tylko o 30% - kod powstaje szybciej, ale ludzie wciąż muszą go sprawdzać, integrować i wdrażać. Czytaj więcej​
  • GitHub Copilot pokazał komendę /orchestrate, która koordynuje zmiany w wielu repozytoriach i utrzymuje stan pracy między sesjami. Czytaj więcej​
  • Stack Overflow próbuje odrodzić się jako backend wiedzy dla agentów AI, a nie tylko klasyczna strona z pytaniami i odpowiedziami. Czytaj więcej​
  • Według raportu Scale tylko 6% przedsiębiorstw skutecznie przeskalowało AI w całej organizacji, co pokazuje skalę luki między pilotażami a realnym wdrożeniem. Czytaj więcej Moim zdaniem pokazuje skalę inercji, marnotrawstwa i złego zarządzania w korpo.
  • Factory 2.0 rozwija koncepcję "software factory", w której wiele agentów ma bezpiecznie pracować nad kodem w prywatnych środowiskach firm. Czytaj więcej​
  • Anthropic tymczasowo wstrzymał planowaną zmianę rozliczeń Claude Agent SDK, która mogła znacząco podnieść koszty intensywnych workflow opartych o automatyzację. Czytaj więcej​
  • Microsoft rozważa dodanie DeepSeek do Copilot Cowork jako tańszej opcji modelowej dla zadań firmowych. Czytaj więcej​
  • KPMG miało opublikować zmyślone case studies AI w raporcie promującym wdrożenia tej technologii u klientów. Czytaj więcej He-he-he...

Najważniejszy wspólny wątek tego wydania jest prosty: przewaga w AI coraz rzadziej polega wyłącznie na wyborze "najlepszego modelu", a coraz częściej na tym, czy mamy dobrą pamięć, dane, uprawnienia, integracje, procedury i możliwość przełączenia się na inną technologię. Modele są coraz mocniejsze, ale prawdziwa wartość zaczyna powstawać w całym systemie wokół nich. No i wartość może nam "wyparować" jeśli zbudowaliśmy ją wokół jednego modelu i jednego dostawcy, od którego możemy zostać odcięci z dnia na dzień bez ostrzeżenia.

Jeśli ten przegląd pomoże komuś w Twoim zespole lepiej zrozumieć, gdzie zmierza rynek AI, podeślij mu to wydanie. Dobrego, spokojnego weekendu (wreszcie będzie ciepło!) i do następnego razu!

Pozdrawiam,
Andy

Newsletter o AI od Andy Brandt

Newsy ze świata AI i komentarze co tydzień na Twojej skrzynce. Poniżej starsze newslettery (ok ~20 dni do tyłu w stosunku do tego, co dostają moi korespondenci).

Read more from Newsletter o AI od Andy Brandt

Witaj Reader! Ostatnie dni to jedno z gęstszych okien w całym roku: OpenAI wypuściło GPT-6 Astra i przy okazji użyło magicznego terminu AGI, którego wcześniej unikało, Nvidia za blisko 13 miliardów dolarów kupiła Hugging Face, a Anthropic, Google i Meta w ciągu 48 godzin pokazały nowe modele. Do tego doszły dwie historie, które warto czytać razem: raport o roju agentów OpenAI, które przez sześć tygodni używały martwej niemieckiej wiki jako tablicy ogłoszeń, oraz esej głównego naukowca OpenAI...

Witaj Reader! Witajcie w kolejnym wydaniu mojego newslettera, który ostatnio stał się dość nieregularny. Powody są zasadniczo dwa. Pierwszy jest taki, że są wakacje. Drugi jest taki, że własnie zaczynam nową pracę i w efekcie dużo mam na głowie innych tematów. Ale tworzenie tego newslettera mi samemu pomaga utrzymać jaki-taki kontakt z tym co się nowego dzieje w AI, więc nie zamierzam przestać choć regularność będzie cierpieć. A dzieje się dużo i póki co naprawdę nie widać, żeby tempo miało...

Witaj Reader! Pojechałem nad morze... a tymczasem te ostatnie dwa tygodnie okazały się bardzo intensywne. Pokazuje to problem jakim jest tempo zachodzącej zmiany, nigdy wcześniej nie spotykane. Zatem... nadrabiamy: Moonshot udostępnił wagi Kimi K3 i tym samym otwarte modele praktycznie zrównały się z komercyjną czołówką, Anthropic wypuścił Claude Opus 5 za połowę ceny Fable, a OpenAI obniżyło ceny Luny o 80 procent. Jednocześnie mieliśmy serię naprawdę niepokojących incydentów: agenty OpenAI,...