:: Aurora Zine ::

numer 03 phile 01 z 01

Dwa razy szybciej leżało na dysku

Wyszedł Qwen 3.8 bez cenzury. Ściągnąłem go rano. Najciekawsze w tym pliku nie ma nic wspólnego z cenzurą — leżało tam od początku i nikt tego nie włączał.

grzegorz404

  • llm
  • qwen
  • mtp
  • spekulacja
  • lokalne-modele

Co tydzień ktoś nagrywa filmik, że wyszedł model, który „zmienia wszystko". W tym tygodniu to Qwen 3.8 27B, wersja bez cenzury. Ściągnąłem go rano, w tle, w tmuxie. I owszem — nie odmawia.

Tylko najciekawsza rzecz w tym pliku nie ma nic wspólnego z cenzurą. Leżała tam od początku, opłacona miejscem na dysku, i nikt jej nie włączał.

O tym jest ten tekst. Nie o tym, co obiecuje miniaturka, tylko o tym, co realnie ruszyło na jednej karcie.

Nudna prawda o „uncensored"

Zacznijmy od tego, po co ludzie w ogóle sięgają po takie wersje. Nie po to, żeby robić krzywdę. Po to, żeby model przestał odmawiać roboty, która jest legalna: analiza logów po włamaniu, reguła detekcji, kryptoanaliza na zajęcia, audyt własnej infrastruktury. Filtr nad modelem czasem nie odróżnia „złam ten szyfr na ćwiczeniach" od czegoś groźnego i tnie prewencyjnie. Wkurza. Rozumiem.

Ale zanim się nakręcisz, trzy rzeczy, które autor modelu pisze wprost, a których żaden filmik nie powie.

Odmowy są ograniczone, nie usunięte. Abliteracja metodą Heretic minimalizuje liczbę odmów względem dywergencji od modelu bazowego. To nie jest wycięcie hamulca, to jego poluzowanie.

Model traci około pół punktu średnio na standardowych testach zdolności. Niewiele, ale nie zero. Za rozluźnienie się płaci.

I najważniejsze, o czym nikt nie mówi: skoro nie odmawia, to też nie ostrzeże Cię, gdy robisz głupotę. Filtr, który czasem irytuje, bywa drugą parą oczu. Na produkcji klienta ta druga para oczu potrafi uratować tyłek. Model bez niej wykona twoje głupie polecenie tak samo posłusznie jak mądre.

Czyli: dobre narzędzie do audytów i własnej infry. Złe do orania cudzego produkcyjnego środowiska po nocy.

Tyle o cenzurze. Teraz to, po co naprawdę warto było ten plik ściągnąć.

Coś, co już masz i nie używasz

Sprawdziłem, co dokładnie siedzi w środku pliku GGUF. Nie zgadywałem — gguf-py na tej maszynie się nie importuje, więc po chłopsku:

head -c 12000000 model.gguf | strings -n 4 | grep -iE "nextn|mtp"

I wyskoczyło:

blk.64.nextn.eh_proj.weight
blk.64.nextn.enorm.weight
blk.64.nextn.hnorm.weight
qwen35.nextn_predict_layers

To jest głowica MTP — Multi-Token Prediction. Mechanizm spekulacyjny wbudowany w wagi modelu. Był tam. Był też w moim starym, „ocenzurowanym" modelu, którego używam codziennie od tygodni. I przez cały ten czas ani jeden wpis w konfiguracji go nie wołał.

Płaciłem za te wagi miejscem na dysku i nie miałem z nich nic.

Jak to w ogóle działa

W skrócie, bo to sedno. Zwykły model generuje jeden token, patrzy na wynik, generuje następny, i tak w kółko. Każdy token to osobny przebieg przez całą sieć.

Spekulacja odwraca to na głowę. Mała, szybka głowica zgaduje kilka tokenów naprzód, a duży model sprawdza je wszystkie za jednym przebiegiem. Jeśli zgadła dobrze — dostajesz trzy tokeny w cenie jednego. Jeśli spudłowała — cofasz się i płacisz normalnie. Na kodzie i powtarzalnym tekście trafia często, bo składnia jest przewidywalna. Na swobodnej prozie rzadziej.

Zwykle spekulacja wymaga osobnego, mniejszego modelu-szkicownika. MTP jest sprytniejsze: głowica siedzi w tym samym pliku, doszczepiona do głównego modelu. Nic nie trzeba dobierać. Trzeba tylko powiedzieć silnikowi, żeby jej użył.

Trzy flagi:

--spec-type draft-mtp
--spec-draft-n-max 3
-np 1

Liczby, nie obietnice

Tu jest cała różnica między tym tekstem a filmikiem. Nie powiem „mega szybko". Powiem, ile.

Ten sam prompt, ten sam plik modelu, trzy przebiegi, mierzone u mnie na 5090:

bez MTP     66 tok/s
z MTP      143-158 tok/s (kod)
           119-136 tok/s (proza)

Ponad dwa razy. Na modelu, którego i tak używam codziennie, bez dokupywania czegokolwiek. Zmiana: cztery flagi i trzydzieści linijek w routerze.

Miniaturka na YouTube obiecywała „3× szybciej". Miniaturka zawsze obiecuje więcej. Prawda jest taka, że przyrost topnieje z długością kontekstu — im dalej, tym rzadziej szkic trafia — ale nie znika. I dwa razy to dwa razy.

Za darmo nie ma nic

Był haczyk, i to poważny, więc opiszę go uczciwie, bo bez tego cały wpis byłby ściemą.

Karta ma 32 GB. Model waży 19, kontekst 262 tysiące tokenów zjada swoje, a bufory spekulacji też chcą miejsca. Pierwsza wersja mieściła się na styk — zostawało jakieś pół giga zapasu. Działało pięknie na krótkich promptach. A potem wrzuciłem zrzut ekranu i serwer padał przy każdym zapytaniu.

Bo enkoder obrazu potrzebuje miejsca dynamicznie, w momencie liczenia obrazu. Pół giga to za mało. cudaMalloc failed, abort, i po zabawie. Tekst nie crashował nigdy, nawet przy 230 tysiącach tokenów — tylko obraz. Objaw mylący jak diabli, bo benchmarki tekstowe świeciły na zielono.

Rozwiązanie nie było „dokup kartę". Było: wypchnąć enkoder wzroku na procesor. 900 megabajtów, które leżały w pamięci karty po to, żeby raz na jakiś czas przeliczyć obrazek, oddały miejsce buforom spekulacji. Cache został w pełnej jakości, kontekst bez zmian, a zapas urósł z pół giga do półtora.

Koszt? Analiza obrazu zeszła z ułamka sekundy na kilkadziesiąt sekund, bo liczy ją procesor. Przy pracy na kodzie i logach — niewidoczne. Przy zrzutach ekranu — poczujesz. Wybór jest świadomy: szybki tekst albo szybkie obrazy, na 32 GB nie zmieścisz obu naraz.

Przy okazji jedna pułapka do zapamiętania, bo sam w nią wdepnąłem: kwantyzacja cache V do q4_0 wygląda kusząco, bo zwalnia parę giga VRAM. Nie rób tego. Wyłącza szybką ścieżkę uwagi i prefill leci z trzech tysięcy tok/s na sześćdziesiąt. Czterdzieści razy wolniej. Zwolnisz pamięć i stracisz cały sens.

Puenta

Cały ten tydzień w AI-newsach był o tym, że wyszedł model bez cenzury. I fajnie, ściągnąłem, chodzi. Ale najlepsza rzecz, jaką dziś rano zrobiłem dla własnej infrastruktury, nie była do pobrania. Leżała na dysku od tygodni, w pliku, którego używam codziennie.

To nie jest tekst o jednym modelu. To jest o odruchu. Zanim dołożysz sprzęt, zanim ściągniesz kolejny „przełomowy" plik — sprawdź, czy używasz tego, co już masz. Zajrzyj w metadane. Puść benchmark u siebie, na swoich promptach, na swojej karcie.

Firmy kupują mocniejsze karty, zanim ktokolwiek zajrzy, co siedzi w pliku modelu.

Hype jest do ściągnięcia. Te dwa razy leżały już na Twoim dysku.

Mierz u siebie.