K2 Horizon: sześć modeli od 0,9B do 375B na Apache 2.0 - wagi otwarte od ręki, dane i kod tylko częściowo
Institute of Foundation Models z Abu Zabi wydał 3 września 2026 K2 Horizon - sześć modeli językowych od 0,9 do 375 miliardów parametrów. Wagi i kod są na licencji Apache 2.0, ale zbiory danych mają własne, odrębne licencje, a komplet danych treningowych, kodu i pośrednich checkpointów jest dziś opublikowany tylko dla części rodziny - dla 32B i 36B-A4B to na razie zapowiedź. Dla osoby z laptopem i Ollamą albo domowym serwerem to i tak ciekawsza wiadomość niż kolejne API za 50 dolarów za milion tokenów. Sprawdzamy, co jest dostępne od ręki, a co dopiero "będzie".
Data faktyczna: komunikat prasowy IFM nosi datę 3 września 2026, tego samego dnia depeszę podał Reuters. Piszemy 5 września. Stan repozytoriów na Hugging Face sprawdzaliśmy tego dnia - część obietnic z komunikatu jest tam oznaczona jako "w przygotowaniu", o czym niżej.
Kto wydał K2 Horizon i co producent rozumie przez "fully open"
IFM (Institute of Foundation Models) to laboratorium założone w 2025 roku przez uniwersytet MBZUAI w Abu Zabi, z biurami także w Dolinie Krzemowej i Paryżu. To ten sam zespół, który wcześniej działał jako LLM360 i od 2023 roku forsuje pojęcie "fully open": nie tylko wagi do pobrania, ale dane treningowe, przepis, kod i pośrednie checkpointy, żeby dało się odtworzyć proces, a nie tylko uruchomić wynik.
K2 Horizon to sześć modeli z jedną architekturą, słownikiem i narzędziami wdrożeniowymi:
| Model | Parametry (aktywne) | Do czego IFM go przeznacza |
|---|---|---|
| K2-Horizon-0.9B | 0,9B | zegarki, okulary, bardzo ograniczony sprzęt |
| K2-Horizon-3.7B | 3,7B | telefony, fine-tuning |
| K2-Horizon-7B | 7B | telefony i laptopy, kodowanie, "deep research" |
| K2-Horizon-32B | 32B (gęsty) | laptop z dużą pamięcią, serwer on-prem |
| K2-Horizon-MoVA-36B-A4B | 36B (4B aktywne) | lokalny hosting z niskim kosztem na token |
| K2-Horizon-375B-A23B | 375B (23B aktywne) | firmowe wdrożenia |
Licencja na modele i kod: Apache 2.0, z komunikatu prasowego linkującego wprost do standardowego tekstu licencji. Zbiory danych - na własnych licencjach (IFM wymienia m.in. ODC-BY), a tam, gdzie redystrybucja jest niemożliwa, laboratorium obiecuje opisać, jak dane zbudowano i zmieszano. Każdy model był wstępnie trenowany na około 20 bilionach tokenów; token to kawałek tekstu, na jakie modele tną zdania, więc 20 bilionów to skala całych bibliotek tekstu.
Parametry w nazwach modeli to liczba wyuczonych "pokręteł" sieci. Więcej zwykle znaczy mądrzej, ale też więcej pamięci potrzebnej do uruchomienia. Przy modelach oznaczonych jako A4B czy A23B liczy się druga liczba - to parametry aktywne, czyli ta część sieci, która naprawdę pracuje przy każdym słowie. Model 36B-A4B trzeba w całości zmieścić w pamięci, ale liczy jak znacznie mniejszy, więc jest szybszy i tańszy w utrzymaniu niż sugeruje jego rozmiar.
Co jest na Hugging Face naprawdę, a co "będzie"
To najważniejsza sekcja tego newsa, bo komunikat prasowy i stan repozytoriów nie są identyczne.
Dostępne od ręki (stan na 5 września 2026):
- Wagi wszystkich sześciu rozmiarów w BF16.
- Warianty FP8 dla 375B, 36B-A4B, 32B i 7B.
- GGUF dla 36B-A4B, 32B, 7B, 3.7B i 0.9B - czyli to, czego potrzebuje llama.cpp, LM Studio czy Ollama po imporcie. GGUF to format pliku, w którym model daje się uruchomić na zwykłym komputerze, także bez mocnej karty graficznej; zwykle w wersji skwantyzowanej, czyli odchudzonej przez zaokrąglenie wag, co kosztuje trochę jakości, a oszczędza dużo pamięci. Dla 375B GGUF-a nie ma i to akurat jest logiczne - takiego modelu i tak nie postawisz na laptopie.
- Zbiory danych w kolekcji: TxT360-v2, Code-Reasoning, Math-Reasoning, SFT-Reasoning, Pretrain-Behaviors.
- Przepisy serwowania dla vLLM i SGLang, z osobnymi parserami
k2_horizondo rozumowania i wywołań narzędzi.
Zapowiedziane, ale w kartach modeli oznaczone jako do wydania:
- Karta 32B mówi wprost: to checkpoint "Stage1", "final checkpoint to be released", a wyniki drugiego etapu "wkrótce".
- Karta 36B-A4B: wydano finalny checkpoint, ale pośrednie checkpointy, dane i kod treningowy "będą wydane".
- Karta 7B jako jedyna z tych, które czytaliśmy, opisuje pośrednie checkpointy i dane jako już publiczne (tagi rewizji
base_final,mid_*_final).
Innymi słowy: "w pełni otwarte" jest dziś w pełni prawdziwe dla mniejszych modeli, a dla 32B i 36B-A4B to nadal obietnica z konkretnym kierunkiem. Warto o tym pamiętać, czytając nagłówki o "największej w historii w pełni otwartej premierze".
Nowości techniczne, którymi IFM się chwali
Dwie rzeczy z komunikatu, obie z zastrzeżeniem, że to opis autora architektury, nie niezależna ocena:
- MoVA (Mixture-of-Value Attention) - rozszerzenie idei mixture-of-experts z warstw feed-forward na uwagę. Efekt według IFM: model 36B z 4B aktywnymi parametrami osiąga wyniki "tylko nieco poniżej" gęstego 32B przy tych samych warunkach treningu. Zestawiliśmy sami dwie liczby z kart modeli: 36B-A4B ma 58,6% na Terminal-Bench 2.1, a 32B-Stage1 36,6%. Zastrzeżenie podwójne - to nasze zestawienie, nie porównanie IFM (obie liczby pochodzą z osobnych tabel, z różnymi modelami odniesienia), a 32B to na dziś niedokończony checkpoint.
- "Diffusion distillation" - generowanie bloków tokenów równolegle, według IFM około 3x szybsze bez utraty jakości. W komunikacie nie ma szczegółów implementacji ani niezależnych pomiarów; w kartach modeli ta technika nie jest opisana jako domyślny tryb serwowania.
Wszystkie modele mają natywne okno kontekstu 512K tokenów (524 288) od etapu midtrainingu. Okno kontekstu to ile tekstu model widzi naraz - cała rozmowa plus wklejone pliki plus jego własna odpowiedź. Pół miliona tokenów mieści spory projekt programistyczny albo kilka książek.
Wyniki - z tabel producenta
IFM porównuje się z otwartymi modelami zbliżonej wielkości, korzystając z liczb Artificial Analysis dla konkurencji. Benchmark to standardowy zestaw zadań, na którym różne modele robią to samo, żeby dało się je zestawić; kto ogłasza wynik, ten zwykle wybiera zestaw, przeciwników i sposób liczenia. Kilka przykładów z kart:
- 7B - SWE-bench Verified 70,6% (dla porównania w tej samej tabeli: Qwen3.5-9B 50,8%), Terminal-Bench 2.1 39,1%, BrowseComp 59,0%. IFM zaznacza, że BrowseComp liczono w protokole "Discard-all@95k" z raportu DeepSeek-V3.2 i że konkurencja mogła używać innych harnessów.
- 36B-A4B - Terminal-Bench 2.1 58,6%, GPQA Diamond 80,8%, wskaźnik "non-hallucination" 69,2%.
- 0.9B - AIME 2026 48,5%, HumanEval+ 79,9%.
Komunikat prasowy mówi, że 0.9B, 3.7B i 7B ustanawiają nowy stan sztuki w swoich klasach wielkości. Warto to czytać dosłownie: "najlepszy w swojej klasie" nie znaczy "lepszy od wszystkiego". W tej samej karcie 0.9B ma 27,3% na GPQA Diamond, podczas gdy dwukrotnie większy Qwen3.5-2B osiąga tam 54,9%. Mały model zostaje małym modelem.
Zasady, które warto znać zanim się zacznie porównywać u siebie: IFM raportuje wszystkie wyniki przy reasoning_effort="high" i top_p=0.95, a temperaturę podaje zależnie od modelu (1.0 dla 7B, 32B i 36B-A4B, 0.6 dla 0.9B) i zaleca co najmniej 32 768 tokenów wyjścia, żeby rozumowanie nie zostało ucięte. Karta 7B pisze wprost: ucięte rozumowanie to nieudana odpowiedź, nie krótsza. Praktyczny wniosek dla domowego użytkownika: jeśli uruchomisz model na ustawieniach domyślnych swojego narzędzia, prawdopodobnie zobaczysz gorsze wyniki niż te z tabel, i to nie będzie wina modelu.
Dla kogo to jest
Osoba z laptopem albo domowym serwerem. Najciekawsze są 7B i 36B-A4B w GGUF. Pierwszy zmieści się w typowym laptopie z 16 GB RAM po kwantyzacji; drugi ma 36B parametrów do załadowania, ale tylko 4B liczone na token - to profil, który lubi dużo pamięci i średnie GPU. Nie podajemy tu wymagań w gigabajtach, bo zależą od wybranej kwantyzacji i nie mierzyliśmy ich sami; karta modelu też ich nie podaje.
Deweloper budujący agenta. Modele mają wbudowane wywołania narzędzi z dedykowanym parserem, 512K kontekstu i przepisy serwowania dla vLLM oraz SGLang. Karty modeli odsyłają po zmierzone opóźnienia i przepustowość na kartach H200 do cookbooka SGLang (karta 32B pisze o przepisie zweryfikowanym na dwóch H200) - samego cookbooka nie czytaliśmy, więc konkretnych liczb stamtąd nie przytaczamy. API jest też u partnerów inferencyjnych IFM (komunikat wymienia Compass, Cerebras i Nebius) - cen nie podano w komunikacie, więc ich nie cytujemy.
Badacz. To jest właściwy adresat "fully open". Pośrednie checkpointy, logi treningu i przepisy danych pozwalają studiować, jak rośnie zdolność rozumowania i użycia narzędzi w trakcie treningu - o ile IFM dowiezie je dla większych modeli.
Firma z wymaganiami compliance. Sprawdziliśmy repozytoria przez API Hugging Face i to, co da się stwierdzić, wygląda prosto: metadane wszystkich sprawdzonych modeli deklarują apache-2.0, repozytoria nie są bramkowane (nie trzeba akceptować dodatkowych warunków przed pobraniem) i nie ma w nich osobnego pliku z warunkami dodatkowymi ani polityką dopuszczalnego użycia. To mniej formalności niż w wielu popularnych rodzinach "open-weight", gdzie licencja bywa własna i z ograniczeniami. Nie twierdzimy natomiast, że IFM nie ma żadnej polityki użycia poza repozytorium - regulaminu strony ani warunków partnerów inferencyjnych nie analizowaliśmy, a i tak przed wdrożeniem produkcyjnym warto to dać do przeczytania prawnikowi. Dane treningowe są na osobnych licencjach i wymagają odrębnego sprawdzenia, jeśli planuje się dotrenowanie.
Ograniczenia i pytania otwarte
- Brak niezależnych benchmarków; liczby konkurencji pochodzą z agregatora, a nie z własnych przebiegów IFM w tych samych warunkach.
- 32B to checkpoint pośredni; finalna wersja "będzie".
- Kod i dane treningowe dla 32B i 36B-A4B na dzień pisania nie są jeszcze w repozytoriach.
- Zalecane ustawienia (high effort, 32K tokenów wyjścia) oznaczają wolne i drogie generowanie na słabym sprzęcie. Model "na zegarek" nie znaczy "szybki na zegarku" bez kwantyzacji i własnych testów.
- Serwowanie wymaga
trust_remote_codew Transformers i vLLM - to standard przy nowych architekturach, ale w środowisku firmowym warto przejrzeć ten kod przed uruchomieniem.
Nasza ocena
Na tle tygodnia, w którym OpenAI i Anthropic wydały modele za 10/50 USD za milion tokenów z coraz bardziej rozbudowanymi warstwami zabezpieczeń i weryfikacji dostępu, K2 Horizon idzie w przeciwną stronę: pobierz, uruchom, przeczytaj, jak to zrobiono. Najbardziej wiarygodna część tej premiery to mniejsze modele z GGUF i kompletnym zestawem materiałów. Największa niewiadoma to, czy IFM dowiezie pełną otwartość dla 32B i 36B-A4B w rozsądnym czasie - to sprawdzimy i wrócimy do tematu, gdy w repozytoriach pojawią się finalne checkpointy i kod treningowy.
Źródła
Linki prowadzą do materiałów, na których oparliśmy ten tekst i które sprawdziliśmy 5 września 2026 podczas redakcyjnej weryfikacji faktów.
- IFM, "Introducing K2 Horizon: Frontier Performance, Radically Open" - blog premierowy: https://ifm.ai/blog/k2/
- IFM, komunikat prasowy z 3 września 2026: https://ifm.ai/k2/press-release/
- Hugging Face, kolekcja K2 Horizon - modele, GGUF, FP8, zbiory danych: https://huggingface.co/collections/IFM/k2-horizon
- Hugging Face, karta modelu K2-Horizon-MoVA-36B-A4B: https://huggingface.co/IFM/K2-Horizon-MoVA-36B-A4B
- Hugging Face, karta modelu K2-Horizon-7B: https://huggingface.co/IFM/K2-Horizon-7B
- Hugging Face, karta modelu K2-Horizon-32B (Stage1): https://huggingface.co/IFM/K2-Horizon-32B
- Hugging Face, karta modelu K2-Horizon-0.9B: https://huggingface.co/IFM/K2-Horizon-0.9B
- Reuters (za Zawya), depesza o premierze z 3 września 2026: https://zawya.com/en/business/ai-shaping-digital-future/abu-dhabi-ai-institute-releases-fully-open-source-models-with-training-data-code-477344
- Hugging Face, API repozytoriów IFM - weryfikacja licencji, bramkowania i listy wariantów GGUF/FP8, stan na 5 września 2026: https://huggingface.co/api/models?author=IFM