Llama od Meta można pobrać i używać bez opłaty licencyjnej w większości zastosowań, także komercyjnych, ale nie jest to klasyczny model open source. Licencja Llama 4 daje ograniczoną, nieprzenoszalną i bezpłatną licencję na używanie oraz modyfikowanie materiałów Meta, a podmioty przekraczające próg 700 mln aktywnych użytkowników miesięcznie muszą uzyskać osobną zgodę.3
Spis treści
ToggleCzym jest Llama i kto za nią stoi?
Llama to rodzina modeli AI rozwijana przez Meta Platforms, czyli firmę stojącą za Facebookiem, Instagramem i WhatsAppem. Określenia „llama facebook” i „llama meta” odnoszą się więc do tej samej technologii. Najnowszą publicznie udostępnioną generacją modeli bazowych pozostaje Llama 4, wydana 5 kwietnia 2025 roku.1
Llama 4 nie jest już wyłącznie modelem językowym przetwarzającym tekst. Meta zaprojektowała tę generację jako natywnie multimodalną: model przyjmuje tekst i obrazy, a generuje tekst oraz kod. Wykorzystuje architekturę Mixture of Experts, w której przy przetwarzaniu konkretnego tokenu aktywowana jest tylko część sieci.2
W oficjalnym repozytorium Meta znajdują się nadal starsze generacje: Llama 3.1 w wariantach 8B, 70B i 405B, Llama 3.2 w wersjach 1B i 3B, modele Vision 11B i 90B oraz Llama 3.3 70B.1 Dla osoby, która chce uruchomić model na zwykłej stacji roboczej, starszy i mniejszy wariant bywa praktyczniejszy niż najnowsza Llama 4.
Najważniejsze liczby: Llama 4 Scout ma 109 mld parametrów łącznie i aktywuje około 17 mld, Maverick ma 400 mld łącznie i również aktywuje około 17 mld.2 Scout obsługuje kontekst do 10 mln tokenów, Maverick do 1 mln.2 Scout po kwantyzacji Int4 pracuje według Meta na pojedynczej karcie z 80 GB pamięci GPU.1
Czy Llama jest darmowa i co dokładnie pozwala robić licencja?
Odpowiedź brzmi: tak, jeśli chodzi o brak opłaty za licencję, ale nie w sensie pełnej swobody typowej dla open source. Llama 4 Community License Agreement udziela licencji nieodpłatnej, światowej i niewyłącznej. Pozwala używać materiałów Llama, kopiować je, rozpowszechniać, tworzyć utwory zależne oraz wprowadzać modyfikacje.3
Najbardziej charakterystyczne ograniczenie dotyczy ogromnych usług internetowych. Jeżeli w miesiącu poprzedzającym dzień wydania Llama 4 produkty licencjobiorcy albo jego podmiotów powiązanych miały ponad 700 mln aktywnych użytkowników miesięcznie, standardowa licencja nie wystarcza. Taki podmiot musi wystąpić do Meta o osobną licencję, a Meta może jej udzielić według własnego uznania.3
Są też obowiązki przy dystrybucji. Produkt zawierający materiały Llama powinien prezentować oznaczenie „Built with Llama”, a kopie materiałów muszą zachować wymagane powiadomienie licencyjne. Jeżeli ktoś wykorzystuje materiały Llama albo wyniki modelu do stworzenia, trenowania lub poprawiania innego modelu, który następnie udostępnia, nazwa takiego modelu musi zaczynać się od słowa „Llama”.3
Do licencji dołączona jest polityka dopuszczalnego użycia. Brak opłaty nie oznacza więc zgody na dowolne zastosowanie modelu. Przy projekcie komercyjnym licencję i tę politykę trzeba traktować jako warunki wdrożenia, nie jako informacyjny dodatek.
Dlaczego otwarte wagi nie oznaczają pełnego open source?
Otwarte wagi i otwarty kod źródłowy opisują różne poziomy dostępu. Wagi to wyuczone parametry modelu. Gdy producent je udostępnia, można pobrać gotowy model, uruchomić go na własnym sprzęcie, kwantyzować, dostrajać i integrować z własnym oprogramowaniem w granicach licencji.
Definicja Open Source AI opracowana przez Open Source Initiative idzie dalej. W wersji 1.0 wymaga dostępu nie tylko do parametrów, lecz także do informacji o danych oraz kompletnego kodu potrzebnego do trenowania i uruchamiania systemu. Warunki mają pozwalać używać, badać, modyfikować i udostępniać system bez indywidualnego pozwolenia.4
Meta publikuje wagi, kod do inferencji, dokumentację i część narzędzi, ale stosuje własną licencję z dodatkowymi warunkami. Model card opisuje charakter zbiorów treningowych, lecz nie udostępnia kompletnego zbioru pozwalającego odtworzyć trening. Dlatego precyzyjniejszym określeniem dla Llama jest model z otwartymi wagami, a nie bezwarunkowo open source.
Jakie wersje i rozmiary modelu są obecnie dostępne?
W rodzinie Llama 4 Meta udostępnia dwa główne modele: Scout i Maverick.1 Oba korzystają z architektury MoE. Scout zawiera 16 ekspertów oraz około 109 mld parametrów łącznie, z czego podczas działania aktywnych jest około 17 mld.2 Maverick zwiększa liczbę ekspertów do 128 i liczbę wszystkich parametrów do około 400 mld, przy zachowaniu około 17 mld parametrów aktywowanych dla tokenu.2
Różnica dotyczy nie tylko wielkości plików. Scout oferuje okno kontekstu do 10 mln tokenów w wariancie Instruct, natomiast Maverick do 1 mln.2 Model card podaje jednocześnie, że dane treningowe obu modeli mają granicę wiedzy w sierpniu 2024 roku.2 Lokalna instalacja najnowszych wag nie daje więc wiedzy o wydarzeniach późniejszych.
Meta nadal publikuje i dokumentuje wcześniejsze modele, co ma duże znaczenie dla komputerów z mniejszą ilością pamięci. Llama 3.2 w wersjach 1B i 3B jest wielokrotnie mniejsza od Scouta i Mavericka, więc lepiej pasuje do urządzeń brzegowych, laptopów i eksperymentów lokalnych.1
Ile pamięci wymaga Llama i co to znaczy dla sprzętu?
Przy ocenie sprzętu trzeba odróżnić liczbę parametrów aktywnych podczas obliczeń od całkowitej liczby wag przechowywanych w pamięci. Scout aktywuje około 17 mld parametrów, lecz jego checkpoint zawiera około 109 mld.2 Maverick aktywuje podobną liczbę, ale w pamięci trzeba utrzymać wagi odpowiadające około 400 mld parametrów.2
| Wariant modelu | Rozmiar | Wymagana pamięć | Typowe zastosowanie |
|---|---|---|---|
| Llama 4 Scout BF16 | 109 mld parametrów łącznie, około 17 mld aktywnych2 | same wagi w BF16 to około 218 GB, Meta wskazuje co najmniej 4 GPU dla pełnej precyzji1 | serwerowa inferencja, multimodalność, bardzo długi kontekst |
| Llama 4 Scout Int4 | ten sam model 109B, kwantyzowany przy uruchamianiu6 | 1 GPU z 80 GB pamięci według oficjalnej implementacji Meta1 | najbardziej dostępna lokalnie konfiguracja Llama 4 |
| Llama 4 Scout FP8 | 109 mld parametrów łącznie2 | 2 GPU po 80 GB według instrukcji Meta1 | inferencja z mniejszym śladem pamięci niż BF16 |
| Llama 4 Maverick FP8 | 400 mld parametrów łącznie, około 17 mld aktywnych2 | pojedynczy host DGX H100, czyli 8 GPU i 640 GB łącznej pamięci7 | duże wdrożenia serwerowe i zaawansowana multimodalność |
Te wartości pokazują, dlaczego hasło o lokalnej Llamie nie oznacza modelu działającego na zwykłym komputerze domowym. Najnowszy Scout po mocnej kwantyzacji nadal celuje w kartę z 80 GB pamięci.1 Na typowym sprzęcie użytkownik wybierze raczej mniejszy model poprzedniej generacji albo dodatkowo skwantyzowany wariant przygotowany przez narzędzia zewnętrzne.
Jak uruchomić Llamę lokalnie?
Meta utrzymuje oficjalny pakiet llama models oraz interfejs wiersza poleceń do pobierania checkpointów. Aktualny plik projektu deklaruje pakiet w wersji 0.2.0 i wymaga Pythona 3.10 lub nowszego.10 Dostęp do wag wymaga zaakceptowania licencji Meta, a po zatwierdzeniu modele pobiera się bezpośrednio od Meta albo przez oficjalne repozytoria w Hugging Face.
Typowy proces obejmuje kilka kroków:
- instalację środowiska Python i zależności dla PyTorch,
- zaakceptowanie licencji i uzyskanie dostępu do wybranego checkpointu,
- pobranie wariantu Base albo Instruct,
- dobór precyzji BF16, FP8 albo Int4 do dostępnej pamięci GPU,
- uruchomienie inferencji przez skrypt Meta albo bibliotekę zgodną z formatem wag.
Oficjalne narzędzie Meta wyświetla listę dostępnych modeli, pobiera checkpointy i weryfikuje pliki. Podpisany adres do pobrania wygasa po 24 godzinach i ma ograniczoną liczbę pobrań.1 W środowisku produkcyjnym trzeba dodatkowo zaplanować serwer inferencyjny, kolejkę zapytań, monitoring pamięci i warstwę autoryzacji.
Czym Llama różni się od ChatGPT i Gemini?
Najważniejsza różnica nie dotyczy jakości odpowiedzi, lecz modelu dystrybucji. Llama daje dostęp do wag i pozwala postawić własny serwer inferencyjny. ChatGPT jest przede wszystkim gotową usługą OpenAI, a Gemini rodziną modeli Google dostarczanych przez API.89
Przy Llamie właściciel infrastruktury sam decyduje o wersji modelu, kwantyzacji, serwerze, logowaniu zapytań, dostrajaniu i sposobie aktualizacji. W usłudze zamkniętej większością tych elementów zarządza dostawca, a użytkownik dostaje gotową infrastrukturę i nie musi kupować ani utrzymywać drogich akceleratorów.
Dlatego zestawienie Llamy z ChatGPT nie jest porównaniem dwóch identycznych produktów. Llama to model i zestaw materiałów do samodzielnego wdrożenia, ChatGPT to kompletna aplikacja z interfejsem i narzędziami działającymi ponad modelem.
Gdzie Llama wypada lepiej, a gdzie gorzej od modeli zamkniętych?
Llama ma wyraźną przewagę tam, gdzie priorytetem jest kontrola. Firma może trzymać checkpoint we własnej infrastrukturze, dobrać kwantyzację, zbudować własny system wyszukiwania po dokumentach, dostroić model i zamknąć warstwę inferencji w prywatnej sieci. Nie zależy przy tym od dostępności zewnętrznego API przy każdym zapytaniu.
Modele zamknięte wygrywają operacyjnie. Dostawca utrzymuje akceleratory, skaluje obciążenie i wdraża nowe wersje bez przebudowy lokalnego klastra. Przy Llama 4 różnica sprzętowa jest szczególnie widoczna, bo nawet Scout w trybie Int4 wymaga GPU z 80 GB pamięci, a Maverick w FP8 hosta z 640 GB pamięci GPU.17
Nie zakładaj też, że otwarte wagi automatycznie oznaczają lepsze odpowiedzi. Meta publikuje benchmarki korzystne dla własnych modeli, a rzeczywista przewaga zależy od języka, domeny, promptu, długości kontekstu i sposobu inferencji. Dla firmy ważniejsze od rankingu bywa to, czy model da się dostroić, wdrożyć bez zewnętrznego API i utrzymać w założonym budżecie sprzętowym.
Jak Llama radzi sobie z polskim i co zmienia lokalne przetwarzanie danych?
Polski nie znajduje się na oficjalnej liście głównych języków wspieranych przez Llama 4. Meta wymienia 12 języków, między innymi angielski, niemiecki, francuski, włoski, hiszpański i portugalski.2 Jednocześnie pretraining objął dane w około 200 językach, a Meta dopuszcza dostrajanie modelu do języków spoza tej listy.2
Llama poradzi sobie więc z polskim, ale producent nie daje dla niego takiego samego poziomu deklarowanego wsparcia jak dla języków z model card. Przy polskim systemie produkcyjnym trzeba testować własne zadania: odmianę, terminologię branżową, formatowanie, wyszukiwanie semantyczne, skłonność do zmyślania i trzymanie się instrukcji.
Lokalna inferencja daje za to realną przewagę w kontroli danych. Jeżeli model, interfejs i baza wiedzy działają na własnym serwerze, treść promptu nie musi trafiać do zewnętrznego dostawcy. To jeszcze nie jest pełna prywatność, bo aplikacja otaczająca model może korzystać z zewnętrznej telemetrii, repozytoriów albo dodatkowych API. O bezpieczeństwie decyduje cały stos, nie sam checkpoint.
Dla organizacji przetwarzającej dokumenty wewnętrzne ten wybór bywa ważniejszy niż kilka punktów w benchmarku. Llama pozwala zbudować środowisko, w którym wagi i dane zostają pod kontrolą operatora. Ceną niezależności są wymagania sprzętowe, utrzymanie infrastruktury i konieczność samodzielnej oceny jakości modelu dla polskiego.
Źródła
Zweryfikowano: wrzesień 2026
Dokumentacja i licencja Meta dla rodziny Llama, definicja Open Source AI, karty modeli oraz dokumentacja sprzętu i konkurencyjnych API.
- llama-models, dokumentacja repozytorium DokumentacjaMetagithub.com
- Llama 4 Model Card DokumentacjaMetagithub.com
- Llama 4 Community License Agreement PrzepisMetagithub.com
- The Open Source AI Definition 1.0 StandardOpen Source Initiativeopensource.org
- The Llama 4 herd: the beginning of a new era of natively multimodal AI innovation RaportMetaai.meta.com
- Llama 4 Scout 17B 16E Instruct, karta modelu DokumentacjaMetahuggingface.co
- NVIDIA DGX H100 i H200 User Guide DokumentacjaNVIDIAdocs.nvidia.com
- Model guidance, rodzina modeli API DokumentacjaOpenAIdevelopers.openai.com
- Gemini API Models DokumentacjaGoogleai.google.dev
- llama-models, plik pyproject.toml DokumentacjaMetagithub.com
Najczęściej zadawane pytania
Czy Llama jest darmowa do zastosowań komercyjnych?
Tak, licencja Llama 4 jest nieodpłatna i pozwala na użycie komercyjne, modyfikacje i dystrybucję. Wyjątkiem są bardzo duże usługi: podmiot, którego produkty miały ponad 700 mln aktywnych użytkowników miesięcznie w miesiącu poprzedzającym premierę modelu, musi wystąpić do Meta o osobną licencję.
Czy Llama to open source?
Nie w rozumieniu definicji Open Source AI, która wymaga dostępu także do informacji o danych treningowych i pełnego kodu do trenowania. Meta udostępnia wagi, kod inferencji i dokumentację na własnej licencji z dodatkowymi warunkami, więc precyzyjniejsze określenie to model z otwartymi wagami.
Jakie wymagania sprzętowe ma Llama 4?
Scout w kwantyzacji Int4 działa według Meta na jednym GPU z 80 GB pamięci, w FP8 potrzebuje dwóch takich kart, a w pełnej precyzji BF16 co najmniej czterech. Maverick w FP8 jest przeznaczony na host DGX H100 z ośmioma GPU i 640 GB łącznej pamięci.
Czy Llama obsługuje język polski?
Polski nie jest jednym z 12 języków wymienionych jako oficjalnie wspierane, ale pretraining objął dane w około 200 językach, a Meta dopuszcza dostrajanie modelu do języków spoza listy. Przy wdrożeniu produkcyjnym trzeba przetestować odmianę, terminologię i trzymanie się instrukcji.
Który wariant Llamy uruchomię na zwykłym komputerze?
Żaden z modeli Llama 4. Na laptopie albo domowym PC realne są mniejsze modele poprzedniej generacji, na przykład Llama 3.2 w wersji 1B lub 3B, ewentualnie mocno skwantyzowane warianty przygotowane przez narzędzia zewnętrzne.

