Wstęp
Jeśli chcesz uruchomić model językowy (ang. LLM) na swoim komputerze to na start fajnym rozwiązaniem jest Ollama. W tym wpisie zakładam instalacje na Windows i pracę w konsoli. Ja używam zamiast standarodwej konsoli cmd.exe programu cmder.exe. Oczywiście musisz posiadać sensowna kartę graficzną czyli GPU oraz właściwe sterowniki. Wszystko jest opisane na stronie Ollamy w sekcji instalacji Widnows. Ja mam starą NVidia RTX 2060 12GB VRAM co starczy do prostych modeli LLM. Sama instalacja jest banalna:
Instalacja
- pobierasz instalator z tego łącza i go uruchamiasz
- albo wpisujesz taką komendę do okna PowerShell
irm https://ollama.com/install.ps1 | iex
Po instalacji dobrze jest ustawić podstawowe opcje takie jak adres i port na jakim ollama serwer nasłuchuje oraz miejsce przechowywania modeli LLM. Trzeba wybrać dysk na jakim mamy naprawdę dużo miejsca ponieważ każdy model to minimum kilka GB. Zrobimy to wpisując w terminalu zmienne systemowe dla OLLAMY. Można też przez aplet w panelu sterownia. Zatem uruchamiamy terminal i w nim wpiszemy:
set /x OLLAMA_HOST=0.0.0.0:11434 set /x OLLAMA_KEEPALIVE=-1 set /x OLLAMA_MODELS=g:\AI\ollama
To podstawowe opcje. Pierwsza mówi, żel Ollama serwer ma nasłuchiwać na dowolnym adresie IP i porcie 11434 (sprawdź jaki masz wolny). Druga mówi, że model sam się nie usunie z pamięci w czasie pracy kiedy go nie będziemy używać przez dłuższy czas. Trzecia opcja mówi gdzie Ollama szuka swoich modeli, gidzie one będą pobierane przy polecenia automatycznego pobierania ich z sieci. Polecenie 'set /x’ ustala te zmienne na stałe, bez tego polecenia maja one zastosowanie tylko w danej sesji terminala.
Jeśli masz już zainstalowany pakiet Ollama to możesz pobrać polski model językowy Bielik. Występuje w wielu wersjach, tutaj pokażę jak pobrać wersję 11B v2.2, która bardzo dobrze radzi sobie z językiem polskim ale nie wspiera innych języków. Zajmuje ona około 10GB. Zakładam, że Ollama jest skonfigurowana i działa poprawnie oraz masz miejsce na dysku na sam model. Pamiętaj, że serwer Ollamy musi być uruchomiony, a zrobisz to poleceniem:
ollama serve
Po chwili w terminalu pojawi sie coś jak niżej:
Tego okna nie zamykaj bo wyłączysz serwer. Otwórz drugi terminali wpisz „ollama run nazwa_modelu” gdzie nazwa modelu to wybrana nazwa modelu LLM. Jak ich nie masz to musisz pobrać. Najprościej poleceniem „ollama pull model” poleceniem run. Jak modelu brak na Twojej maszynie Ollama pobierze go automatycznie, co potrwa bo maja one po kilka GB. Ja pobierze to uruchomi i możesz konwersować z lokalnym LLM.
Modele językowe przechowywane są w ustalonym zmienną środowiskową OLLAMA_MODELS co można sprawdzić(poniżej dla windows):
set | find "OLLAMA"
Pobieranie modelu za pomocą polecenia 'ollama pull’
Najpierw wyszukujemy model w serwisie ollama.com:
Wybieramy model i kopiujemy link:
To łącze wklejamy do polecenia w konsoli
#ollama pull qooba/bielik-11b-v2.6-instruct:Q4_K_M
Model się pobiera, co zajmie chwilkę. Możemy sparwdzic czy Ollama go widzi:
#ollama list
Potem możemy go już uruchomić:
ollama run qooba/bielik-11b-v2.6-instruct:Q4_K_M
Pobieranie modelu i jego konwersja do formatu Ollama
Tym razem pobieramy model ze strony huggingface.co. Wyszukujemy tam interesujący nas model np. Bielik-11B-v2.6-Instruct-GGUF we właściwej kwantyzacji i wybieramy model Instruct GGUF do konwersji na format Ollama
Przechodzimy do sekcji plików i pobieramy właściwy, potem klikamy w link do pobrania (aby pobrać potem w konsoli) albo klikamy w 'Download’:
Jak model się pobierze to możemy konwertować go do Ollama. W tym celu tworzymy plik o nazwie 'Modelfile’ (bez rozszerzenia i w tym samy katalogu gdzie pobrany plik) i wpisujemy do niego:
FROM ./Bielik-11B-v2.6-Instruct.Q6_K.gguf
Kolejno wydajemy polecenia (z konsoli i wym samym katalogu gdzie plik 'Modelfile’)
ollama create bielik-11b-v2.6-q6_k -f Modelfile
Rozpoczyna się proces konwersji:
Po dłuuuuuugiej chwili konwersji mamy model dla Ollama, co można sprawdzić poleceniem:
ollama list
Teraz można model uruchomić i zapytać o coś (lubię spytać podchwytliwie bo często modele sie wykładają):
ollama run bielik-11b-v2.6-q6_k:latest
Dobra, tym razem nie dał sie nabrać.













