Jos mikään yllä olevista ei ratkaise ongelmaasi, seuraava askel on tarkistaa ROCm:n omat GitHub-issuet ja keskustelupalstat, koska uusien korttien yhteensopivuusongelmat ratkeavat usein yhteisön toimesta ennen kuin ne päätyvät viralliseen dokumentaatioon. Kannattaa myös liittää mukaan täsmälliset versiotiedot (ROCm-versio, ajuriversio, LM Studio -versio ja tarkka näytönohjainmalli), kun kysyt apua, koska suurin osa turhista edestakaisin käydyistä keskusteluista syntyy juuri puuttuvista versiotiedoista.

Todellinen suorituskykyesimerkki

Tarkkoja, virallisia tokens-per-second-lukuja LM Studion ja ROCm:n yhdistelmälle on vielä vähän saatavilla, koska tulos riippuu voimakkaasti mallista, kvantisoinnista ja kontekstin pituudesta. Yksi julkinen, dokumentoitu esimerkki löytyy GitHub-käyttäjä aldrinaranin julkaisemasta oppaasta, jossa RX 7800 XT -kortilla mitattiin selvä ero CPU- ja GPU-ajon välillä.

AjotapaNäytönohjainNopeus
Vain CPU~8 tokenia/s
ROCm-runtimeRX 7800 XT~68 tokenia/s

Ero on karkeasti kahdeksankertainen, mikä havainnollistaa hyvin, miksi GPU-kerrosten asettaminen oikein (vaihe 12) on koko oppaan tärkein yksittäinen optimointi. Omat tuloksesi vaihtelevat mallin koon ja kortin mukaan, mutta samaa suuruusluokkaa kannattaa odottaa vastaavalla laitteistolla. Isommalla kortilla, kuten RX 9070 XT tai RX 7900 XTX, ero CPU:hun on tyypillisesti vielä suurempi, koska näissä korteissa on enemmän laskentayksiköitä ja nopeampi muistikaista, joka on juuri kielimallin inferenssissä pullonkaula. Muistikaistan merkitys korostuu erityisesti silloin, kun malli täyttää lähes koko VRAM:in, jolloin jokainen generoitu tokeni vaatii datan siirtämistä muistin ja laskentayksiköiden välillä mahdollisimman nopeasti.

Kannattaa suhtautua kaikkiin yksittäisiin tokens-per-second-lukuihin varauksella, koska ne riippuvat mallista, kvantisoinnista, kontekstin pituudesta, käytetystä kehotteesta ja jopa käyttöjärjestelmän taustaprosesseista. Paras tapa arvioida oman koneesi suorituskykyä on mitata se itse samalla mallilla ja samalla kehotteella ennen ja jälkeen ROCm-runtimen käyttöönoton, jolloin näet suoraan oman laitteistosi todellisen hyödyn ilman, että vertailet erilaisia testiolosuhteita keskenään.

Tietoturva ja yksityisyys: miksi paikallinen ajo kannattaa

Tämä on shattered.io:lle luonteva näkökulma, jota moni pelkkään suorituskykyyn keskittyvä opas ei mainitse lainkaan. Kun ajat kielimallia LM Studiolla ROCm:n kautta, kaikki keskustelun sisältö, ladatut dokumentit ja mahdolliset liitetiedostot pysyvät fyysisesti koneellasi. Mitään ei lähetetä ulkopuoliselle palvelimelle käsiteltäväksi, eikä palveluntarjoaja pysty näkemään kehotteitasi, tallentamaan niitä mallin jatkokoulutukseen tai luovuttamaan niitä kolmannelle osapuolelle.

Tämä on merkittävä ero verrattuna pilvipohjaisiin tekoälypalveluihin, joiden käyttöehdot ja tietosuojakäytännöt vaihtelevat palveluntarjoajittain ja muuttuvat ajoittain ilman suurta huomiota. Yrityskäytössä paikallinen ajo voi helpottaa myös GDPR-arviointia, koska henkilötietoja tai liikesalaisuuksia sisältävää dataa ei tarvitse siirtää EU:n ulkopuolelle tai kolmannen osapuolen infrastruktuuriin lainkaan. Tämä ei tarkoita, että paikallinen malli olisi automaattisesti turvallisempi kaikissa mielessä, sillä itse konetta pitää silti suojata tavallisilla keinoilla, mutta tiedonsiirtoon liittyvä riski poistuu käytännössä kokonaan.

Käytännön vinkki: jos avaat LM Studion paikallisen API-palvelimen myös muille laitteille kotiverkossasi, rajaa pääsy palomuurisäännöillä vain omaan lähiverkkoosi äläkä koskaan avaa porttia 1234 suoraan internetiin ilman autentikointikerrosta. Oletusasennus ei sisällä käyttäjätunnistusta, koska se on suunniteltu yhden käyttäjän paikalliseen käyttöön, ei julkiseksi palvelimeksi.

Sama periaate pätee, vaikka käyttäisit konetta vain itse: pidä käyttöjärjestelmä ja ROCm-paketit ajan tasalla tietoturvapäivitysten osalta, vaikka itse tekoälypino ei olisikaan jatkuvassa käytössä. Paikallinen kone, jolla on suora pääsy näytönohjaimen laskentaresursseihin, on siinä mielessä houkutteleva kohde, että sen kaappaaminen antaisi hyökkääjälle pääsyn myös laskentatehoon, ei pelkästään tietoihin.

Täydellinen esimerkkiprojekti: oma komentorivichattibotti

Kun palvelin toimii, sen päälle on helppo rakentaa oma pieni työkalu. Seuraava Python-skripti muodostaa yksinkertaisen komentorivichatin, joka keskustelee paikallisesti ajettavan mallin kanssa LM Studion OpenAI-yhteensopivan rajapinnan kautta. Tallenna se esimerkiksi nimellä chat.py.

import json
import urllib.request

API_URL = "http://localhost:1234/v1/chat/completions"
MODEL = "qwen2.5-7b-instruct"

def ask(messages):
    payload = json.dumps({
        "model": MODEL,
        "messages": messages,
        "temperature": 0.7
    }).encode("utf-8")

    req = urllib.request.Request(
        API_URL,
        data=payload,
        headers={"Content-Type": "application/json"}
    )
    with urllib.request.urlopen(req) as response:
        data = json.loads(response.read())
        return data["choices"][0]["message"]["content"]

def main():
    history = [{"role": "system", "content": "Vastaa aina suomeksi, lyhyesti ja ytimekkäästi."}]
    print("Paikallinen chattibotti kaynnissa. Kirjoita 'lopeta' poistuaksesi.")
    while True:
        user_input = input("Sina: ")
        if user_input.strip().lower() == "lopeta":
            break
        history.append({"role": "user", "content": user_input})
        reply = ask(history)
        history.append({"role": "assistant", "content": reply})
        print(f"Malli: {reply}")

if __name__ == "__main__":
    main()

Käynnistä skripti komennolla python3 chat.py, kun LM Studion palvelin on käynnissä ja malli ladattuna. Koska kaikki liikenne kulkee koneesi sisällä, mikään keskustelun sisältö ei poistu laitteestasi. Tämä on sama periaate, jolla voit rakentaa laajempia työkaluja, kuten paikallisia dokumenttihakuja tai automaatioskriptejä, ilman että data kulkee ulkopuolisen palvelun kautta.

Tästä pohjasta on helppo jatkaa moneen suuntaan. Voit lisätä skriptiin tiedostojen lukemisen ja liittää niiden sisällön kehotteeseen, jolloin sinulla on yksinkertainen tapa kysyä kysymyksiä omista dokumenteistasi ilman, että ne koskaan poistuvat koneeltasi. Yhtä lailla voit korvata input()-kutsun web-palvelimella, jolloin samaa mallia voi käyttää selaimen kautta muualta kotiverkostasi, kunhan muistat rajata pääsyn palomuurilla edellisessä osiossa mainitulla tavalla.

Edistyneet vinkit tehokkaampaan käyttöön

Kun perusasennus toimii ja olet ajanut ensimmäiset mallit onnistuneesti, seuraavat vinkit auttavat puristamaan laitteistosta enemmän irti. Osa näistä koskee myös suorittimen puolta: jos olet aiemmin virittänyt Ryzen-suorittimesi HWiNFO-oppaamme mukaisesti, samat periaatteet lämpötilojen ja tehonkulutuksen seurannasta pätevät myös näytönohjaimen puolella.

  • Aja LM Studion palvelin taustapalveluna systemd-yksikön kautta, jos haluat sen käynnistyvän automaattisesti koneen käynnistyessä.
  • Seuraa lämpötilaa ja tehonkulutusta pitkissä ajoissa komennolla rocm-smi --showtemp --showpower, erityisesti jos kotelon ilmanvaihto on tiukka.
  • Kokeile eri kvantisointitasoja samalle mallille: Q4_K_M säästää VRAM:ia, Q8_0 antaa tarkempia vastauksia mutta vaatii enemmän muistia.
  • Jos ajat useita malleja rinnakkain eri projekteihin, käytä lms-komentoriviä skriptien automatisointiin sen sijaan, että vaihdat malleja käsin graafisesta käyttöliittymästä.
  • Lukitse ROCm-versio tuotantokäytössä branch-kohtaisella pakettinimellä, jotta automaattinen järjestelmäpäivitys ei riko toimivaa asennusta yllättäen.
  • Pidä erillinen muistiinpano siitä, mikä ROCm-versio, ajuriversio ja LM Studio -versio olivat käytössä silloin kun asennus viimeksi toimi, jotta pystyt palaamaan tunnettuun toimivaan tilaan nopeasti, jos jokin päivitys rikkoo jotain.

Nämä vinkit eivät ole pakollisia perusasennuksen kannalta, mutta ne säästävät huomattavasti aikaa pitkällä aikavälillä, erityisesti jos päivität järjestelmääsi säännöllisesti tai kokeilet useita eri malleja ja kvantisointitasoja rinnakkain. Pieni ylimääräinen kirjanpitotyö asennuksen alkuvaiheessa maksaa itsensä takaisin heti ensimmäisen kerran, kun jokin päivitys menee pieleen ja sinun täytyy palauttaa järjestelmä tunnettuun toimivaan tilaan nopeasti.

Usein kysytyt kysymykset

Toimiiko LM Studio Windowsissa AMD-näytönohjaimella ilman ROCm-asennusta?
Kyllä. Windows-versio käyttää AMD-korteille ensisijaisesti Vulkan- ja DirectML-taustajärjestelmiä, jotka toimivat tavallisella Adrenalin-ajurilla ilman erillistä ROCm-pakettia. Tämä tekee Windows-reitistä huomattavasti nopeamman ottaa käyttöön kuin tässä oppaassa kuvattu Linux-polku, joskin ROCm:n laajempi työkalutuki jää tällä reitillä käyttämättä.

Mikä AMD Radeon -malli sopii parhaiten paikalliseen tekoälyyn?
Hinta-VRAM-suhteen puolesta RX 9060 XT 16 Gt on tällä hetkellä vahva sisääntulokortti, kun taas RX 9070 XT tai RX 7900 XTX sopivat isompiin malleihin ja useamman sovelluksen samanaikaiseen ajoon. Jos budjetti sallii, kannattaa aina valita enemmän VRAM:ia tarjoava malli saman sukupolven sisällä, koska VRAM on useammin pullonkaula kuin itse laskentateho kotikäytössä.

Paljonko VRAM:ia tarvitsen 7-9 miljardin parametrin malliin?
Q4_K_M-kvantisoinnilla 8 gigatavua riittää useimmiten juuri ja juuri, mutta 12-16 gigatavua antaa tilaa pidemmälle kontekstille ilman kompromisseja.

Toimiiko ROCm WSL2:ssa Windows 11:ssä?
Osittain. Uusimpien korttien, kuten RX 9000 -sarjan, tuki on ensin saapunut natiiviin Linuxiin, ja WSL2-tuki on seurannut viiveellä. Jos WSL2 on sinulle tärkeä, tarkista ajankohtainen tilanne ennen ostopäätöstä äläkä oleta, että natiivin Linuxin tukilista pätisi suoraan myös WSL2-ympäristössä.

Onko ROCm ilmainen käyttää?
Kyllä, ROCm on avoimen lähdekoodin ohjelmisto eikä sen käyttö kotikäytössä maksa mitään. Ainoa kustannus on näytönohjain itse ja sähkö, jolla sitä ajetaan. Myöskään LM Studio ei veloita henkilökohtaisesta käytöstä, joten koko putki on käytännössä ilmainen laitteiston hankinnan jälkeen.

Kannattaako paikallisen tekoälypalvelimen sähkönkulutusta miettiä Suomessa?
Kyllä varsinkin, jos konetta pidetään päällä jatkuvasti taustapalvelimena. Pörssisähkösopimuksella raskaimmat eräajot kannattaa ajoittaa halvempiin tunteihin, kun taas satunnainen keskustelukäyttö ei vaikuta laskuun merkittävästi.

Voiko LM Studiota käyttää ilman erillistä näytönohjainta?
Kyllä, LM Studio toimii myös pelkällä suorittimella, mutta generointinopeus on huomattavasti hitaampi, tyypillisesti kymmenesosa GPU-kiihdytetystä nopeudesta. Pelkkä suoritin voi silti riittää satunnaiseen kokeiluun tai hyvin pienille malleille, joissa vasteajalla ei ole kiire.

Miten päivitän ROCm:n uuteen versioon rikkomatta asennusta?
Poista vanha branch-kohtainen paketti ensin kokonaan, tarkista yhteensopiva ajuriversio ROCm:n julkaisutiedoista, ja asenna uusi versio vasta sen jälkeen. Suoraa päivitystä vanhan päälle ei suositella, koska se on yleisin yksittäinen syy rikkoutuneisiin ROCm-asennuksiin pitkäaikaisessa käytössä.

Yhteinen nimittäjä useimmille näistä sudenkuopista on kiire: asennus etenee liian nopeasti ilman että välivaiheiden onnistumista varmistetaan. Jokainen tämän oppaan vaihe sisältää tarkoituksella oman tarkistuskomennon juuri siksi, että virheet löytyvät heti eivätkä vasta kaksi vaihetta myöhemmin, jolloin niiden juurisyyn selvittäminen on huomattavasti työläämpää.

Vianetsintä: yleisimmät virheet ja korjaukset

Alla oleva taulukko kokoaa yhdeksän virhettä, joita ROCm- ja LM Studio -käyttäjät kohtaavat useimmin, sekä niiden käytännön korjaukset. Kannattaa käydä taulukko läpi järjestyksessä ylhäältä alas, koska useimmat myöhemmät ongelmat ratkeavat, kun ensimmäinen rivi (GPU:n tunnistus) on kunnossa. Jos olet aiemmin ajanut GPU-benchmarkkeja samalla koneella, voit hyödyntää samoja työkaluja tarkistaaksesi, näkyykö näytönohjain järjestelmässä ylipäätään oikein ennen kuin syytät ROCm-asennusta.

OngelmaTodennäköinen syyKorjaus
rocminfo ei näytä GPU:ta lainkaanAjuri tai ROCm-paketit eivät asentuneet oikeinAja sudo amdgpu-install --usecase=rocm,graphics uudelleen ja käynnistä kone
LM Studio ei tarjoa ROCm-runtimea valittavaksiROCm-pino puuttuu tai on rikki taustallaVahvista rocminfo-tulos ensin, asenna LM Studio uudelleen tämän jälkeen
“Out of memory” mallia ladattaessaMalli tai konteksti on liian suuri VRAM:iin nähdenVaihda pienempään kvantisointiin (esim. Q4_K_M) tai lyhennä kontekstia
Palvelin ei vastaa osoitteessa localhost:1234Palvelinta ei ole käynnistetty tai portti on varattuTarkista lms ls ja vapauta portti komennolla sudo lsof -i :1234
Generointi on hidasta GPU:sta huolimattaGPU-kerrokset asetettu nollaan, malli laskee CPU:llaNosta GPU-kerrosten liukusäädin maksimiin latausikkunassa
amdgpu-install epäonnistuu riippuvuusvirheeseenRistiriitaiset tai vanhentuneet pakettivarastotAja sudo apt update && sudo apt --fix-broken install ennen uutta yritystä
Kortti tunnistetaan mutta ROCm kaatuu käynnistyksessäOsittain tuettu arkkitehtuuri ilman ohitustaAseta HSA_OVERRIDE_GFX_VERSION lähimmän tuetun arkkitehtuurin mukaan
PyTorch ei löydä ROCm-laitetta ROCm-asennuksen jälkeenYmpäristömuuttujat eivät ole aktiivisia nykyisessä istunnossaAvaa uusi terminaali-istunto uudelleenkäynnistyksen jälkeen ja testaa uudelleen
Windows-versio kaatuu isolla kontekstillaVulkan-runtime tavoittaa VRAM-rajanPienennä kontekstin pituutta tai vaihda pienempään malliin

Jos mikään yllä olevista ei ratkaise ongelmaasi, seuraava askel on tarkistaa ROCm:n omat GitHub-issuet ja keskustelupalstat, koska uusien korttien yhteensopivuusongelmat ratkeavat usein yhteisön toimesta ennen kuin ne päätyvät viralliseen dokumentaatioon. Kannattaa myös liittää mukaan täsmälliset versiotiedot (ROCm-versio, ajuriversio, LM Studio -versio ja tarkka näytönohjainmalli), kun kysyt apua, koska suurin osa turhista edestakaisin käydyistä keskusteluista syntyy juuri puuttuvista versiotiedoista.

Todellinen suorituskykyesimerkki

Tarkkoja, virallisia tokens-per-second-lukuja LM Studion ja ROCm:n yhdistelmälle on vielä vähän saatavilla, koska tulos riippuu voimakkaasti mallista, kvantisoinnista ja kontekstin pituudesta. Yksi julkinen, dokumentoitu esimerkki löytyy GitHub-käyttäjä aldrinaranin julkaisemasta oppaasta, jossa RX 7800 XT -kortilla mitattiin selvä ero CPU- ja GPU-ajon välillä.

AjotapaNäytönohjainNopeus
Vain CPU~8 tokenia/s
ROCm-runtimeRX 7800 XT~68 tokenia/s

Ero on karkeasti kahdeksankertainen, mikä havainnollistaa hyvin, miksi GPU-kerrosten asettaminen oikein (vaihe 12) on koko oppaan tärkein yksittäinen optimointi. Omat tuloksesi vaihtelevat mallin koon ja kortin mukaan, mutta samaa suuruusluokkaa kannattaa odottaa vastaavalla laitteistolla. Isommalla kortilla, kuten RX 9070 XT tai RX 7900 XTX, ero CPU:hun on tyypillisesti vielä suurempi, koska näissä korteissa on enemmän laskentayksiköitä ja nopeampi muistikaista, joka on juuri kielimallin inferenssissä pullonkaula. Muistikaistan merkitys korostuu erityisesti silloin, kun malli täyttää lähes koko VRAM:in, jolloin jokainen generoitu tokeni vaatii datan siirtämistä muistin ja laskentayksiköiden välillä mahdollisimman nopeasti.

Kannattaa suhtautua kaikkiin yksittäisiin tokens-per-second-lukuihin varauksella, koska ne riippuvat mallista, kvantisoinnista, kontekstin pituudesta, käytetystä kehotteesta ja jopa käyttöjärjestelmän taustaprosesseista. Paras tapa arvioida oman koneesi suorituskykyä on mitata se itse samalla mallilla ja samalla kehotteella ennen ja jälkeen ROCm-runtimen käyttöönoton, jolloin näet suoraan oman laitteistosi todellisen hyödyn ilman, että vertailet erilaisia testiolosuhteita keskenään.

Tietoturva ja yksityisyys: miksi paikallinen ajo kannattaa

Tämä on shattered.io:lle luonteva näkökulma, jota moni pelkkään suorituskykyyn keskittyvä opas ei mainitse lainkaan. Kun ajat kielimallia LM Studiolla ROCm:n kautta, kaikki keskustelun sisältö, ladatut dokumentit ja mahdolliset liitetiedostot pysyvät fyysisesti koneellasi. Mitään ei lähetetä ulkopuoliselle palvelimelle käsiteltäväksi, eikä palveluntarjoaja pysty näkemään kehotteitasi, tallentamaan niitä mallin jatkokoulutukseen tai luovuttamaan niitä kolmannelle osapuolelle.

Tämä on merkittävä ero verrattuna pilvipohjaisiin tekoälypalveluihin, joiden käyttöehdot ja tietosuojakäytännöt vaihtelevat palveluntarjoajittain ja muuttuvat ajoittain ilman suurta huomiota. Yrityskäytössä paikallinen ajo voi helpottaa myös GDPR-arviointia, koska henkilötietoja tai liikesalaisuuksia sisältävää dataa ei tarvitse siirtää EU:n ulkopuolelle tai kolmannen osapuolen infrastruktuuriin lainkaan. Tämä ei tarkoita, että paikallinen malli olisi automaattisesti turvallisempi kaikissa mielessä, sillä itse konetta pitää silti suojata tavallisilla keinoilla, mutta tiedonsiirtoon liittyvä riski poistuu käytännössä kokonaan.

Käytännön vinkki: jos avaat LM Studion paikallisen API-palvelimen myös muille laitteille kotiverkossasi, rajaa pääsy palomuurisäännöillä vain omaan lähiverkkoosi äläkä koskaan avaa porttia 1234 suoraan internetiin ilman autentikointikerrosta. Oletusasennus ei sisällä käyttäjätunnistusta, koska se on suunniteltu yhden käyttäjän paikalliseen käyttöön, ei julkiseksi palvelimeksi.

Sama periaate pätee, vaikka käyttäisit konetta vain itse: pidä käyttöjärjestelmä ja ROCm-paketit ajan tasalla tietoturvapäivitysten osalta, vaikka itse tekoälypino ei olisikaan jatkuvassa käytössä. Paikallinen kone, jolla on suora pääsy näytönohjaimen laskentaresursseihin, on siinä mielessä houkutteleva kohde, että sen kaappaaminen antaisi hyökkääjälle pääsyn myös laskentatehoon, ei pelkästään tietoihin.

Täydellinen esimerkkiprojekti: oma komentorivichattibotti

Kun palvelin toimii, sen päälle on helppo rakentaa oma pieni työkalu. Seuraava Python-skripti muodostaa yksinkertaisen komentorivichatin, joka keskustelee paikallisesti ajettavan mallin kanssa LM Studion OpenAI-yhteensopivan rajapinnan kautta. Tallenna se esimerkiksi nimellä chat.py.

import json
import urllib.request

API_URL = "http://localhost:1234/v1/chat/completions"
MODEL = "qwen2.5-7b-instruct"

def ask(messages):
    payload = json.dumps({
        "model": MODEL,
        "messages": messages,
        "temperature": 0.7
    }).encode("utf-8")

    req = urllib.request.Request(
        API_URL,
        data=payload,
        headers={"Content-Type": "application/json"}
    )
    with urllib.request.urlopen(req) as response:
        data = json.loads(response.read())
        return data["choices"][0]["message"]["content"]

def main():
    history = [{"role": "system", "content": "Vastaa aina suomeksi, lyhyesti ja ytimekkäästi."}]
    print("Paikallinen chattibotti kaynnissa. Kirjoita 'lopeta' poistuaksesi.")
    while True:
        user_input = input("Sina: ")
        if user_input.strip().lower() == "lopeta":
            break
        history.append({"role": "user", "content": user_input})
        reply = ask(history)
        history.append({"role": "assistant", "content": reply})
        print(f"Malli: {reply}")

if __name__ == "__main__":
    main()

Käynnistä skripti komennolla python3 chat.py, kun LM Studion palvelin on käynnissä ja malli ladattuna. Koska kaikki liikenne kulkee koneesi sisällä, mikään keskustelun sisältö ei poistu laitteestasi. Tämä on sama periaate, jolla voit rakentaa laajempia työkaluja, kuten paikallisia dokumenttihakuja tai automaatioskriptejä, ilman että data kulkee ulkopuolisen palvelun kautta.

Tästä pohjasta on helppo jatkaa moneen suuntaan. Voit lisätä skriptiin tiedostojen lukemisen ja liittää niiden sisällön kehotteeseen, jolloin sinulla on yksinkertainen tapa kysyä kysymyksiä omista dokumenteistasi ilman, että ne koskaan poistuvat koneeltasi. Yhtä lailla voit korvata input()-kutsun web-palvelimella, jolloin samaa mallia voi käyttää selaimen kautta muualta kotiverkostasi, kunhan muistat rajata pääsyn palomuurilla edellisessä osiossa mainitulla tavalla.

Edistyneet vinkit tehokkaampaan käyttöön

Kun perusasennus toimii ja olet ajanut ensimmäiset mallit onnistuneesti, seuraavat vinkit auttavat puristamaan laitteistosta enemmän irti. Osa näistä koskee myös suorittimen puolta: jos olet aiemmin virittänyt Ryzen-suorittimesi HWiNFO-oppaamme mukaisesti, samat periaatteet lämpötilojen ja tehonkulutuksen seurannasta pätevät myös näytönohjaimen puolella.

  • Aja LM Studion palvelin taustapalveluna systemd-yksikön kautta, jos haluat sen käynnistyvän automaattisesti koneen käynnistyessä.
  • Seuraa lämpötilaa ja tehonkulutusta pitkissä ajoissa komennolla rocm-smi --showtemp --showpower, erityisesti jos kotelon ilmanvaihto on tiukka.
  • Kokeile eri kvantisointitasoja samalle mallille: Q4_K_M säästää VRAM:ia, Q8_0 antaa tarkempia vastauksia mutta vaatii enemmän muistia.
  • Jos ajat useita malleja rinnakkain eri projekteihin, käytä lms-komentoriviä skriptien automatisointiin sen sijaan, että vaihdat malleja käsin graafisesta käyttöliittymästä.
  • Lukitse ROCm-versio tuotantokäytössä branch-kohtaisella pakettinimellä, jotta automaattinen järjestelmäpäivitys ei riko toimivaa asennusta yllättäen.
  • Pidä erillinen muistiinpano siitä, mikä ROCm-versio, ajuriversio ja LM Studio -versio olivat käytössä silloin kun asennus viimeksi toimi, jotta pystyt palaamaan tunnettuun toimivaan tilaan nopeasti, jos jokin päivitys rikkoo jotain.

Nämä vinkit eivät ole pakollisia perusasennuksen kannalta, mutta ne säästävät huomattavasti aikaa pitkällä aikavälillä, erityisesti jos päivität järjestelmääsi säännöllisesti tai kokeilet useita eri malleja ja kvantisointitasoja rinnakkain. Pieni ylimääräinen kirjanpitotyö asennuksen alkuvaiheessa maksaa itsensä takaisin heti ensimmäisen kerran, kun jokin päivitys menee pieleen ja sinun täytyy palauttaa järjestelmä tunnettuun toimivaan tilaan nopeasti.

Usein kysytyt kysymykset

Toimiiko LM Studio Windowsissa AMD-näytönohjaimella ilman ROCm-asennusta?
Kyllä. Windows-versio käyttää AMD-korteille ensisijaisesti Vulkan- ja DirectML-taustajärjestelmiä, jotka toimivat tavallisella Adrenalin-ajurilla ilman erillistä ROCm-pakettia. Tämä tekee Windows-reitistä huomattavasti nopeamman ottaa käyttöön kuin tässä oppaassa kuvattu Linux-polku, joskin ROCm:n laajempi työkalutuki jää tällä reitillä käyttämättä.

Mikä AMD Radeon -malli sopii parhaiten paikalliseen tekoälyyn?
Hinta-VRAM-suhteen puolesta RX 9060 XT 16 Gt on tällä hetkellä vahva sisääntulokortti, kun taas RX 9070 XT tai RX 7900 XTX sopivat isompiin malleihin ja useamman sovelluksen samanaikaiseen ajoon. Jos budjetti sallii, kannattaa aina valita enemmän VRAM:ia tarjoava malli saman sukupolven sisällä, koska VRAM on useammin pullonkaula kuin itse laskentateho kotikäytössä.

Paljonko VRAM:ia tarvitsen 7-9 miljardin parametrin malliin?
Q4_K_M-kvantisoinnilla 8 gigatavua riittää useimmiten juuri ja juuri, mutta 12-16 gigatavua antaa tilaa pidemmälle kontekstille ilman kompromisseja.

Toimiiko ROCm WSL2:ssa Windows 11:ssä?
Osittain. Uusimpien korttien, kuten RX 9000 -sarjan, tuki on ensin saapunut natiiviin Linuxiin, ja WSL2-tuki on seurannut viiveellä. Jos WSL2 on sinulle tärkeä, tarkista ajankohtainen tilanne ennen ostopäätöstä äläkä oleta, että natiivin Linuxin tukilista pätisi suoraan myös WSL2-ympäristössä.

Onko ROCm ilmainen käyttää?
Kyllä, ROCm on avoimen lähdekoodin ohjelmisto eikä sen käyttö kotikäytössä maksa mitään. Ainoa kustannus on näytönohjain itse ja sähkö, jolla sitä ajetaan. Myöskään LM Studio ei veloita henkilökohtaisesta käytöstä, joten koko putki on käytännössä ilmainen laitteiston hankinnan jälkeen.

Kannattaako paikallisen tekoälypalvelimen sähkönkulutusta miettiä Suomessa?
Kyllä varsinkin, jos konetta pidetään päällä jatkuvasti taustapalvelimena. Pörssisähkösopimuksella raskaimmat eräajot kannattaa ajoittaa halvempiin tunteihin, kun taas satunnainen keskustelukäyttö ei vaikuta laskuun merkittävästi.

Voiko LM Studiota käyttää ilman erillistä näytönohjainta?
Kyllä, LM Studio toimii myös pelkällä suorittimella, mutta generointinopeus on huomattavasti hitaampi, tyypillisesti kymmenesosa GPU-kiihdytetystä nopeudesta. Pelkkä suoritin voi silti riittää satunnaiseen kokeiluun tai hyvin pienille malleille, joissa vasteajalla ei ole kiire.

Miten päivitän ROCm:n uuteen versioon rikkomatta asennusta?
Poista vanha branch-kohtainen paketti ensin kokonaan, tarkista yhteensopiva ajuriversio ROCm:n julkaisutiedoista, ja asenna uusi versio vasta sen jälkeen. Suoraa päivitystä vanhan päälle ei suositella, koska se on yleisin yksittäinen syy rikkoutuneisiin ROCm-asennuksiin pitkäaikaisessa käytössä.

Nvidia ja CUDA hallitsevat yhä paikallisen tekoälyn keskustelua, mutta moni suomalainen käyttää jo AMD Radeon -näytönohjainta pelikoneessaan eikä halua ostaa uutta korttia pelkän kielimallin ajamisen vuoksi. Hyvä uutinen on, että se ei ole enää tarpeen. AMD:n ROCm-ohjelmistopino on kasvanut vuosien varrella käyttökelpoiseksi myös kuluttajakorteilla, ja LM Studio versiossa 0.4.23 tekee koko prosessista huomattavasti helpompaa kuin komentorivipohjaiset vaihtoehdot. Tässä oppaassa käydään läpi, miten Radeon RX 7000- ja RX 9000 -sarjan näytönohjaimella pystyy ajamaan kielimalleja paikallisesti, ilman pilvipalveluita ja ilman kuukausimaksuja.

Opas etenee vaihe vaiheelta Ubuntu-pohjaisesta ROCm-asennuksesta LM Studion käyttöönottoon ja lopuksi omaan Python-pohjaiseen esimerkkiprojektiin. Mukana on myös nopeampi Windows-reitti niille, jotka eivät halua koskea Linuxiin lainkaan. Kaikki komennot ja versiot on tarkistettu syyskuussa 2026, joten ohjeet toimivat suoraan kopioitaessa.

Jos olet aiemmin lukenut laitteistokategoriamme muita oppaita, tiedät jo että Nvidia-puolella samantyyppinen asennus onnistuu suoraan Ollamalla parissa minuutissa. AMD-reitti vaatii hieman enemmän vaiheita, koska ROCm ei ole yhtä valmiiksi paketoitu kuin CUDA, mutta lopputulos on käytännössä yhtä käyttökelpoinen kotikoneella. Tämä opas on kirjoitettu erityisesti niille, joilla on jo Radeon-kortti koneessa ja jotka haluavat hyödyntää sen myös tekoälyyn, ei pelkästään pelaamiseen.

Miksi AMD Radeon kannattaa paikalliseen tekoälyyn

Suurin syy on VRAM per euro. AMD:n oma ohjehinta RX 9060 XT 16 Gt -mallille on 349 dollaria, mikä on Suomen hintatasolla noin 374 euroa, ja kortista saa silti täydet 16 gigatavua muistia mallien lataamiseen. Vertailun vuoksi moni vastaavan hintaluokan Nvidia-kortti tarjoaa vain 8 tai 12 gigatavua. Kielimallin koko rajoittaa suoraan sitä, kuinka isoja ja tarkkoja vastauksia malli pystyy tuottamaan, joten enemmän VRAM:ia tarkoittaa käytännössä enemmän vaihtoehtoja ilman kvantisoinnin karsimista äärimmilleen.

Toinen syy on ROCm:n kypsyminen. AMD julkaisi syyskuussa 2025 blogikirjoituksen otsikolla “The Road to ROCm on Radeon for Windows and Linux”, jossa PyTorch-tuki tuotiin julkiseen esikatseluun sekä Windowsille että Linuxille RX 7000- ja RX 9000 -sarjan korteille. Vuoteen 2026 mennessä ROCm on edennyt versioon 10.0.0, ja sen dokumentaatio kuvaa alustan nyt avoimen lähdekoodin ja alustariippumattomaksi ratkaisuksi, joka toimii sekä Linuxilla että Windowsilla. Tämä ei tarkoita, että kaikki toimisi identtisesti molemmilla käyttöjärjestelmillä, mutta suunta on selvä: Radeon ei ole enää toisen luokan kansalainen paikallisessa tekoälyssä.

Kolmas syy koskee erityisesti Suomea ja muuta Pohjolaa. Suuri osa suomalaisista kotitalouksista on siirtynyt pörssisähköön, jolloin sähkön hinta vaihtelee tunneittain. Kielimallin ajaminen paikallisesti tarkoittaa, että voit ajoittaa raskaammat eräajot ja mallien lataukset halvempiin yötunteihin, kun taas pilvipalvelun laskutus ei välitä kellonajasta. Tähän palataan tarkemmin oppaan loppupuolella.

Neljäs, vähemmän mitattava syy on yhteisön luottamus. AMD on julkaissut ROCm:n lähdekoodin avoimesti jo vuosia, ja kehitystä voi seurata suoraan GitHubista ilman mustia laatikoita. Tämä on houkutellut ympärille aktiivisen harrastajayhteisön, joka on tuottanut käytännön ohjeita, korjauksia ja yhteensopivuuslistoja jopa niille korteille, joita AMD itse ei virallisesti tue. Tästä syystä moni kotikäyttäjä pystyy ajamaan ROCm:ää kortilla, joka ei ole virallisessa tukilistassa, kunhan on valmis lukemaan hieman yhteisön dokumentaatiota virallisen tuen puuttuessa.

ROCm:n kypsyminen: mistä ollaan tultu vuoteen 2026 mennessä

ROCm ei ole uusi projekti, mutta sen kuluttajakorttituki on ollut pitkään heikko kohta. Vielä muutama vuosi sitten ROCm toimi luotettavasti lähinnä AMD:n kalliilla Instinct-datakeskuskorteilla, ja tavallisen Radeon-pelaajan piti turvautua epävirallisiin kiertoteihin saadakseen edes jotain toimimaan. Tilanne muuttui merkittävästi, kun AMD julkaisi ROCm 6.4.1b -päivityksen, joka toi RX 9000 -sarjan tuen mukaan heti uuden sukupolven korttien julkaisun yhteydessä, ei vuosia jäljessä kuten aiemmin.

Radeon Software for Linux 25.10.2.1 -ajuripaketti, joka sisältää ROCm 6.4.2:n, laajensi koneoppimistuen kattamaan sekä RDNA 4- että RDNA 3 -sukupolvet samassa paketissa. Käytännössä tämä tarkoittaa, että RX 9070 XT, RX 9070, RX 9070 GRE ja RX 9060 XT saivat tuen PyTorchille, ONNX Runtimelle, JAX:ille ja TensorFlow’lle heti julkaisusta lähtien, eikä käyttäjän tarvinnut odottaa kuukausia erillistä koneoppimispäivitystä. Syksyllä 2026 julkaistu ROCm Core SDK 10.0.0 vei kehitystä vielä pidemmälle: dokumentaatio kuvaa sen nyt avoimeksi lähdekoodiksi, joka on suunniteltu alustariippumattomaksi Linuxin ja Windowsin välillä, ei pelkästään Linux-keskeiseksi projektiksi.

Tämä kehityskaari selittää, miksi tämän oppaan neuvot voivat muuttua parin vuoden sisällä. Jos luet tätä esimerkiksi vuonna 2027, kannattaa tarkistaa AMD:n omasta ROCm-dokumentaatiosta, onko Windows-tuki edennyt siihen pisteeseen, että myös LM Studion ROCm-runtime (eikä pelkkä Vulkan) toimisi natiivisti Windowsilla ilman WSL2:ta.

Esivaatimukset: laitteisto, käyttöjärjestelmä ja versiot

Ennen kuin aloitat, tarkista että seuraavat asiat täsmäävät. Ohje on kirjoitettu Ubuntu-käyttäjälle, koska ROCm:n tuki on tällä hetkellä kypsintä Linuxilla, mutta Windows-vaihtoehto esitellään myöhemmin omassa osiossa.

  • Käyttöjärjestelmä: Ubuntu 24.04.4 LTS tai Ubuntu 22.04.5 LTS (ROCm:n virallisesti tukemat versiot)
  • Näytönohjain: AMD Radeon RX 7700 XT, RX 7800 XT, RX 7900 GRE/XT/XTX, tai RX 9060, RX 9060 XT, RX 9070, RX 9070 GRE, RX 9070 XT
  • ROCm-versio: 7.2.1 tuotantokäyttöön, tai uusin ydin-SDK 10.0.0 kokeilunhaluisille
  • LM Studio: versio 0.4.23 (julkaistu 29.8.2026)
  • Järjestelmämuisti: vähintään 16 Gt, suositellaan 32 Gt useamman mallin samanaikaiseen lataamiseen
  • Levytila: vähintään 40 Gt vapaana ROCm-pinolle ja pariin kielimalliin
  • Käyttäjätunnus, jolla on sudo-oikeudet pakettien asennukseen
  • Toimiva internetyhteys mallien ja pakettien lataamiseen (itse käyttö ei tarvitse yhteyttä asennuksen jälkeen)

Huomaa, että ROCm:n Linux-tukimatriisi versiolle 7.2.1 listaa juuri yllä mainitut kortit virallisesti tuetuiksi Ubuntu 22.04, 24.04 ja 25.10 -järjestelmillä. Jos näytönohjaimesi ei ole listalla, se ei tarkoita, ettei se toimisi lainkaan, mutta joudut todennäköisesti käyttämään HSA_OVERRIDE_GFX_VERSION-muuttujaa, josta lisää tuonnempana.

Versionumerot kannattaa ottaa vakavasti, koska ROCm-ekosysteemi on edelleen herkkä versioristiriidoille. Väärä yhdistelmä ajuria ja ROCm-pakettia on yleisin yksittäinen syy siihen, että asennus näyttää onnistuneelta mutta näytönohjainta ei silti löydy myöhemmässä vaiheessa. Jos koneessasi on jo valmiiksi jokin vanhempi ROCm-asennus, kannattaa se poistaa kokonaan ennen kuin aloitat tämän oppaan mukaisesti, sillä osittaiset tai keskeneräiset asennukset aiheuttavat vaikeasti jäljitettäviä virheitä.

Muistin ja levytilan suositukset tässä oppaassa ovat käytännön nyrkkisääntöjä, eivät virallisia minimivaatimuksia, koska LM Studion omat julkaisusivut eivät toistaiseksi listaa tarkkoja RAM-vaatimuksia. Kokemus useista asennuksista kuitenkin osoittaa, että 16 gigatavua järjestelmämuistia on käytännön alaraja sujuvaan käyttöön, kun samaan aikaan on auki selain, LM Studio ja itse ladattu kielimalli.

ROCm vai Vulkan? Kaksi tapaa käyttää Radeonia LM Studiossa

AMD:n oma LM Studio -ohjekirja on tässä täsmällinen: “LM Studio offers both Vulkan and AMD ROCm™ software backends (called runtimes) for AMD users.” Käytännössä tämä tarkoittaa, että LM Studio antaa valita kahden ajonaikaisen taustajärjestelmän väliltä, ja valinta kannattaa tehdä käyttötarkoituksen mukaan, ei oletuksena.

Vulkan-runtime toimii lähes jokaisella modernilla AMD-kortilla ilman erillistä asennusta, koska se nojaa samaan grafiikka-ajuriin, joka on jo koneellasi pelaamista varten. Se on nopein tapa päästä alkuun, ja Windows-käyttäjille se on tällä hetkellä käytännössä oletusreitti, sillä LM Studion AMD-kiihdytys Windowsilla kulkee ensisijaisesti Vulkanin ja DirectML:n kautta, ei ROCm:n. ROCm-runtime puolestaan avaa pääsyn koko AMD:n tekoälypinoon: PyTorchiin, ONNX Runtimeen, JAX:iin ja TensorFlow’hun, ja se on tyypillisesti nopeampi raskaissa kuormissa, koska se on suunniteltu nimenomaan laskentaa varten grafiikan sijaan. Tämä tuki on toistaiseksi vahvinta Linuxilla, vaikka ROCm 10.0.0:n dokumentaatio ilmoittaa jo tukevansa Windowsia natiivisti.

Voit tarkistaa kumpi runtime on juuri nyt käytössä LM Studion asetusvalikosta kohdasta “Runtime” tai “Hardware”. Jos et ole varma, kumpi vaihtoehto on valittuna, hyvä nyrkkisääntö on seurata mallin latauksen jälkeistä GPU-kuormaa käyttöjärjestelmän omalla työkalulla: jos näytönohjaimen käyttöaste nousee selvästi lähelle sataa prosenttia generoinnin aikana, kiihdytys toimii, oli runtime kumpi tahansa. Jos kuorma pysyy lähellä nollaa ja vain suorittimen käyttöaste nousee, malli laskee edelleen CPU:lla eikä kumpikaan runtime ole aktiivinen.

OminaisuusVulkan-runtimeAMD ROCm -runtime
Asennuksen vaativuusEi erillistä asennusta, käyttää olemassa olevaa ajuriaVaatii oman ROCm-pinon asennuksen
KäyttöjärjestelmätukiWindows ja Linux tasavertaisestiVahvin Linuxilla, Windows-tuki kehittyy
Sopii parhaitenNopeaan aloitukseen, satunnaiskäyttöönToistuvaan raskaaseen käyttöön, kehitystyöhön
Laajempi työkalutukiRajallinenPyTorch, ONNX Runtime, JAX, TensorFlow
Tyypillinen suorituskykyHyväUsein parempi raskaissa malleissa

Tuetut AMD Radeon -näytönohjaimet ROCm:lle

ROCm:n virallinen laitteistotaulukko listaa tarkasti, mitkä arkkitehtuurit ja mallit ovat tuettuja. Tämä on hyödyllistä tietoa jo ennen ostopäätöstä, ei vasta asennusvaiheessa, koska väärän kortin ostaminen tarkoittaa joko epävirallista kiertotietä tai heikompaa suorituskykyä. Alla on tiivistelmä Linux-tukimatriisista versiolle 7.2.1, joka kattaa sekä RDNA 3- että RDNA 4 -sukupolven kortit.

MalliArkkitehtuuriLLVM-kohdeVRAM (tyypillinen)
RX 9070 XT / 9070 GRE / 9070RDNA 4gfx120116 Gt
RX 9060 XT / 9060 XT LP / 9060RDNA 4gfx120016 Gt (myös 8 Gt -versio saatavilla)
RX 7900 XTXRDNA 3gfx110024 Gt
RX 7900 XT / 7900 GRERDNA 3gfx1100 / gfx110120 Gt / 16 Gt
RX 7800 XT / 7700 / 7700 XTRDNA 3gfx110116 Gt / 12 Gt

Jos kortti puuttuu listalta, se ei suoraan tarkoita, ettei se toimisi. Yhteisön ylläpitämät ohjeet ja HSA_OVERRIDE_GFX_VERSION-muuttuja mahdollistavat monen osittain tuetun kortin käytön, kunhan se on riittävän lähellä jotain virallisesti tuettua arkkitehtuuria.

RDNA 4 -sukupolven kortit (RX 9000 -sarja) ja RDNA 3 -sukupolven kortit (RX 7000 -sarja) eroavat toisistaan erityisesti tekoälykiihdytykseen tarkoitettujen laskentayksiköiden osalta, mutta ROCm-tuen kannalta molemmat ovat käytännössä yhtä kypsiä vuonna 2026. Uudemmalla RDNA 4:llä on hieman parempi tehokkuus wattia kohden, mikä näkyy erityisesti pitkissä latausjaksoissa alhaisempana lämpötilana ja hiljaisempana tuulettimien käyntinä. Jos päivität vanhemmasta RX 6000 -sarjan (RDNA 2) kortista, huomaa että se ei ole virallisessa tukilistassa lainkaan, jolloin HSA_OVERRIDE_GFX_VERSION-ohitus on käytännössä pakollinen eikä vain valinnainen optimointi.

LM Studio, Ollama vai llama.cpp suoraan?

Jos olet ajanut kielimalleja aiemmin Nvidia-kortilla, olet ehkä käyttänyt Ollamaa, joka on suosittu erityisesti komentoriviltä. Olemme käsitelleet Ollaman asennusta RTX-korteille aiemmassa Ollama-oppaassamme, ja moni kysyy, kannattaisiko sama työkalu valita myös AMD-puolella. Ollama tukee ROCm:ää periaatteessa, mutta AMD-tuki on ollut historiallisesti kokeellisempaa ja vaatii enemmän käsin säätämistä kuin Nvidia-puoli.

LM Studio eroaa Ollamasta siinä, että se tarjoaa graafisen käyttöliittymän mallien selaamiseen, lataamiseen ja keskusteluun, minkä lisäksi se tekee runtime-valinnan (Vulkan vai ROCm) näkyväksi ja helpoksi vaihtaa asetuksista käsin. Tämä on erityisen kätevää juuri AMD-korteilla, koska pystyt kokeilemaan kumpi taustajärjestelmä toimii paremmin omalla laitteistollasi ilman komentorivin ympäristömuuttujien säätämistä joka kerta. Jos taas rakennat automatisoitua palvelinta ilman käyttöliittymää, pelkkä llama.cpp käännettynä ROCm-tuella on kevyempi vaihtoehto, mutta sen pystyttäminen vaatii huomattavasti enemmän käsityötä kuin LM Studion valmis paketti.

Käytännön suositus on yksinkertainen: jos haluat kokeilla ja käyttää mallia päivittäin ilman jatkuvaa komentorivin säätämistä, LM Studio on tällä hetkellä sujuvin reitti AMD-korteille. Jos rakennat tuotantopalvelinta, joka pyörii ilman valvontaa, kannattaa myöhemmin siirtyä llama.cpp:hen tai vLLM:ään ROCm-tuella, mutta silloinkin LM Studiolla tehty testiasennus toimii hyvänä tapana vahvistaa, että ROCm-pino ylipäätään toimii koneessasi.

Näiden kolmen työkalun välillä ei kannata ajatella lopullista valintaa, koska ne kaikki nojaavat pohjimmiltaan samaan llama.cpp-moottoriin ja samaan ROCm-kiihdytykseen. Voit hyvin asentaa kaikki kolme rinnakkain samalle koneelle ja käyttää LM Studiota päivittäiseen keskusteluun, Ollamaa nopeisiin komentorivitesteihin ja raakaa llama.cpp:tä silloin, kun tarvitset tarkkaa hallintaa jokaiseen käynnistysparametriin. Kukaan ei estä vaihtamasta työkalua kesken projektin, kun tarpeet muuttuvat.

Mitä kielimallia kannattaa kokeilla ensin

LM Studion sisäänrakennettu mallikirjasto tarjoaa satoja GGUF-muotoisia malleja, ja aloittelijalle valikoima voi tuntua ylivoimaiselta. Käytännössä kannattaa aloittaa tunnetusta, hyvin dokumentoidusta perheestä ja edetä sieltä isompiin tai erikoistuneempiin malleihin sitä mukaa kun VRAM ja käyttötarve sen sallivat.

  • 7-9 miljardin parametrin mallit (esim. Qwen2.5 7B, Llama 3.1 8B, Mistral 7B): sopivat 8-12 gigatavun kortteihin Q4_K_M-kvantisoinnilla, hyvä lähtökohta yleiskäyttöön
  • 12-14 miljardin parametrin mallit: vaativat käytännössä 16 gigatavua VRAM:ia, sopivat RX 9060 XT:lle ja RX 7800 XT:lle
  • 20-30 miljardin parametrin mallit: vaativat 20-24 gigatavua VRAM:ia, sopivat RX 7900 XT/XTX-tason korteille
  • Erikoistuneet koodausmallit (esim. Qwen2.5-Coder): kannattavat, jos käytät kielimallia pääosin ohjelmointiin, koska ne ovat usein tarkempia samalla parametrimäärällä kuin yleismallit

Kvantisointitaso vaikuttaa suoraan sekä muistin tarpeeseen että vastausten laatuun. Q4_K_M on hyvä tasapaino useimmille käyttäjille, kun taas Q8_0 säilyttää enemmän tarkkuutta mutta vaatii lähes kaksinkertaisen VRAM-määrän samaan malliin verrattuna.

Kontekstin pituus on toinen muuttuja, joka kannattaa ymmärtää ennen ensimmäistä latausta. Pidempi konteksti tarkoittaa, että malli muistaa enemmän aiemmasta keskustelusta tai pystyy käsittelemään pidempiä dokumentteja kerralla, mutta se vie myös enemmän VRAM:ia mallin koon päälle. Jos huomaat, että malli mahtuu juuri ja juuri muistiin lyhyellä kontekstilla mutta kaatuu pidemmällä, ensimmäinen korjausliike on lyhentää kontekstia ennen kuin vaihdat pienempään malliin kokonaan.

Vaihe 1-3: käyttöjärjestelmän ja ajurin valmistelu

Ensimmäiset kolme vaihetta eivät vielä koske itse ROCm:ää, vaan pohjustavat järjestelmän niin, että varsinainen asennus menee läpi ilman yllätyksiä. Tämä osuus kannattaa tehdä huolella, koska suurin osa myöhemmistä ongelmista juontuu juuri puutteellisesta pohjatyöstä.

Vaihe 1: Tarkista näytönohjain ja ydinversio

Aloita varmistamalla, että käytössäsi on tuettu Ubuntu-versio ja että järjestelmä tunnistaa näytönohjaimen oikein. Tämä vaihe säästää myöhemmin turhaa vianetsintää, koska suuri osa ROCm-ongelmista juontaa juurensa siihen, että asennus aloitetaan väärällä käyttöjärjestelmäversiolla.

lsb_release -a
uname -r
lspci | grep -i amd

Vaihe 2: Asenna kernel-headerit ja esivaatimukset

ROCm tarvitsee kernel-headerit ja muutaman peruspaketin voidakseen rakentaa ja ladata omat ajurimoduulinsa. Ilman oikeita headereita amdgpu-moduulin kääntäminen epäonnistuu myöhemmässä vaiheessa, ja virheilmoitus on usein harhaanjohtava, joten tämä kannattaa hoitaa kuntoon heti alussa eikä jättää viimeiseksi.

sudo apt update
sudo apt install -y "linux-headers-$(uname -r)" wget gnupg2 software-properties-common

Vaihe 3: Lisää AMD:n asennustyökalu

AMD toimittaa erillisen amdgpu-install-työkalun, joka hoitaa pakettivarastojen lisäämisen puolestasi eikä vaadi käsin kopioitavia GPG-avaimia tai apt-lähdetiedostoja. Lataa se AMD:n virallisilta sivuilta oman Ubuntu-versiosi mukaan ja asenna se dpkg:llä ennen seuraavaa vaihetta. Tämä on huomattavasti luotettavampi tapa kuin vanhat käsin kirjoitetut ohjeet, joita löytyy yhä monista vanhentuneista foorumiketjuista.

wget https://repo.radeon.com/amdgpu-install/amdgpu-install-latest.deb
sudo apt install -y ./amdgpu-install-latest.deb
sudo apt update

Vaihe 4-6: ROCm-pinon asennus ja käyttöoikeudet

Tässä vaiheessa asennetaan varsinainen ROCm-ohjelmistopino ja varmistetaan, että käyttöjärjestelmä antaa sille luvan käyttää näytönohjainta. Kolmesta vaiheesta viides on käytännössä se, joka eniten erottaa onnistuneen ja epäonnistuneen asennuksen toisistaan, joten älä hyppää sen yli vaikka se vaikuttaisi triviaalilta.

Vaihe 4: Asenna ROCm avoimilla kernel-moduuleilla

Debian- ja Ubuntu-järjestelmille AMD:n dokumentaatio suosittelee avointa kernel-moduulia, joka asentuu yhdellä komennolla. Tämä on nykyisin suositeltu tapa verrattuna vanhempaan suljettuun ajuriin, koska avoin moduuli päivittyy paremmin uusien kernel-versioiden mukana eikä vaadi erillistä DKMS-uudelleenkäännöstä jokaisen kernel-päivityksen jälkeen.

sudo amdgpu-install --usecase=rocm,graphics --no-dkms
sudo apt install -y rocm-hip-sdk rocminfo rocm-smi

Jos haluat lukita asennuksen tiettyyn ROCm-haaraan tuotantokäytössä, käytä branch-kohtaista pakettinimeä, esimerkiksi rocm-hip-sdk7.2.1 yleisen rocm-hip-sdk-nimen sijaan. Tämä estää automaattiset päivitykset rikkomasta toimivaa asennusta.

Vaihe 5: Lisää käyttäjä render- ja video-ryhmiin

Tämä on vaihe, jonka moni unohtaa ja joka aiheuttaa myöhemmin “GPU:ta ei löydy” -virheitä, vaikka itse ROCm-paketit olisivat asentuneet täysin oikein. Ilman oikeita ryhmäjäsenyyksiä käyttäjätunnuksellasi ei ole lupaa käyttää ROCm:n laskentalaitteita, koska Linuxin käyttöoikeusjärjestelmä estää pääsyn oletuksena.

sudo usermod -aG render,video $USER
sudo reboot

Vaihe 6: Vahvista asennus

Uudelleenkäynnistyksen jälkeen tarkista, että ROCm todella näkee näytönohjaimesi. Kaksi komentoa riittää.

rocminfo | grep -A 3 "Agent 2"
rocm-smi --showproductname

Onnistuneessa asennuksessa rocminfo listaa näytönohjaimesi omana laskenta-agenttinaan (yleensä “Agent 2”, koska “Agent 1” on suoritin), ja rocm-smi tulostaa kortin tuotenimen ja lämpötilan. Jos komennot palauttavat tyhjän tai virheen, palaa vaiheeseen 5 ennen jatkamista.

Vaihe 7-9: LM Studion asennus ja ROCm-runtimen valinta

Nyt kun järjestelmätaso on kunnossa ja rocminfo tunnistaa näytönohjaimesi, on aika asentaa itse sovellus, jolla malleja oikeasti käytetään. Tämä osuus on selvästi nopeampi kuin edelliset, koska LM Studio hoitaa suuren osan yksityiskohdista puolestasi graafisen käyttöliittymän kautta.

Vaihe 7: Lataa ja asenna LM Studio

Lataa LM Studion Linux-versio (AppImage) sovelluksen omalta lataussivulta ja tee siitä suoritettava.

chmod +x LM-Studio-0.4.23.AppImage
./LM-Studio-0.4.23.AppImage

Vaihe 8: Valitse ROCm-runtime asetuksista

Avaa LM Studiossa asetukset ja siirry runtime-välilehdelle. Sieltä löytyvät sekä Vulkan- että AMD ROCm -vaihtoehdot AMD-käyttäjille. Valitse ROCm ja anna sovelluksen ladata tarvittavat lisäosat. Jos ROCm-vaihtoehtoa ei näy listassa lainkaan, syy on lähes aina vaiheessa 4-6 tapahtunut virhe, ei itse LM Studiossa.

Vaihe 9: Aseta HSA_OVERRIDE_GFX_VERSION osittain tuetuille korteille

Jos näytönohjaimesi ei ole virallisesti tuettujen korttien listalla mutta kuuluu samaan arkkitehtuuriperheeseen, voit pakottaa ROCm:n käyttämään lähimmän tuetun kortin ajonaikaista profiilia.

# RDNA 3 -kortit (esim. RX 7600, RX 7700 nonXT)
export HSA_OVERRIDE_GFX_VERSION=11.0.0

# RDNA 2 -kortit (esim. RX 6800 XT, RX 6900 XT)
export HSA_OVERRIDE_GFX_VERSION=10.3.0

Aseta muuttuja ennen LM Studion käynnistämistä, tai lisää se pysyvästi ~/.bashrc-tiedostoon, jos käytät samaa korttia jatkuvasti. Tämä on epävirallinen kiertotie, joten kaikki mallit eivät välttämättä toimi täydellä nopeudella, mutta se riittää useimmille 7B-13B-parametrin kielimalleille.

Vaihe 10-12: mallin lataus, palvelin ja optimointi

Viimeiset kolme vaihetta ovat siinä mielessä palkitsevimpia, että pääset vihdoin näkemään koko putken toimivan päästä päähän. Tässä vaiheessa ladataan ensimmäinen kielimalli, käynnistetään paikallinen palvelin ja hienosäädetään asetukset niin, että ROCm-kiihdytyksestä saadaan täysi hyöty irti.

Vaihe 10: Lataa ensimmäinen malli

LM Studion sisäänrakennettu Hugging Face -selain näyttää suoraan, mitkä mallit sopivat käytettävissä olevaan VRAM-määrään. Aloittelijalle sopii hyvin GGUF-muotoinen 7-9 miljardin parametrin malli Q4_K_M-kvantisoinnilla, koska se mahtuu mukavasti 12-16 gigatavun kortteihin ja jättää tilaa kontekstille.

Vaihe 11: Käynnistä paikallinen palvelin ja testaa API

LM Studio tarjoaa OpenAI-yhteensopivan rajapinnan, joka käynnistyy oletuksena osoitteeseen http://localhost:1234/v1. Voit käynnistää sen graafisesti Local Server -välilehdeltä tai komentorivin lms-työkalulla.

lms server start
lms ls
lms load qwen2.5-7b-instruct

curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen2.5-7b-instruct",
    "messages": [{"role": "user", "content": "Kerro yksi fakta Suomesta"}]
  }'

Onnistunut pyyntö palauttaa JSON-vastauksen, jossa on tavallinen OpenAI-tyylinen choices-taulukko ja mallin generoima teksti. Jos yhteys katkeaa heti, tarkista että palvelin on todella käynnissä komennolla lms ls ja että portti 1234 ei ole varattu jollekin toiselle sovellukselle. Rajapinnan yhteensopivuus OpenAI:n omien kirjastojen kanssa tarkoittaa käytännössä, että voit käyttää mitä tahansa olemassa olevaa Python- tai JavaScript-koodia, joka on kirjoitettu alun perin OpenAI:n pilvipalvelua varten, muuttamalla vain osoitteen paikalliseksi.

Vaihe 12: Optimoi GPU-kerrokset ja kontekstin pituus

Mallin latausikkunassa on liukusäädin GPU-kerrosten määrälle. Jos säädin on nollassa, malli laskee kaiken suorittimella, mikä selittää hitaan generointinopeuden vaikka ROCm olisi asennettu oikein. Nosta arvo maksimiin ja laske kontekstin pituutta, jos VRAM loppuu kesken. 4096 tokenin konteksti on hyvä lähtökohta useimmille kotikäyttäjille.

Windows-pikapolku: LM Studio ja Vulkan ilman ROCm-asennusta

Jos et halua koskea Linuxiin tai WSL2:een lainkaan, Windows-reitti on huomattavasti lyhyempi. Asenna vain LM Studion Windows-asennuspaketti sovelluksen latausivulta, avaa asetuksista runtime-valikko ja valitse Vulkan. Näytönohjaimesi tavallinen Adrenalin-ajuri riittää, erillistä ROCm-pakettia ei tarvita. Koko prosessi vie käytännössä alle kymmenen minuuttia siitä hetkestä, kun asennuspaketti on ladattu, verrattuna Linux-reitin kahteentoista vaiheeseen.

Tämä reitti on selvästi nopeampi ottaa käyttöön, mutta se ei anna pääsyä ROCm:n laajempaan työkalupinoon, kuten PyTorchiin tai ONNX Runtimeen. Jos aiot pelkästään keskustella kielimallin kanssa LM Studion käyttöliittymässä, Vulkan riittää mainiosti. Jos aiot myöhemmin kokeilla myös muita tekoälytyökaluja samalla kortilla, Linux ja ROCm kannattavat pitkällä tähtäimellä enemmän.

WSL2-käyttäjille kannattaa mainita, että ROCm:n tuki Windowsin Linux-alijärjestelmässä on edelleen jäljessä natiivista Linux-asennuksesta. Yhteisöraportit ovat toistuvasti huomauttaneet, että uusien korttien tuki saapuu ensin natiiviin Linuxiin ja vasta myöhemmin WSL2:een, joten älä yllättyneenä jos tuore RX 9000 -sarjan kortti ei toimi WSL2:ssa heti julkaisun jälkeen.

Käytännössä kolme reittiä muodostavat selkeän valintapuun: valitse Windows ja Vulkan, jos haluat nopeimman käyttöönoton etkä tarvitse ROCm:n laajempaa työkalutukea. Valitse Linux ja ROCm, jos aiot myöhemmin kokeilla myös muita koneoppimistyökaluja tai haluat parhaan mahdollisen suorituskyvyn raskaissa malleissa. Valitse WSL2 vain, jos et voi asentaa natiivia Linuxia mutta ymmärrät, että tuki voi olla puutteellisempaa uusimmilla korteilla.

Näytönohjaimen hinta ja kannattavuus Suomessa

Heinäkuun 2026 hintaseuranta antaa hyvän kuvan siitä, missä kohtaa hintakäyrää eri mallit tällä hetkellä ovat. Hinnat vaihtelevat jälleenmyyjän ja saatavuuden mukaan, mutta suunta on tässä olennaisempi kuin yksittäinen euromäärä.

MalliHinta 07/2026KeskihintaHistoriallinen minimi
Gigabyte RX 9070 XT Gaming OC655 €726 €635 €
Gigabyte RX 9060 XT WINDFORCE447 €484 €382 €
ASUS DUAL RX 9060 XT444 €478 €389 €
AMD:n ohjehinta, RX 9070 XT~649 € (599 $)
AMD:n ohjehinta, RX 9060 XT 16 Gt~374 € (349 $)

RX 9060 XT on tällä hetkellä hintansa puolesta houkuttelevin sisääntulokortti paikalliseen tekoälyyn, koska 16 gigatavua VRAM:ia alle 450 eurolla on harvinaista Nvidia-puolella samassa hintaluokassa. RX 9070 XT sopii, jos haluat ajaa isompia 13-14 miljardin parametrin malleja tai useampaa mallia samanaikaisesti. Olemme vertailleet RX 9070 XT:n pelisuorituskykyä tarkemmin RTX 5070 -vertailuartikkelissamme, jos haluat tietää myös pelipuolen suorituskykyeron ennen ostopäätöstä, sillä sama kortti palvelee tietysti molempia käyttötarkoituksia.

Kannattaa myös muistaa, että näytönohjainten hinnat ovat olleet nousussa laajemman muistipulan vuoksi, mikä on nostanut sekä AMD:n että Nvidian korttien hintoja vuoden 2026 aikana. Jos budjetti on tiukka, RX 9060 XT:n 8 gigatavun versio on halvempi vaihtoehto, mutta se rajoittaa käytännössä 7-9 miljardin parametrin malleihin Q4-kvantisoinnilla.

Taulukon historiallinen minimi kertoo, kuinka halvalla kortin on aiemmin saanut, mikä auttaa arvioimaan onko nykyinen hinta hyvä vai kannattaako odottaa. Kun nykyhinta on lähellä historiallista minimiä, kuten RX 9070 XT:n tapauksessa heinäkuussa 2026, ostohetki on suhteellisen edullinen verrattuna siihen, että hinta olisi lähellä keskiarvoa tai sen yläpuolella. Hinnat elävät jatkuvasti muistipulan ja kysynnän mukaan, joten kannattaa tarkistaa ajankohtainen hinta ennen ostopäätöstä sen sijaan, että luottaa pelkästään tässä oppaassa mainittuihin lukuihin.

Sähkön hinta kannattaa ottaa huomioon osana kokonaislaskelmaa. Suomessa pörssisähkösopimus on yleinen valinta, ja hinta vaihtelee tunneittain kysynnän mukaan. Näytönohjain kuluttaa täydellä kuormalla tyypillisesti 200-300 wattia mallista riippuen, joten pitkät mallien lataukset tai eräajot kannattaa ajoittaa halvempiin yötunteihin, jos sopimuksesi seuraa spot-hintaa. Tämä ei muuta kokonaiskustannusta dramaattisesti yksittäisellä keskusteluistunnolla, mutta se kertyy, jos käytät konetta jatkuvasti taustapalvelimena.

Yleisimmät sudenkuopat ROCm-asennuksessa

Suurin osa ROCm-asennusten ongelmista ei johdu itse ohjelmistosta, vaan asennusjärjestyksestä tai unohdetusta yksittäisestä komennosta. Seuraava lista kokoaa virheet, joita näkee toistuvasti yhteisöfoorumeilla ja tukipyynnöissä, jotta voit välttää ne etukäteen sen sijaan että selvität ne jälkikäteen.

  • Ajurin ja ROCm:n väärä asennusjärjestys. Jos asennat ensin vanhan suljetun ajurin ja yrität sitten päälle avointa ROCm-pakettia, järjestelmään jää ristiriitaisia moduuleja. Poista vanha ajuri kokonaan ennen ROCm:n asennusta.
  • Käyttäjä ei kuulu render- ja video-ryhmiin. Tämä on yleisin yksittäinen syy siihen, että “asennus onnistui mutta mikään ei toimi”.
  • ROCm-versio ei täsmää ajuriversion kanssa. ROCm 6.x tarvitsee vastaavan amdgpu-dkms 6.x -ajurin. Sekoittaminen aiheuttaa arvaamattomia kaatumisia.
  • WSL2:n oletetaan toimivan kuin natiivi Linux. Moni yrittää turhaan väkisin, vaikka uusimpien korttien WSL2-tuki tulee viiveellä natiivin Linuxin jälkeen.
  • Vulkan- ja ROCm-runtimet sekoitetaan keskenään. Jos LM Studio näyttää olevan hidas, tarkista ensin kumpi runtime on todella valittuna asetuksista.
  • Malli valitaan liian suureksi VRAM:iin nähden. Jos GGUF-tiedosto on lähes yhtä suuri kuin VRAM, käyttöjärjestelmä ja muut sovellukset eivät enää mahdu mukaan, ja lataus epäonnistuu.
  • HSA_OVERRIDE_GFX_VERSION unohdetaan osittain tuetuilla korteilla. Ilman sitä ROCm ei välttämättä käynnisty lainkaan vanhemmalla tai ei-listatulla kortilla.

Yhteinen nimittäjä useimmille näistä sudenkuopista on kiire: asennus etenee liian nopeasti ilman että välivaiheiden onnistumista varmistetaan. Jokainen tämän oppaan vaihe sisältää tarkoituksella oman tarkistuskomennon juuri siksi, että virheet löytyvät heti eivätkä vasta kaksi vaihetta myöhemmin, jolloin niiden juurisyyn selvittäminen on huomattavasti työläämpää.

Vianetsintä: yleisimmät virheet ja korjaukset

Alla oleva taulukko kokoaa yhdeksän virhettä, joita ROCm- ja LM Studio -käyttäjät kohtaavat useimmin, sekä niiden käytännön korjaukset. Kannattaa käydä taulukko läpi järjestyksessä ylhäältä alas, koska useimmat myöhemmät ongelmat ratkeavat, kun ensimmäinen rivi (GPU:n tunnistus) on kunnossa. Jos olet aiemmin ajanut GPU-benchmarkkeja samalla koneella, voit hyödyntää samoja työkaluja tarkistaaksesi, näkyykö näytönohjain järjestelmässä ylipäätään oikein ennen kuin syytät ROCm-asennusta.

OngelmaTodennäköinen syyKorjaus
rocminfo ei näytä GPU:ta lainkaanAjuri tai ROCm-paketit eivät asentuneet oikeinAja sudo amdgpu-install --usecase=rocm,graphics uudelleen ja käynnistä kone
LM Studio ei tarjoa ROCm-runtimea valittavaksiROCm-pino puuttuu tai on rikki taustallaVahvista rocminfo-tulos ensin, asenna LM Studio uudelleen tämän jälkeen
“Out of memory” mallia ladattaessaMalli tai konteksti on liian suuri VRAM:iin nähdenVaihda pienempään kvantisointiin (esim. Q4_K_M) tai lyhennä kontekstia
Palvelin ei vastaa osoitteessa localhost:1234Palvelinta ei ole käynnistetty tai portti on varattuTarkista lms ls ja vapauta portti komennolla sudo lsof -i :1234
Generointi on hidasta GPU:sta huolimattaGPU-kerrokset asetettu nollaan, malli laskee CPU:llaNosta GPU-kerrosten liukusäädin maksimiin latausikkunassa
amdgpu-install epäonnistuu riippuvuusvirheeseenRistiriitaiset tai vanhentuneet pakettivarastotAja sudo apt update && sudo apt --fix-broken install ennen uutta yritystä
Kortti tunnistetaan mutta ROCm kaatuu käynnistyksessäOsittain tuettu arkkitehtuuri ilman ohitustaAseta HSA_OVERRIDE_GFX_VERSION lähimmän tuetun arkkitehtuurin mukaan
PyTorch ei löydä ROCm-laitetta ROCm-asennuksen jälkeenYmpäristömuuttujat eivät ole aktiivisia nykyisessä istunnossaAvaa uusi terminaali-istunto uudelleenkäynnistyksen jälkeen ja testaa uudelleen
Windows-versio kaatuu isolla kontekstillaVulkan-runtime tavoittaa VRAM-rajanPienennä kontekstin pituutta tai vaihda pienempään malliin

Jos mikään yllä olevista ei ratkaise ongelmaasi, seuraava askel on tarkistaa ROCm:n omat GitHub-issuet ja keskustelupalstat, koska uusien korttien yhteensopivuusongelmat ratkeavat usein yhteisön toimesta ennen kuin ne päätyvät viralliseen dokumentaatioon. Kannattaa myös liittää mukaan täsmälliset versiotiedot (ROCm-versio, ajuriversio, LM Studio -versio ja tarkka näytönohjainmalli), kun kysyt apua, koska suurin osa turhista edestakaisin käydyistä keskusteluista syntyy juuri puuttuvista versiotiedoista.

Todellinen suorituskykyesimerkki

Tarkkoja, virallisia tokens-per-second-lukuja LM Studion ja ROCm:n yhdistelmälle on vielä vähän saatavilla, koska tulos riippuu voimakkaasti mallista, kvantisoinnista ja kontekstin pituudesta. Yksi julkinen, dokumentoitu esimerkki löytyy GitHub-käyttäjä aldrinaranin julkaisemasta oppaasta, jossa RX 7800 XT -kortilla mitattiin selvä ero CPU- ja GPU-ajon välillä.

AjotapaNäytönohjainNopeus
Vain CPU~8 tokenia/s
ROCm-runtimeRX 7800 XT~68 tokenia/s

Ero on karkeasti kahdeksankertainen, mikä havainnollistaa hyvin, miksi GPU-kerrosten asettaminen oikein (vaihe 12) on koko oppaan tärkein yksittäinen optimointi. Omat tuloksesi vaihtelevat mallin koon ja kortin mukaan, mutta samaa suuruusluokkaa kannattaa odottaa vastaavalla laitteistolla. Isommalla kortilla, kuten RX 9070 XT tai RX 7900 XTX, ero CPU:hun on tyypillisesti vielä suurempi, koska näissä korteissa on enemmän laskentayksiköitä ja nopeampi muistikaista, joka on juuri kielimallin inferenssissä pullonkaula. Muistikaistan merkitys korostuu erityisesti silloin, kun malli täyttää lähes koko VRAM:in, jolloin jokainen generoitu tokeni vaatii datan siirtämistä muistin ja laskentayksiköiden välillä mahdollisimman nopeasti.

Kannattaa suhtautua kaikkiin yksittäisiin tokens-per-second-lukuihin varauksella, koska ne riippuvat mallista, kvantisoinnista, kontekstin pituudesta, käytetystä kehotteesta ja jopa käyttöjärjestelmän taustaprosesseista. Paras tapa arvioida oman koneesi suorituskykyä on mitata se itse samalla mallilla ja samalla kehotteella ennen ja jälkeen ROCm-runtimen käyttöönoton, jolloin näet suoraan oman laitteistosi todellisen hyödyn ilman, että vertailet erilaisia testiolosuhteita keskenään.

Tietoturva ja yksityisyys: miksi paikallinen ajo kannattaa

Tämä on shattered.io:lle luonteva näkökulma, jota moni pelkkään suorituskykyyn keskittyvä opas ei mainitse lainkaan. Kun ajat kielimallia LM Studiolla ROCm:n kautta, kaikki keskustelun sisältö, ladatut dokumentit ja mahdolliset liitetiedostot pysyvät fyysisesti koneellasi. Mitään ei lähetetä ulkopuoliselle palvelimelle käsiteltäväksi, eikä palveluntarjoaja pysty näkemään kehotteitasi, tallentamaan niitä mallin jatkokoulutukseen tai luovuttamaan niitä kolmannelle osapuolelle.

Tämä on merkittävä ero verrattuna pilvipohjaisiin tekoälypalveluihin, joiden käyttöehdot ja tietosuojakäytännöt vaihtelevat palveluntarjoajittain ja muuttuvat ajoittain ilman suurta huomiota. Yrityskäytössä paikallinen ajo voi helpottaa myös GDPR-arviointia, koska henkilötietoja tai liikesalaisuuksia sisältävää dataa ei tarvitse siirtää EU:n ulkopuolelle tai kolmannen osapuolen infrastruktuuriin lainkaan. Tämä ei tarkoita, että paikallinen malli olisi automaattisesti turvallisempi kaikissa mielessä, sillä itse konetta pitää silti suojata tavallisilla keinoilla, mutta tiedonsiirtoon liittyvä riski poistuu käytännössä kokonaan.

Käytännön vinkki: jos avaat LM Studion paikallisen API-palvelimen myös muille laitteille kotiverkossasi, rajaa pääsy palomuurisäännöillä vain omaan lähiverkkoosi äläkä koskaan avaa porttia 1234 suoraan internetiin ilman autentikointikerrosta. Oletusasennus ei sisällä käyttäjätunnistusta, koska se on suunniteltu yhden käyttäjän paikalliseen käyttöön, ei julkiseksi palvelimeksi.

Sama periaate pätee, vaikka käyttäisit konetta vain itse: pidä käyttöjärjestelmä ja ROCm-paketit ajan tasalla tietoturvapäivitysten osalta, vaikka itse tekoälypino ei olisikaan jatkuvassa käytössä. Paikallinen kone, jolla on suora pääsy näytönohjaimen laskentaresursseihin, on siinä mielessä houkutteleva kohde, että sen kaappaaminen antaisi hyökkääjälle pääsyn myös laskentatehoon, ei pelkästään tietoihin.

Täydellinen esimerkkiprojekti: oma komentorivichattibotti

Kun palvelin toimii, sen päälle on helppo rakentaa oma pieni työkalu. Seuraava Python-skripti muodostaa yksinkertaisen komentorivichatin, joka keskustelee paikallisesti ajettavan mallin kanssa LM Studion OpenAI-yhteensopivan rajapinnan kautta. Tallenna se esimerkiksi nimellä chat.py.

import json
import urllib.request

API_URL = "http://localhost:1234/v1/chat/completions"
MODEL = "qwen2.5-7b-instruct"

def ask(messages):
    payload = json.dumps({
        "model": MODEL,
        "messages": messages,
        "temperature": 0.7
    }).encode("utf-8")

    req = urllib.request.Request(
        API_URL,
        data=payload,
        headers={"Content-Type": "application/json"}
    )
    with urllib.request.urlopen(req) as response:
        data = json.loads(response.read())
        return data["choices"][0]["message"]["content"]

def main():
    history = [{"role": "system", "content": "Vastaa aina suomeksi, lyhyesti ja ytimekkäästi."}]
    print("Paikallinen chattibotti kaynnissa. Kirjoita 'lopeta' poistuaksesi.")
    while True:
        user_input = input("Sina: ")
        if user_input.strip().lower() == "lopeta":
            break
        history.append({"role": "user", "content": user_input})
        reply = ask(history)
        history.append({"role": "assistant", "content": reply})
        print(f"Malli: {reply}")

if __name__ == "__main__":
    main()

Käynnistä skripti komennolla python3 chat.py, kun LM Studion palvelin on käynnissä ja malli ladattuna. Koska kaikki liikenne kulkee koneesi sisällä, mikään keskustelun sisältö ei poistu laitteestasi. Tämä on sama periaate, jolla voit rakentaa laajempia työkaluja, kuten paikallisia dokumenttihakuja tai automaatioskriptejä, ilman että data kulkee ulkopuolisen palvelun kautta.

Tästä pohjasta on helppo jatkaa moneen suuntaan. Voit lisätä skriptiin tiedostojen lukemisen ja liittää niiden sisällön kehotteeseen, jolloin sinulla on yksinkertainen tapa kysyä kysymyksiä omista dokumenteistasi ilman, että ne koskaan poistuvat koneeltasi. Yhtä lailla voit korvata input()-kutsun web-palvelimella, jolloin samaa mallia voi käyttää selaimen kautta muualta kotiverkostasi, kunhan muistat rajata pääsyn palomuurilla edellisessä osiossa mainitulla tavalla.

Edistyneet vinkit tehokkaampaan käyttöön

Kun perusasennus toimii ja olet ajanut ensimmäiset mallit onnistuneesti, seuraavat vinkit auttavat puristamaan laitteistosta enemmän irti. Osa näistä koskee myös suorittimen puolta: jos olet aiemmin virittänyt Ryzen-suorittimesi HWiNFO-oppaamme mukaisesti, samat periaatteet lämpötilojen ja tehonkulutuksen seurannasta pätevät myös näytönohjaimen puolella.

  • Aja LM Studion palvelin taustapalveluna systemd-yksikön kautta, jos haluat sen käynnistyvän automaattisesti koneen käynnistyessä.
  • Seuraa lämpötilaa ja tehonkulutusta pitkissä ajoissa komennolla rocm-smi --showtemp --showpower, erityisesti jos kotelon ilmanvaihto on tiukka.
  • Kokeile eri kvantisointitasoja samalle mallille: Q4_K_M säästää VRAM:ia, Q8_0 antaa tarkempia vastauksia mutta vaatii enemmän muistia.
  • Jos ajat useita malleja rinnakkain eri projekteihin, käytä lms-komentoriviä skriptien automatisointiin sen sijaan, että vaihdat malleja käsin graafisesta käyttöliittymästä.
  • Lukitse ROCm-versio tuotantokäytössä branch-kohtaisella pakettinimellä, jotta automaattinen järjestelmäpäivitys ei riko toimivaa asennusta yllättäen.
  • Pidä erillinen muistiinpano siitä, mikä ROCm-versio, ajuriversio ja LM Studio -versio olivat käytössä silloin kun asennus viimeksi toimi, jotta pystyt palaamaan tunnettuun toimivaan tilaan nopeasti, jos jokin päivitys rikkoo jotain.

Nämä vinkit eivät ole pakollisia perusasennuksen kannalta, mutta ne säästävät huomattavasti aikaa pitkällä aikavälillä, erityisesti jos päivität järjestelmääsi säännöllisesti tai kokeilet useita eri malleja ja kvantisointitasoja rinnakkain. Pieni ylimääräinen kirjanpitotyö asennuksen alkuvaiheessa maksaa itsensä takaisin heti ensimmäisen kerran, kun jokin päivitys menee pieleen ja sinun täytyy palauttaa järjestelmä tunnettuun toimivaan tilaan nopeasti.

Usein kysytyt kysymykset

Toimiiko LM Studio Windowsissa AMD-näytönohjaimella ilman ROCm-asennusta?
Kyllä. Windows-versio käyttää AMD-korteille ensisijaisesti Vulkan- ja DirectML-taustajärjestelmiä, jotka toimivat tavallisella Adrenalin-ajurilla ilman erillistä ROCm-pakettia. Tämä tekee Windows-reitistä huomattavasti nopeamman ottaa käyttöön kuin tässä oppaassa kuvattu Linux-polku, joskin ROCm:n laajempi työkalutuki jää tällä reitillä käyttämättä.

Mikä AMD Radeon -malli sopii parhaiten paikalliseen tekoälyyn?
Hinta-VRAM-suhteen puolesta RX 9060 XT 16 Gt on tällä hetkellä vahva sisääntulokortti, kun taas RX 9070 XT tai RX 7900 XTX sopivat isompiin malleihin ja useamman sovelluksen samanaikaiseen ajoon. Jos budjetti sallii, kannattaa aina valita enemmän VRAM:ia tarjoava malli saman sukupolven sisällä, koska VRAM on useammin pullonkaula kuin itse laskentateho kotikäytössä.

Paljonko VRAM:ia tarvitsen 7-9 miljardin parametrin malliin?
Q4_K_M-kvantisoinnilla 8 gigatavua riittää useimmiten juuri ja juuri, mutta 12-16 gigatavua antaa tilaa pidemmälle kontekstille ilman kompromisseja.

Toimiiko ROCm WSL2:ssa Windows 11:ssä?
Osittain. Uusimpien korttien, kuten RX 9000 -sarjan, tuki on ensin saapunut natiiviin Linuxiin, ja WSL2-tuki on seurannut viiveellä. Jos WSL2 on sinulle tärkeä, tarkista ajankohtainen tilanne ennen ostopäätöstä äläkä oleta, että natiivin Linuxin tukilista pätisi suoraan myös WSL2-ympäristössä.

Onko ROCm ilmainen käyttää?
Kyllä, ROCm on avoimen lähdekoodin ohjelmisto eikä sen käyttö kotikäytössä maksa mitään. Ainoa kustannus on näytönohjain itse ja sähkö, jolla sitä ajetaan. Myöskään LM Studio ei veloita henkilökohtaisesta käytöstä, joten koko putki on käytännössä ilmainen laitteiston hankinnan jälkeen.

Kannattaako paikallisen tekoälypalvelimen sähkönkulutusta miettiä Suomessa?
Kyllä varsinkin, jos konetta pidetään päällä jatkuvasti taustapalvelimena. Pörssisähkösopimuksella raskaimmat eräajot kannattaa ajoittaa halvempiin tunteihin, kun taas satunnainen keskustelukäyttö ei vaikuta laskuun merkittävästi.

Voiko LM Studiota käyttää ilman erillistä näytönohjainta?
Kyllä, LM Studio toimii myös pelkällä suorittimella, mutta generointinopeus on huomattavasti hitaampi, tyypillisesti kymmenesosa GPU-kiihdytetystä nopeudesta. Pelkkä suoritin voi silti riittää satunnaiseen kokeiluun tai hyvin pienille malleille, joissa vasteajalla ei ole kiire.

Miten päivitän ROCm:n uuteen versioon rikkomatta asennusta?
Poista vanha branch-kohtainen paketti ensin kokonaan, tarkista yhteensopiva ajuriversio ROCm:n julkaisutiedoista, ja asenna uusi versio vasta sen jälkeen. Suoraa päivitystä vanhan päälle ei suositella, koska se on yleisin yksittäinen syy rikkoutuneisiin ROCm-asennuksiin pitkäaikaisessa käytössä.