"We are back" « oc.at

KI Modelle auf lokaler Hardware

EndOfDayz 08.02.2025 - 20:46 17097 94
Posts

Viper780

Elder
Er ist tot, Jim!
Avatar
Registered: Mar 2001
Location: Wien
Posts: 52594
Sind ja noch 2 Layer mehr. Muss es aber mal recherchieren wie da der Zugriff auf die Hardware erfolgt.

Wsl2 hab ich sowieso laufen.

KruzFX

8.10.2021
Avatar
Registered: Aug 2005
Location: ZDR
Posts: 2315
folgend das docker-compose.yml für ROCm Support:


Code:
services:

  # ----------------------------------------------------------
  #  OLLAMA – AMD Radeon RX 7800 XT / RDNA3 / ROCm
  #  ROCm-Image ist immer aktiv, kein Override-File nötig.
  # ----------------------------------------------------------
  ollama:
    image: ${OLLAMA_ROCM_IMAGE:-ollama/ollama:rocm}
    container_name: angebotssystem_ollama
    restart: unless-stopped
    volumes:
      - ollama_data:/root/.ollama
    devices:
      - /dev/kfd:/dev/kfd          # ROCm Kernel Fusion Driver
      - /dev/dri:/dev/dri          # Direct Rendering Infrastructure
    group_add:
      - video
#      - render
    ipc: host
    environment:
      # RX 7800 XT = RDNA3 / gfx1101
      HSA_OVERRIDE_GFX_VERSION:  ${HSA_OVERRIDE_GFX_VERSION:-11.0.0}
      ROCR_VISIBLE_DEVICES:      ${ROCR_VISIBLE_DEVICES:-0}
      HIP_VISIBLE_DEVICES:       ${HIP_VISIBLE_DEVICES:-0}
      OLLAMA_VULKAN:             ${OLLAMA_VULKAN:-0}        # ROCm hat Vorrang, kein Vulkan
      # Performance für 16 GB VRAM
      OLLAMA_NO_CLOUD:           ${OLLAMA_NO_CLOUD:-1}
      OLLAMA_FLASH_ATTENTION:    ${OLLAMA_FLASH_ATTENTION:-1}
      OLLAMA_KV_CACHE_TYPE:      ${OLLAMA_KV_CACHE_TYPE:-q8_0}
      OLLAMA_NUM_PARALLEL:       ${OLLAMA_NUM_PARALLEL:-1}
      OLLAMA_MAX_LOADED_MODELS:  ${OLLAMA_MAX_LOADED_MODELS:-1}
      OLLAMA_GPU_OVERHEAD:       ${OLLAMA_GPU_OVERHEAD:-1073741824}
    healthcheck:
      test: ["CMD-SHELL", "ollama list > /dev/null 2>&1"]
      interval: 10s
      timeout: 10s
      retries: 20
      start_period: 30s
    ports:
      - 11434:11434
    networks:
      - internal

volumes:
  ollama_data:
    name: angebotssystem_ollama_data

networks:
  internal:
    name: local_net
    driver: bridge

und dazu noch das .env file, kann man aber auch direkt ins compose file auch reingeben:

Code:
# Ollama lokal auf AMD Radeon RX 7800 XT (kostenlos)
# Modell vorher laden: docker compose exec ollama ollama pull "Modelbezeichnung"
OLLAMA_MODEL=gemma4:26b

# --- AMD ROCm (RX 7800 XT / RDNA3 / gfx1101) ---
OLLAMA_ROCM_IMAGE=ollama/ollama:rocm
HSA_OVERRIDE_GFX_VERSION=11.0.0
ROCR_VISIBLE_DEVICES=0
HIP_VISIBLE_DEVICES=0
OLLAMA_VULKAN=0
OLLAMA_NO_CLOUD=1
OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q8_0
OLLAMA_NUM_PARALLEL=1
OLLAMA_MAX_LOADED_MODELS=1
OLLAMA_GPU_OVERHEAD=1073741824

ROCm muss man halt noch separat installieren, dafür gibts aber eh Anleitungen von AMD (https://rocm.docs.amd.com/projects/...uick-start.html)
Bearbeitet von KruzFX am 28.04.2026, 19:37

Earthshaker

Here to stay
Avatar
Registered: Dec 2002
Location: .de
Posts: 9646
Wir wollen mal mit lokaler KI spielen haben aber keine wirklich taugliche Hardware.

Budget 5k für eine Maschine. Ich bin mir unschlüssig ob ich mir eine Maschine mit einer Nvidia RTX4000 oder einfach einen Mac Mini Studio m4 Max und ned das ganze Budget verblasen.

Habt ihr einen Tip?

charmin

Vereinsmitglied
stay classy!
Avatar
Registered: Dec 2002
Location:  
Posts: 16486
Gmktec EVO X2 mit 128gb.
Oder den neuen Nvidia Thor hrhr :D

mat

Administrator
Legends never die
Avatar
Registered: Aug 2003
Location: nö
Posts: 25966
MacBook mit M5 Max und 128 GB RAM. Wenns nichts wird, hast noch immer eines der besten Dev Notebooks, das man für Geld kaufen kann.

charmin

Vereinsmitglied
stay classy!
Avatar
Registered: Dec 2002
Location:  
Posts: 16486
Zitat aus einem Post von mat
MacBook mit M5 Max und 128 GB RAM. Wenns nichts wird, hast noch immer eines der besten Dev Notebooks, das man für Geld kaufen kann.

Was kosten die. Warad a geil.

Earthshaker

Here to stay
Avatar
Registered: Dec 2002
Location: .de
Posts: 9646
6500brutto
Sehr verlockend tatsächlich :D

Gmktec Evo X2 128. Hast die im Einsatz Charmin?

COLOSSUS

Administrator
GNUltra
Avatar
Registered: Dec 2000
Location: ~
Posts: 12403

charmin

Vereinsmitglied
stay classy!
Avatar
Registered: Dec 2002
Location:  
Posts: 16486
Zitat aus einem Post von Earthshaker
6500brutto
Sehr verlockend tatsächlich :D

Gmktec Evo X2 128. Hast die im Einsatz Charmin?

In Video auf YouTube gesehen zu Gemma 4 und dem Teil. Schaut gut aus.

voyager

banned by viper780
Registered: Nov 2001
Location: offline
Posts: 4708
Zitat aus einem Post von Earthshaker
Mac Mini Studio m4 Max und ned das ganze Budget verblasen.

was mit M5 holen, da wurde die Neutral Engine deutlich verbessert. Dazu gibt es KI Beschleuniger in jedem GPU Kern, die es beim M4 noch nicht gab. Und natürlich viel Ram, wenn du große Modell willst. Dank Unified Memory bist hier halt im Gegensatz zu einer Windows Lösung mit Grafikkarte im Vorteil.

Für MacOS gibts auch Graphische Interfaces, mit denen man direkt sieht, welche Modelle auf der Ram Config flüssig laufen, und kann die auch direkt downloaden und benutzen.

voyager

banned by viper780
Registered: Nov 2001
Location: offline
Posts: 4708
Zitat aus einem Post von charmin
Was kosten die. Warad a geil.

rund 6000 Brutto mit der stärksten CPU , 128GB Ram(also max) und 2TB SSD mit 14" Display. 16" sind imho 300 Euro Aufpreis

wenn du nur was zum rumstehen brauchst, bald ist WWDC, da könnte evtl ein neuer Studio,... mit M5 vorgestellt werden

Viper780

Elder
Er ist tot, Jim!
Avatar
Registered: Mar 2001
Location: Wien
Posts: 52594
Kommt drauf an was man macht. Bei der klassischen Abfrage eines LLM ist die Rechenpower relativ egal. Was zählt ist sehr viel Speicher und maximale Speicherbandbreite.

Deshalb ist AMD Strix Halo (zB das größte Produkt "AI Max+ 395") wegen dem breiten Interface so beliebt (der "große" Mac Mini ist ähnlich schnell aber max 64GB), dann kommt der Mac Studio mit dem M3 Ultra (819 GB/s bei 192 GB) (M5 Ultra wird im Herbst erwartet) ist er eigentlich das schnellste was man sich kaufen kann. Aber der Preis ist extrem.

Dazwischen gibt's die von Colo verlinkten nvidia DGX - der punktet vorallem beim Prompt Processing oder dem Training von Modellen.

Das Mac Book Pro mit dem 40 Core M5 Max liefert auch beachtliche 614 GB/s (der M4 Vorgänger ist bei 546 GB/s) fast 2,5x schneller bei der Tokengenerierung als ein nvidia DGX System.

Strix Halo gibt's auch in Notebooks (hat 256 GB/s)

Earthshaker

Here to stay
Avatar
Registered: Dec 2002
Location: .de
Posts: 9646
Dank euch für den Input

charmin

Vereinsmitglied
stay classy!
Avatar
Registered: Dec 2002
Location:  
Posts: 16486
Super Überblick Viper.

Viper780

Elder
Er ist tot, Jim!
Avatar
Registered: Mar 2001
Location: Wien
Posts: 52594
Hab mich die Woche für die Firma etwas einarbeiten dürfen.
Aber habens wieder gelassen. Die Qualität ist so weit unter dem was man mit einem GPT Mini Modell bekommt und selbst wenn wir auf irgendwelche Opensource Modelle gehen ist hosting bei einem Cloud Provider günstiger bei besserer Leistung (privacy ist natürlich auch da ein Problem)
Kontakt | Unser Forum | Über overclockers.at | Impressum | Datenschutz