KI Modelle auf lokaler Hardware
EndOfDayz 08.02.2025 - 20:46 17097 94
Viper780
ElderEr ist tot, Jim!
|
Sind ja noch 2 Layer mehr. Muss es aber mal recherchieren wie da der Zugriff auf die Hardware erfolgt.
Wsl2 hab ich sowieso laufen.
|
KruzFX
8.10.2021
|
folgend das docker-compose.yml für ROCm Support: services:
# ----------------------------------------------------------
# OLLAMA – AMD Radeon RX 7800 XT / RDNA3 / ROCm
# ROCm-Image ist immer aktiv, kein Override-File nötig.
# ----------------------------------------------------------
ollama:
image: ${OLLAMA_ROCM_IMAGE:-ollama/ollama:rocm}
container_name: angebotssystem_ollama
restart: unless-stopped
volumes:
- ollama_data:/root/.ollama
devices:
- /dev/kfd:/dev/kfd # ROCm Kernel Fusion Driver
- /dev/dri:/dev/dri # Direct Rendering Infrastructure
group_add:
- video
# - render
ipc: host
environment:
# RX 7800 XT = RDNA3 / gfx1101
HSA_OVERRIDE_GFX_VERSION: ${HSA_OVERRIDE_GFX_VERSION:-11.0.0}
ROCR_VISIBLE_DEVICES: ${ROCR_VISIBLE_DEVICES:-0}
HIP_VISIBLE_DEVICES: ${HIP_VISIBLE_DEVICES:-0}
OLLAMA_VULKAN: ${OLLAMA_VULKAN:-0} # ROCm hat Vorrang, kein Vulkan
# Performance für 16 GB VRAM
OLLAMA_NO_CLOUD: ${OLLAMA_NO_CLOUD:-1}
OLLAMA_FLASH_ATTENTION: ${OLLAMA_FLASH_ATTENTION:-1}
OLLAMA_KV_CACHE_TYPE: ${OLLAMA_KV_CACHE_TYPE:-q8_0}
OLLAMA_NUM_PARALLEL: ${OLLAMA_NUM_PARALLEL:-1}
OLLAMA_MAX_LOADED_MODELS: ${OLLAMA_MAX_LOADED_MODELS:-1}
OLLAMA_GPU_OVERHEAD: ${OLLAMA_GPU_OVERHEAD:-1073741824}
healthcheck:
test: ["CMD-SHELL", "ollama list > /dev/null 2>&1"]
interval: 10s
timeout: 10s
retries: 20
start_period: 30s
ports:
- 11434:11434
networks:
- internal
volumes:
ollama_data:
name: angebotssystem_ollama_data
networks:
internal:
name: local_net
driver: bridge
und dazu noch das .env file, kann man aber auch direkt ins compose file auch reingeben: # Ollama lokal auf AMD Radeon RX 7800 XT (kostenlos)
# Modell vorher laden: docker compose exec ollama ollama pull "Modelbezeichnung"
OLLAMA_MODEL=gemma4:26b
# --- AMD ROCm (RX 7800 XT / RDNA3 / gfx1101) ---
OLLAMA_ROCM_IMAGE=ollama/ollama:rocm
HSA_OVERRIDE_GFX_VERSION=11.0.0
ROCR_VISIBLE_DEVICES=0
HIP_VISIBLE_DEVICES=0
OLLAMA_VULKAN=0
OLLAMA_NO_CLOUD=1
OLLAMA_FLASH_ATTENTION=1
OLLAMA_KV_CACHE_TYPE=q8_0
OLLAMA_NUM_PARALLEL=1
OLLAMA_MAX_LOADED_MODELS=1
OLLAMA_GPU_OVERHEAD=1073741824
ROCm muss man halt noch separat installieren, dafür gibts aber eh Anleitungen von AMD ( https://rocm.docs.amd.com/projects/...uick-start.html)
Bearbeitet von KruzFX am 28.04.2026, 19:37
|
Earthshaker
Here to stay
|
Wir wollen mal mit lokaler KI spielen haben aber keine wirklich taugliche Hardware.
Budget 5k für eine Maschine. Ich bin mir unschlüssig ob ich mir eine Maschine mit einer Nvidia RTX4000 oder einfach einen Mac Mini Studio m4 Max und ned das ganze Budget verblasen.
Habt ihr einen Tip?
|
charmin
Vereinsmitgliedstay classy!
|
Gmktec EVO X2 mit 128gb. Oder den neuen Nvidia Thor hrhr
|
mat
AdministratorLegends never die
|
MacBook mit M5 Max und 128 GB RAM. Wenns nichts wird, hast noch immer eines der besten Dev Notebooks, das man für Geld kaufen kann.
|
charmin
Vereinsmitgliedstay classy!
|
MacBook mit M5 Max und 128 GB RAM. Wenns nichts wird, hast noch immer eines der besten Dev Notebooks, das man für Geld kaufen kann. Was kosten die. Warad a geil.
|
Earthshaker
Here to stay
|
6500brutto Sehr verlockend tatsächlich  Gmktec Evo X2 128. Hast die im Einsatz Charmin?
|
COLOSSUS
AdministratorGNUltra
|
|
charmin
Vereinsmitgliedstay classy!
|
6500brutto Sehr verlockend tatsächlich 
Gmktec Evo X2 128. Hast die im Einsatz Charmin? In Video auf YouTube gesehen zu Gemma 4 und dem Teil. Schaut gut aus.
|
voyager
banned by viper780
|
Mac Mini Studio m4 Max und ned das ganze Budget verblasen. was mit M5 holen, da wurde die Neutral Engine deutlich verbessert. Dazu gibt es KI Beschleuniger in jedem GPU Kern, die es beim M4 noch nicht gab. Und natürlich viel Ram, wenn du große Modell willst. Dank Unified Memory bist hier halt im Gegensatz zu einer Windows Lösung mit Grafikkarte im Vorteil. Für MacOS gibts auch Graphische Interfaces, mit denen man direkt sieht, welche Modelle auf der Ram Config flüssig laufen, und kann die auch direkt downloaden und benutzen.
|
voyager
banned by viper780
|
Was kosten die. Warad a geil. rund 6000 Brutto mit der stärksten CPU , 128GB Ram(also max) und 2TB SSD mit 14" Display. 16" sind imho 300 Euro Aufpreis wenn du nur was zum rumstehen brauchst, bald ist WWDC, da könnte evtl ein neuer Studio,... mit M5 vorgestellt werden
|
Viper780
ElderEr ist tot, Jim!
|
Kommt drauf an was man macht. Bei der klassischen Abfrage eines LLM ist die Rechenpower relativ egal. Was zählt ist sehr viel Speicher und maximale Speicherbandbreite.
Deshalb ist AMD Strix Halo (zB das größte Produkt "AI Max+ 395") wegen dem breiten Interface so beliebt (der "große" Mac Mini ist ähnlich schnell aber max 64GB), dann kommt der Mac Studio mit dem M3 Ultra (819 GB/s bei 192 GB) (M5 Ultra wird im Herbst erwartet) ist er eigentlich das schnellste was man sich kaufen kann. Aber der Preis ist extrem.
Dazwischen gibt's die von Colo verlinkten nvidia DGX - der punktet vorallem beim Prompt Processing oder dem Training von Modellen.
Das Mac Book Pro mit dem 40 Core M5 Max liefert auch beachtliche 614 GB/s (der M4 Vorgänger ist bei 546 GB/s) fast 2,5x schneller bei der Tokengenerierung als ein nvidia DGX System.
Strix Halo gibt's auch in Notebooks (hat 256 GB/s)
|
Earthshaker
Here to stay
|
Dank euch für den Input
|
charmin
Vereinsmitgliedstay classy!
|
Super Überblick Viper.
|
Viper780
ElderEr ist tot, Jim!
|
Hab mich die Woche für die Firma etwas einarbeiten dürfen. Aber habens wieder gelassen. Die Qualität ist so weit unter dem was man mit einem GPT Mini Modell bekommt und selbst wenn wir auf irgendwelche Opensource Modelle gehen ist hosting bei einem Cloud Provider günstiger bei besserer Leistung (privacy ist natürlich auch da ein Problem)
|