Hy-MT2 7B

Dieses Modell ist aus seiner Modellkarte automatisch übernommen und von uns noch nicht gegengelesen; Größen, Kontext und Lizenz sind gemessen, die Einordnung nicht.

Hy-MT2 7B braucht mit der Variante Q4_K_M rund 6,3 GB Speicher und läuft auf 614 von 678 geführten Geräten flüssig.

Mit dem wenigsten Speicher schafft es: Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 1000 Blackwell Laptop GPU, 32 GB. Die letzte Zahl im Namen ist der Arbeitsspeicher; der Grafikspeicher beträgt 8 GB.

Berechnet für 4.096 Token Kontext (Anwendungsfall „Ausprobieren, Neugier“). Die Tempowerte sind an veröffentlichten und eigenen Messungen abgeglichen, aber nicht auf diesem Gerät gemessen. Ausgenommen sind Werte mit dem Zusatz „nicht an Messungen abgeglichen“: für sie fehlt der Abgleich, sie sind unsicher.

Wofür möchten Sie das Modell nutzen?
Mehr zu diesem Einsatzzweck: Modelle und Geräte nach Preis
Anbieter
tencent
Parameter
7,5 Mrd.
Längster Kontext
262.144 Token
Lizenz
Apache 2.0

So starten Sie es mit Ollama:

$ ollama run hf.co/tencent/Hy-MT2-7B-GGUF:Q4_K_M
>>> /set parameter num_ctx 4096

Ab 24 GB Grafikspeicher wählt Ollama von selbst mehr Kontext und braucht dann mehr Speicher; beim Mac zählt dabei der Teil des Arbeitsspeichers, den macOS der Grafik zuteilt. Die zweite Zeile, nach dem Start in Ollama eingegeben, hält den Kontext bei den 4.096 Token, für die die Zahlen hier gelten.

Oder mit llama.cpp, mit dem Kontext dieser Seite (lädt das Modell von Hugging Face):

$ llama-server -hf tencent/Hy-MT2-7B-GGUF:Q4_K_M -c 4096

Geräte, auf denen es flüssig läuft

Die Tempowerte sind berechnet, nicht auf dem Gerät gemessen, und an veröffentlichten und eigenen Messungen abgeglichen. Ausgenommen sind die mit * markierten Werte: sie sind nicht abgeglichen und deshalb unsicher.

GerätUrteilTempoSpeicher
Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 1000 Blackwell Laptop GPU, 32 GBLäuft gut52 bis 64 Token/s *8 GB
davon 7,2 GB nutzbar
Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 2000 Blackwell Laptop GPU, 16 GBLäuft gut52 bis 64 Token/s *8 GB
davon 7,2 GB nutzbar
Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 2000 Blackwell Laptop GPU, 32 GBLäuft gut52 bis 64 Token/s *8 GB
davon 7,2 GB nutzbar
Lenovo ThinkPad P1 16 Zoll (2025), RTX PRO 2000 Blackwell Laptop GPU, 64 GBLäuft gut52 bis 64 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5060 Laptop GPU, 16 GBLäuft gut52 bis 64 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5060 Laptop GPU, 32 GBLäuft gut52 bis 64 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5060 Laptop GPU, 64 GBLäuft gut52 bis 64 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5070 Laptop GPU, 16 GBLäuft gut52 bis 64 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5070 Laptop GPU, 32 GBLäuft gut52 bis 64 Token/s *8 GB
davon 7,2 GB nutzbar
ASUS ROG Zephyrus G14 (2025), GeForce RTX 5070 Laptop GPU, 64 GBLäuft gut52 bis 64 Token/s *8 GB
davon 7,2 GB nutzbar

und 604 weitere

Grafikkarten, in die es ganz passt

GrafikkarteUrteilTempoSpeicher
NVIDIA GeForce RTX 3070 Ti, 8 GBLäuft gut80 bis 98 Token/s8 GB
davon 7,2 GB nutzbar
Intel Arc A750, 8 GBLäuft gut54 bis 101 Token/s8 GB
davon 7,2 GB nutzbar
Intel Arc A580, 8 GBLäuft gut54 bis 101 Token/s8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 2080 SUPER, 8 GBLäuft gut67 bis 81 Token/s *8 GB
davon 7,2 GB nutzbar
AMD Radeon RX 5700, 8 GBLäuft gut48 bis 89 Token/s *8 GB
davon 7,2 GB nutzbar
AMD Radeon RX 5700 XT, 8 GBLäuft gut48 bis 89 Token/s *8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 5060 Ti, 8 GBLäuft gut61 bis 74 Token/s8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 5060, 8 GBLäuft gut61 bis 74 Token/s8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 2070 SUPER, 8 GBLäuft gut61 bis 74 Token/s *8 GB
davon 7,2 GB nutzbar
NVIDIA GeForce RTX 3070, 8 GBLäuft gut61 bis 74 Token/s8 GB
davon 7,2 GB nutzbar

und 86 weitere

Alle Geräte und Grafikkarten für Hy-MT2 7B

Varianten

Der Bedarf gilt für 4.096 Token Kontext. Dabei bleibt Ollama, wenn Sie nach dem Start „/set parameter num_ctx 4096“ eingeben.

VarianteDateiSpeicherbedarfStartbefehl
Q4_K_M4,6 GB6,3 GBollama run hf.co/tencent/Hy-MT2-7B-GGUF:Q4_K_M
Q6_K6,2 GB7,9 GBollama run hf.co/tencent/Hy-MT2-7B-GGUF:Q6_K
Q8_08,0 GB9,7 GBollama run hf.co/tencent/Hy-MT2-7B-GGUF:Q8_0

Quelle: https://huggingface.co/tencent/Hy-MT2-7B-GGUF

Weitere Ratgeber