Lokal AI-motor udfordrer tech-giganternes sky-monopol
DwarfStar 4 kører DeepSeek, GLM og Qwen på Mac, CUDA og ROCm med CLI, lokale API'er og agent i samme pakke
Læs i dit tempo
Kort
Antirez har frigivet DwarfStar 4, et gratis program der kører kraftig kunstig intelligens direkte på egen computer. Det er vigtigt fordi følsomme oplysninger bliver på egen maskine og man undgår dyre nettjenester. Nu kan brugere hente programmerne og prøve chat, lokal adgang og løbende hjælp til kodning.
Begynder
Hvad hvis den store intelligens kunne bo hjemme på skrivebordet? Det er spørgsmålet bag DwarfStar 4, med kælenavnet ds4. Ideen er enkel. Store åbne modeller skal køre lokalt. De skal ikke bo på fjernservere. Åbne modeller betyder frit tilgængelige intelligenser, som alle kan hente. Fjernservere betyder store computere langt væk. På en M5 Max, en kraftig chip fra Apple, med 128 gigabyte (GB) arbejdshukommelse, altså Random Access Memory (RAM), skriver modellen DeepSeek V4 Flash 34,4 tokens i sekundet. Tokens er små bidder af tekst, som orddele. Den læser 557 tokens i sekundet, når den tager imod et prompt. Et prompt er den tekst, man giver den. Den husker 32.000 tokens ad gangen. Det kaldes kontekstvinduet. Det er modellens korte hukommelse.
Motoren er selve regneprogrammet. Det er skrevet i programmeringssproget C. Det laver inferens. Inferens er arbejdet med at regne svar ud. På Mac bruger den Metal. Metal er Apples system til at regne på chippen. På grafikkort fra NVIDIA bruger den CUDA. CUDA betyder Compute Unified Device Architecture. Det er NVIDIAs regnesystem. På chippen Strix Halo fra Advanced Micro Devices (AMD) bruger den ROCm. ROCm betyder Radeon Open Compute. Det er AMDs regnesystem. Den kører modellerne DeepSeek V4 og V4.1 Flash, GLM 5.x og Qwen 3.8 Flash Next. Den kører både tekst og vision. Tekst betyder skrevne ord. Vision betyder forståelse af billeder. Koden ligger åbent under en fri licens fra Massachusetts Institute of Technology (MIT). Det er det, der kaldes MIT-licensen. Bag projektet står antirez. Han er manden bag Redis. Redis er et kendt system til at gemme data hurtigt.
Tricket er asymmetrisk kvantisering. Det betyder ujævn komprimering. Tænk på en kuffert. Tøjet presses hårdt sammen. Dokumenterne holdes skarpe. Sådan arbejder ds4 med mixture-of-experts-modeller. Det betyder en blanding af eksperter. Mange små specialister deles om opgaverne. De mange ruteeksperter komprimeres hårdt. Ruteeksperter er specialisterne, man vælger mellem undervejs. At komprimere betyder at gøre mindre præcis for at fylde mindre. De fælles kritiske stier bevares præcise. Det er hovedvejene, som alle spørgsmål bruger. Sådan får ds4 de store modeller til at passe på maskiner med meget arbejdshukommelse. Lange præfikser kan gemmes på Solid State Drive (SSD). Det er en hurtig harddisk. Et præfiks er en lang start på en tekst. Den kan genoptages via prompt-hash. Det er et fingeraftryk for den givne tekst.
Pakken samler tre programmer. ./ds4 er til chat. Chat er samtale med modellen. ./ds4-server giver lokale programmeringsgrænseflader. Det betyder Application Programming Interfaces (APIer). Det er veje, så andre programmer på maskinen kan spørge modellen. I eksemplet er der op til 100.000 i kontekstvinduet. ./ds4-agent holder vedvarende kodningssessioner. Det er lange forløb, hvor modellen hjælper med at skrive programmer. Modeller hentes med download_model.sh. Det er et lille henteprogram. Et eksempel er varianten ds4f-q2. Det er en bestemt komprimeret udgave. Mac bygges med make. Make er en byggekommando. Linux bygges på computeren DGX Spark med make cuda-spark. Linux er et styresystem. 128 GB er skæringspunktet i projektets hardwarematrix. Det er oversigten over, hvilke maskiner der kan hvad. Her passer både V4 Flash Q2 som basis og GLM 5.3 Q2 og Qwen Q4. V4.1 Q2 hentes løbende fra SSD. Skalaen går fra 32 GB til 512 GB. Den går op til to maskiner med 512 GB hver.

34,4 tokens i sekundet genererer DeepSeek V4 Flash på en M5 Max med 128 GB RAM og 32.000 tokens i kontekstvinduet. 557 tokens i sekundet når den læser et prompt ind. Det er pointen med DwarfStar 4 (ds4): store åbne modeller skal køre lokalt i stedet for på fjernservere.
Motoren er skrevet i C og laver inferens på Mac med Metal, på NVIDIA med CUDA og på AMD Strix Halo med ROCm. Den kører DeepSeek V4 og V4.1 Flash, GLM 5.x og Qwen 3.8 Flash Next, både tekst og vision. Koden ligger åbent under MIT-licens. Bag projektet står antirez, manden bag Redis.
Tricket er asymmetrisk kvantisering. De mange ruteeksperter i mixture-of-experts-modellerne komprimeres hårdt, mens de fælles kritiske stier bevares præcise. Sådan får ds4 de store modeller til at passe på maskiner med meget RAM. Lange præfikser kan gemmes på SSD og genoptages via prompt-hash.
Pakken samler tre programmer. ./ds4 er til chat, ./ds4-server giver lokale API'er med op til 100.000 i kontekstvinduet i eksemplet, og ./ds4-agent holder vedvarende kodningssessioner. Modeller hentes med download_model.sh, for eksempel varianten ds4f-q2. Mac bygges med make, Linux på DGX Spark med make cuda-spark.
128 GB er skæringspunktet i projektets hardwarematrix. Her passer både V4 Flash Q2 som basis og GLM 5.3 Q2 og Qwen Q4. V4.1 Q2 hentes løbende fra SSD. Skalaen går fra 32 GB til 512 GB og op til to maskiner med 512 GB hver.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 2 kilder
- Vurdering Nyheds 4/5 — Nyt værktøj til at køre LLM lokalt er relevant for udviklere.
- Skrevet Model: deepseek-v4-flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Korrektur 1 zen · 2 rettelser
- Korrektur 2 chatdk · 3 rettelser
- Vedtagelse ainews-auto-v3 · score 0.9547