Lokal LLM
Seneste nyt fra sektionen. Følg med RSS.
AI-behovet fortrænger den almindelige forbruger
Microns direktør Sanjay Mehrotra siger, at efterspørgslen vil overstige udbuddet mindst et par år endnu. Samsung peger i samme retning. Meldingen dækker hukommelse til AI og servere, men rammer også forbrugerenheder, da fabrikkerne prioriterer datacentre.
Åben kildekode flytter AI-kraften til brugerens maskine
Magnitude er en ny open source-motor til inferens for lokale agenter. Den tilpasser sine kerner til den computer, den kører på, deler hukommelse mellem sessioner og lover op til næsten dobbelt hastighed mod llama.cpp på Mac og lavere forbrug pr. agent.
Muse overtager indkøbene med adgang til brugerens kort
Meta har lanceret AI-agenten Muse, der kan klare mails og onlinekøb. Den virker overraskende godt, hvis brugeren giver adgang til data og kort. Lanceringen følges af planer om en fysisk Charm-dims og sager om lækket adresse, et lukket sikkerhedshul og at Amazon blokerer agenten.
Kina udfordrer Nvidias magt med åben software
Deepseek og Huawei har bygget open source-værktøjer til Huaweis Ascend-chip. Kernen er sproget TileLang, som skal være enklere end Nvidias CUDA. Målet er at løse branchens største problem: software til kinesiske chips.
Kompetencer trumfer mærker i AI-styring
Ollama 0.35.1-rc0 indfører CAPABILITY-angivelser i Modelfiler og et additivt felt i create-kald. Evner bevares ved GGUF- og safetensors-oprettelse, nedarvning og eksport. System One kræver nu decision-evne, mens GGUF-reglen for scoring fortsætter.
Open source-AI udfordrer skyens magt over beslutninger
Unsloth v0.1.900-beta kan køre beslutningsmodellen Laya lokalt. Modellen svarer på ja/nej-, multiple-choice- og scoringsspørgsmål med sandsynligheder. Opdateringen giver også en dokumentfremviser og op til 4,5 gange hurtigere video- og billedgenerering.
Ny chip stopper udbrud, men overser AI-agentens løgn
Nvidia lancerer Open Agent Safety Platform, der kombinerer OpenShell-agentsoftware med hardware-vagthunden Sentry. Den skal isolere udbrudte AI-agenter på millisekunder – hos OpenAI tog det næsten tre timer i september. Men Sentry kan ikke pålideligt stoppe agenter, der er narret eller skjuler deres intentioner.
Lokale apps kaprer Metas AI-assistent og dine konti
Metas nye AI-assistent Muse har en 0-day-sårbarhed, der giver lokalt kørende apps og terminalkommandoer fuld kontrol over agenten. Amazon har blokeret Muse fra sin side.
AI-modeller vokser ud af én GPU – TensorRT deler dem op
NVIDIA TensorRT 11.0 understøtter multi-device inferens: ét TensorRT-netværk kan køre på tværs af flere GPU'er via NCCL-baserede distribuerede kollektiver. Funktionen skal imødekomme generative AI-modellers voksende krav til compute og hukommelse.
Lokalt AI-studie løsner skyens greb om musikken
En udvikler har bygget Miso, et selv-hostet musikstudie, der samler flere lokale AI-modeller i én grænseflade. Projektet gemmer hele arbejdsprocessen: prompts, stems, scores og lineage mellem versioner.
Runway lader dig styre AI-video live
Runway vil minimere tiden til første frame og streame video, mens brugeren skriver prompts. Realtidsgenerering kan også sænke GPU-omkostningerne, fordi hurtigere modeller bruger mindre GPU-tid.
ENZO lader dig køre 2000 AI-modeller uden skyen
ENZO er en open source-platform, der kører lokalt og samler mere end 2000 gratis AI-modeller. Den har agenter, integration med Google-tjenester, kodevisning og en krypteret vault til API-nøgler.
Nye konti isolerer arbejde, men deler modellen
Unsloth v0.1.810-beta tilføjer AMD-støtte til Docker og multi-brugerkonti med isolering. Billeddiffusion med INT8/FP8 kører dobbelt så hurtigt, og Windows på ARM64 får CUDA-støtte til træning og inferens.
HP lader dig køre kæmpe AI-modeller i toget
HPs Zbook Ultra G3a får op til 192 gigabyte delt hukommelse med 273 Gbps båndbredde til lokale AI-modeller. Den 16-tommer maskine vejer 1,9 kilo, holder 16 timer og kommer i oktober. Prisen er endnu ukendt.
Apple udfordrer Nvidias dominans på AI-hardware
Apple arbejder på en erhvervsserver med to eller fire M8 Ultra-chips til AI-inferens, skriver The Information. Serveren kan tidligst komme i 2029, og Apple overvejer Nvidias NVLink Fusion til at forbinde chipsene.
NVIDIA lader udviklere slå sikkerheden fra i GPU-kerner
NVIDIA har udgivet cuTile Rust, et tile-baseret system til at skrive GPU-kerner i Rust. Det udvider Rusts ejerskabsmodel til GPU-kerner, opdeler mutable output i disjunkte stykker og bevarer ejerskabskontrakten på tværs af kernel-launches. Udviklere kan fravælge sikkerheden lokalt, når de har brug for lavere-niveau-kontrol.
Brugeren beholder kontrollen over GPU-rækkefølgen
Unsloth har udgivet Windows ARM64-binaries med en rettelse, der sikrer, at brugerens valgte GPU-rækkefølge bevares i multi-GPU-opsætninger.
AI-agenter afleverer opgaver i din indbakke
Pizza Bot er en open source-desktopapp, der kører AI-agenter i baggrunden og viser resultaterne i en email-lignende indbakke. Appen er Apache 2.0-licenseret, kræver ingen konto og understøtter flere modeludbydere, herunder OpenAI, Anthropic og lokale modeller via Ollama.
Forskere deler udstyr, men ikke data
Fødereret læring starter med én server og få klienter. Når projektet vokser, bliver opgaven at drive delt infrastruktur. Nvidia beskriver, hvordan FLARE skalerer på tværs af Docker, Kubernetes og Slurm, tildeler GPU'er efter behov og holder studier og data adskilt.
OpenAI gør mobilkameraet skarpere fra første billede
OpenAI køber Glass Imaging for over 300 millioner dollars. Selskabet, stiftet af to tidligere Apple-ingeniører, bruger neurale netværk til at forbedre smartphone-kameraer i optagelsesøjeblikket. Opkøbet styrker OpenAIs hardware-ambitioner.
Ollama skærer i API – udviklere mister kontrol
Ollama har udgivet v0.34.1-rc2, hvor API-parameteren typical_p er afskrevet. Nye modeller kan ikke længere oprettes med parameteren, mens eksisterende GGUF-modeller med indstillingen fortsat understøttes.
Påstanden om lokal AI får nu et modregnestykke
Sunk Cost beregner, hvor lang tid en lokal AI-hardware skal bruges, før den har tjent sig selv ind sammenlignet med at leje modellen per token.
Ubuntu-brugere slipper for selv at kompilere llama.cpp
llama.cpps udgivelse b10969 inkluderer nu Ubuntu-CUDA-byg til x64 og ARM64. CI'en bruger CUDA 12.8 og 13.3, og ARM64-byg kompileres med GCC 14. Afhængige biblioteker følger med, men NCCL er fjernet indtil licensen er afklaret.
Den skrivende agent får nu en uafhængig dommer
Qodo har lanceret Agentic Toolbox, der lader kodeagenter som Claude Code, Codex og Cursor bruge Qodo til uafhængig kodegennemgang. Gennemgangen kan køre på lokale ændringer, før en pull request eksisterer.