NVIDIA publiceerde op 4 september een handleiding voor het draaien van AI-modellen op Jetson, zijn hardware voor lokale toepassingen. De voorbeelden gebruiken Nemotron 3.5 Lightning en Qwen3.8-27B. Het bedrijf beschrijft hoe zulke modellen dicht bij sensoren en machines kunnen werken, zonder voor iedere modelaanroep afhankelijk te zijn van een datacenter.
Minder rekenwerk per antwoord
De toelichting behandelt twee manieren om tekst sneller te genereren. Quantisatie gebruikt getallen met een lagere precisie, wat minder geheugen en rekenwerk vraagt. Daarnaast kan een kleiner model alvast stukjes tekst voorstellen die het hoofdmodel gezamenlijk controleert. NVIDIA meldt dat de snelste combinatie van technieken in zijn tests per model verschilde.
Eigen taken blijven de maatstaf
De fabrikant raadt ontwikkelaars aan snelheid én nauwkeurigheid te controleren met voorbeelden uit hun eigen toepassing. Resultaten van algemene prestatietests vertellen immers niet of alle belangrijke eigenschappen behouden blijven. Ook een passend kleiner voorstelmodel levert volgens de handleiding niet automatisch de verwachte versnelling: daarvoor moet het hoofdmodel genoeg voorgestelde tekst accepteren.
Verder bij de bron
De feiten en aankondigingen achter deze Nxt-brief.
Zelfstandig geformuleerde uitleg, gemaakt met behulp van AI op basis van de genoemde bronnen. Zo werken we.
