GPU & inference
Serving, kernels, quantisatie en de kosten van het daadwerkelijk draaien van het model.
Wat hier thuishoort
GPU & inference is voor serving, kernels, quantisatie en de kosten van het daadwerkelijk draaien van een model. Notities hier gaan over hardware, latentie en geld — niet over prompts schrijven.
Titels, samenvattingen en deze definitie staan in de HTML. JavaScript opent alleen het mobiele menu.
Nog niets in dit onderdeel.
Deze index staat online, ook als hij leeg is, zodat het onderdeel een openbaar adres heeft. Nieuwe notities verschijnen hier als HTML, niet na JavaScript.