De L40S vult een cruciale lacune in het GPU-ecosysteem van datacenters. Terwijl rekengerichte AI-trainings-GPU's zoals de Nvidia H100 prioriteit geven aan ruwe prestaties, maar grafische acceleratie volledig achterwege laten, missen traditionele professionele visualisatiekaarten doorgaans de AI-rekencapaciteiten die moderne inferentieworkloads en opkomende AI-gestuurde grafische toepassingen vereisen. Deze positionering maakt hem bijzonder waardevol voor synthetische datageneratie, multimodale AI-ontwikkeling en Omniverse-toepassingen waar zowel reken- als grafische prestaties essentieel zijn.
NVIDIA L40S-specificaties
| Specificaties | L40 | L40S | H100 80G PCIe |
| GPU-architectuur | Ada Lovelace | Ada Lovelace | hopper |
| GPU-matrijs | AD102 | AD102 | GH100 |
| CUDA-kernen | 18,176 | 18,176 | 14,592 |
| Tensor kernen | 568 (4e generatie) | 568 (4e generatie) | 456 |
| RT Cores | 142 (3e generatie) | 142 (3e generatie) | - |
| GPU-geheugen | 48 GB GDDR6 met ECC | 48 GB GDDR6 met ECC | 80 GB HBM2e |
| Geheugenbandbreedte | 864 GB / s | 864 GB / s | 2 TB / s |
| Geheugeninterface | 384-bit | 384-bit | 5120-bit |
| Max Stroomverbruik | 300W | 350W | 350W |
| Form Factor | 4.4″ H x 10.5″ L: Dubbele sleuf | 4.4″ H x 10.5″ L: Dubbele sleuf | 4.4″ H x 10.5″ L: Dubbele sleuf |
| Thermische oplossing | Passieve | Passieve | Passieve |
| Display-connectoren | 4x DisplayPort 1.4a | 4x DisplayPort 1.4a | - |
| PCIe-interface | Gen4 x16 | Gen4 x16 | Gen5 x16 |
| Stekker | 16-pin | 16-pin | 16-pin |
| vGPU-ondersteuning | Ja | Ja | Nee |
| Multi-Instance GPU (MiG) | Nee | Nee | Ja |
| NVLink-ondersteuning | Nee | Nee | Nee |
Prestatie specificaties
| metrisch | L40-prestaties | L40S-prestaties | H100-prestaties |
| FP32-prestaties | 90.5 TFLOPS | 91.6 TFLOPS | 51.2 TFLOPS |
| TF32 Tensorkern | 362.1 TFLOPS | 366 TFLOPS | 756 TFLOPS |
| FP16 Tensorkern | 724 TFLOPS | 733 TFLOPS | 1513 TFLOPS |
| FP8 Tensorkern | 1,448 TFLOPS | 1,466 TFLOPS | 3026 TFLOPS |
| Piek INT8 Tensor TOPS | 1,448 TFLOPS | 1,466 TFLOPS | 3026 TOPS |
| RT-kernprestaties | 209 TFLOPS | 212 TFLOPS | - |
(Prestatiecijfers zijn schaars)
NVIDIA L40S versus H100
Een gedetailleerde blik op de specificaties onthult de onderscheidende ontwerpfilosofieën achter de NVIDIA L40S en H100. De L40S is gebouwd op de Ada Lovelace-architectuur, met dezelfde AD102-chip als in NVIDIA's high-end workstation-videokaarten. Deze erfenis resulteert in een enorm aantal van 18,176 CUDA-cores, wat resulteert in uitstekende single-precision FP32-prestaties, een hoeksteen van traditionele grafische rendering en wetenschappelijk computergebruik. De Hopper-architectuur en GH100-chip van de H100 zijn daarentegen speciaal ontworpen voor AI- en HPC-workloads.
Het meest opvallende verschil is de kernconfiguratie. De L40S bevat 142 RT-cores van de derde generatie en 568 Tensor-cores van de vierde generatie. De RT-cores zijn gespecialiseerde hardware voor het versnellen van raytracing, een functie die volledig ontbreekt op de H100, waardoor de L40S op unieke wijze fotorealistische rendering kan leveren. Hoewel de H100 minder Tensor-cores heeft, zijn ze sneller en geavanceerder, geoptimaliseerd voor nieuwe AI-dataformaten zoals FP8, wat hem een overtuigende voorsprong geeft op het gebied van ruwe AI-prestaties.
Deze afweging is ook duidelijk zichtbaar in de geheugensubsystemen. De H100 maakt gebruik van 80 GB duur HBM2e-geheugen, wat een verbluffende bandbreedte van 2 TB/s oplevert. Dit is essentieel om de SM's van stroom te voorzien tijdens grootschalige AI-modeltraining en -inferentie. De L40S maakt gebruik van een conventioneler 48 GB GDDR6-geheugen, wat een bandbreedte van 864 GB/s oplevert. Hoewel dit minder dan de helft is van de H100, is dit nog steeds een aanzienlijke hoeveelheid, perfect geschikt voor het laden van grote 3D-scènes, texturen met hoge resolutie en omvangrijke AI-modellen voor inferentie.
Tot slot schetst de functionaliteit hun beoogde rollen. De L40S beschikt over vier DisplayPort 1.4a-uitgangen en robuuste vGPU-ondersteuning, waardoor hij ideaal is voor gevirtualiseerde werkstations, render farms en cloudgaming-implementaties. De H100, die geen display-uitgangen of vGPU-mogelijkheden heeft, biedt in plaats daarvan Multi-Instance GPU (MiG)-technologie, waardoor hij kan worden gepartitioneerd in meerdere kleinere, geïsoleerde GPU-instanties om meerdere rekenintensieve workloads tegelijkertijd te verwerken. Het gedeelde passieve thermische ontwerp met twee sloten en het 350W-vermogen van de L40S en de PCIe H100 zorgen voor flexibiliteit bij de implementatie in een breed scala aan industriestandaard servers.
Wanneer je de L40S vergelijkt met NVIDIA's vlaggenschip, de H100, worden de verschillen in hun beoogde rol duidelijk. De H100 is de onbetwiste leider in pure AI-trainingsprestaties van die generatie GPU's, maar deze vergelijking vertelt slechts een deel van het verhaal. Het is vermeldenswaard dat de L40 ook deel uitmaakt van NVIDIA's line-up, met een lager TDP van 300 W vergeleken met de 40 W van de L350S, en vergelijkbare prestaties biedt bij een lager stroomverbruik.
De H100 die we hier bekijken, is de originele 80GB PCIe-versie met HBM2e-geheugen. NVIDIA heeft deze reeks sindsdien uitgebreid met varianten zoals de H100 NVL, die dient als vervanging voor het originele 80GB PCIe-model. Deze biedt 94GB geheugen en een hoger TDP van 400W, plus NVLink-ondersteuning voor configuraties met twee GPU's. De H100-familie breidt zich ook uit naar 8-GPU SXM-configuraties en de nieuwere H200, die dezelfde GPU-chip deelt, maar verbeterde prestaties levert in zowel PCIe- als SXM-vormfactoren.
Het onderscheid tussen de L40S en de H100 benadrukt een strategische divergentie in het ontwerp van GPU's voor datacenters. De H100 is een puur rekengerichte kaart, exclusief geoptimaliseerd voor AI en high-performance computing-workloads. De focus ligt op grootschalige AI-training, waarbij maximale rekencapaciteit het primaire doel is. Elk aspect van het ontwerp, van de enorme HBM2e-geheugenbandbreedte tot de gespecialiseerde Tensor Cores, is ontworpen voor de meest veeleisende neurale netwerktrainingsscenario's.
De L40S daarentegen is een universele GPU die is ontworpen voor veelzijdigheid en is gericht op AI-inferentie naast grafisch-intensieve workloads en NVIDIA vGPU-implementaties. Hoewel het een competente en kosteneffectieve oplossing is voor AI-inferentie, ligt zijn ware kracht in de ondersteuning van een breed scala aan grafisch-intensieve applicaties waarvoor de H100 simpelweg niet is gebouwd.
Grafisch-intensieve workloads en professionele toepassingen
De L40S blinkt uit in tal van grafisch intensieve domeinen die zowel rekenkracht als geavanceerde renderingmogelijkheden vereisen. Bij 3D-rendering en animatie vertrouwen studio's op de L40S voor het renderen van complexe scènes, waarbij de RT Cores raytracingberekeningen versnellen die onmogelijk zouden zijn op GPU's die alleen computerkracht gebruiken. Film- en televisieproductiebedrijven gebruiken deze mogelijkheden voor realtime previsualisatie, waardoor regisseurs en cameramensen fotorealistische renders van CGI-scènes kunnen bekijken tijdens het filmen, wat de postproductietijd en -kosten aanzienlijk verkort.
Architecten- en ingenieursbureaus gebruiken de L40S voor realtime architectuurvisualisatie en productontwerp. Klanten kunnen door fotorealistische gebouwweergaven lopen of gedetailleerde productprototypes bekijken voordat de fysieke bouw begint. De professionele grafische mogelijkheden van de kaart maken hem ook ideaal voor CAD-werkstations, waar engineers zowel de rekenkracht voor complexe simulaties als de grafische versnelling voor vloeiende, hoogwaardige viewportprestaties nodig hebben.
In de media- en entertainmentsector ondersteunt de L40S renderfarms die animatieframes van eindkwaliteit verwerken. Tegelijkertijd maken de vGPU-mogelijkheden cloudgebaseerde creatieve workflows mogelijk, waarbij artiesten op afstand toegang hebben tot krachtige grafische werkstations. Videobewerkings- en postproductiefaciliteiten gebruiken de L40S voor realtime effectverwerking, kleurcorrectie en compositing-workflows die zowel grafische versnelling als aanzienlijke rekenkracht vereisen.
De markt voor virtuele desktopinfrastructuur (VDI) vertegenwoordigt een ander belangrijk toepassingsgebied, waar de vGPU-technologie van de L40S meerdere gebruikers in staat stelt GPU-bronnen te delen voor grafisch versnelde virtuele desktops. Dit maakt professionele grafische mogelijkheden toegankelijk in zakelijke omgevingen zonder dat er afzonderlijke GPU's aan elke gebruiker hoeven te worden toegewezen.
De evolutie naar op natuurkunde gebaseerde AI-training
Belangrijker nog, de L40S biedt mogelijkheden die de H100 volledig mist. Het belangrijkste onderscheidende kenmerk van de L40S zijn de 142 RT-cores van de derde generatie, die realtime raytracing en fotorealistische rendering mogelijk maken. Hoewel de H100 geen RT-cores heeft en geen grafische acceleratie kan uitvoeren, maken de RT-cores van de L40S hem de duidelijke keuze voor toepassingen die zowel AI-berekeningen als geavanceerde graphics vereisen.
Bron: Nvidia
Dit onderscheid wordt steeds belangrijker naarmate we de toenemende populariteit zien van door AI gegenereerde 3D-modellen, digitale tweelingsimulaties en Universal Scene Description (OpenUSD)-workflows. De volgende stap in kunstmatige intelligentie draait niet alleen om het trainen van grotere taalmodellen; het gaat om het ontwikkelen van wereldmodellen die natuurkunde, ruimtelijke relaties en interacties in de echte wereld begrijpen. Deze evolutie vereist een fundamentele verschuiving in de manier waarop we het genereren van trainingsdata benaderen.
Hoewel het trainen van traditionele AI-modellen sterk afhankelijk is van NVIDIA's vlaggenschip-GPU's, vereist het trainen van de volgende generatie fysiek gefundeerde wereldmodellen een andere aanpak. Deze geavanceerde AI-systemen hebben enorme hoeveelheden trainingsdata nodig die niet alleen visuele informatie vastleggen, maar ook fysieke eigenschappen, lichtgedrag, materiaalinteracties en ruimtelijke relaties. GPU's zoals de L40S worden essentieel voor het genereren van trainingsdata op grote schaal, waarbij hun RT Cores de creatie van fysiek nauwkeurige synthetische omgevingen mogelijk maken die dienen als basis voor het trainen van meer geavanceerde AI-modellen.
Deze mogelijkheid voor geavanceerde grafische rendering, aangestuurd door de speciale RT Cores, is precies wat de L40S de ideale engine maakt voor NVIDIA's Omniverse-platform en het bredere ecosysteem van op fysica gebaseerde AI-ontwikkeling.
Omniversum
Omniversum is een ontwikkelplatform met API's, SDK's en services waarmee ontwikkelaars applicaties en workflows kunnen bouwen op basis van Universal Scene Description (OpenUSD). Het is ontworpen om fysiek nauwkeurige, realtime 3D virtuele werelden te creëren en te verbinden. Dit wordt bereikt door NVIDIA's RTX-technologie voor fotorealistische, raytraced rendering rechtstreeks te integreren in industriële en robotica simulatieworkflows. De L40S, met zijn krachtige RT Cores, biedt de essentiële hardwareversnelling om deze veeleisende RTX renderingworkloads aan te kunnen, waardoor ontwikkelaars licht, materialen en fysica met verbluffend realisme kunnen simuleren.
Omniverse is meer dan alleen een visualisatietool: het is een platform voor de ontwikkeling van de volgende generatie fysieke AI. Door deze levensechte virtuele werelden, oftewel 'digitale tweelingen', te creëren, kunnen ontwikkelaars complexe industriële installaties simuleren, complete robotvloten testen en autonome voertuigen valideren in een veilige, virtuele omgeving voordat ze in de praktijk worden ingezet. Cruciaal is dat deze high-fidelity simulaties de basis vormen voor het genereren van enorme hoeveelheden fysiek gebaseerde synthetische data; een essentiële bron voor het trainen van de krachtige AI-modellen die draaien op rekengerichte GPU's.
Synthetische manipulatiebewegingsgeneratie voor robotica
De NVIDIA Isaac GR00T-blauwdruk De bewegingsgeneratie voor synthetische manipulatie biedt een raamwerk voor roboticatraining en laat zien hoe de RT Core-mogelijkheden van de L40S het mogelijk maken om grote datasets te creëren op basis van minimale menselijke demonstraties. Deze workflow pakt een van de belangrijkste uitdagingen in de roboticaontwikkeling aan: het tijdrovende en dure proces van het verzamelen van voldoende hoogwaardige trainingsdata voor robotmanipulatietaken.
Traditionele roboticatraining is sterk afhankelijk van gesuperviseerd leren of imitatieleren, waarbij robots nieuwe vaardigheden verwerven door menselijke demonstraties van experts te observeren en na te bootsen. Het creëren van perfecte demonstraties is echter een uitdaging, en het verzamelen van uitgebreide, hoogwaardige datasets in de praktijk is tijdrovend, tijdrovend en duur. Een goed getrainde menselijke operator heeft doorgaans ongeveer één minuut nodig om één hoogwaardige demonstratie op te nemen, wat moeilijk schaalbaar is vanwege de aanzienlijke menselijke inspanning die hiervoor nodig is en de kans op fouten.
De Isaac GR00T-blauwdruk pakt deze uitdaging aan door gebruik te maken van synthetische data, gegenereerd uit fysiek nauwkeurige simulaties, om het dataverzamelingsproces te versnellen. Organisaties kunnen exponentieel meer data verzamelen met slechts een paar uur aan menselijke demonstraties.
De Isaac GR00T De blauwdruk bestaat uit drie belangrijke componenten die samenwerken om een uitgebreide pijplijn voor het genereren van synthetische gegevens te creëren:
- GR00T-Teleop stelt bekwame menselijke operators in staat om virtuele robots te besturen met behulp van ruimtelijke computerapparatuur zoals de Apple Vision Pro. Met dit systeem kunnen operators complexe manipulatietaken demonstreren in fotorealistische virtuele omgevingen, waarbij niet alleen de bewegingstrajecten, maar ook de omgevingscontext en objectinteracties worden vastgelegd. De Apple Vision Pro streamt handtrackinggegevens naar Isaac Lab, dat tegelijkertijd een meeslepend beeld van de omgeving van de robot terugstreamt naar het apparaat, wat intuïtieve en interactieve besturing van de robot mogelijk maakt.
- GR00T-Mimic neemt de opgenomen demonstraties en vermenigvuldigt ze met behulp van geavanceerde simulatietechnieken tot grotere synthetische datasets. Deze component gebruikt de opgenomen demonstraties als input om aanvullende synthetische bewegingstrajecten te genereren in Isaac Lab, ter ondersteuning van zowel eenarmige als tweehandige humanoïde robotmanipulatie. Het proces omvat het annoteren van belangrijke punten in de demonstraties en het gebruik van interpolatie om ervoor te zorgen dat de synthetische trajecten vloeiend en contextueel passend zijn.
- GR00T-Gen Maakt gebruik van de NVIDIA Omniverse- en Cosmos-platformen om synthetische datasets uit te breiden via 3D-upscaling en domeinrandomisatie. Deze component voegt extra diversiteit toe door achtergrond, belichting en andere variabelen in de scène te randomiseren. Het verrijkt de gegenereerde beelden via NVIDIA Cosmos Transfer, wat zorgt voor fotorealisme dat de kloof tussen simulatie en werkelijkheid verkleint.
Deze pipeline illustreert perfect de gespecialiseerde, complementaire rol van moderne datacenter-GPU's. De L40S, met zijn speciale RT-cores, fungeert als wereldbouwer. Hij is onmisbaar in de beginfase van datageneratie, waar hij de fysiek gebaseerde rendering, realtime raytracing en domeinrandomisatie afhandelt die nodig zijn om een fotorealistische en diverse virtuele omgeving te creëren.
Deze high-fidelity virtuele wereld wordt vervolgens het canvas voor de volgende generatiefase. Generatieve AI-modellen, zoals die in NVIDIA-kosmos, worden uitgevoerd op rekengerichte GPU's zoals de H100 om de uiteindelijke trainingsgegevens te produceren. De H100 maakt gebruik van de realistische omgeving van de L40S om miljoenen dynamische, fysiek bewuste scenario's te genereren.
Prestatiebenchmarks voor AI-inferentie
Een andere toepassing waar kaarten zoals de L40S populair zijn, is voor kostenefficiënte inferentie. Om de real-world AI-inferentiemogelijkheden van de L40S te vergelijken met die van de H100, hebben we de LLM-prestaties gebenchmarkt met behulp van vLLM met Nvidia's Open Reasoning Nemotron 14B-parametermodel op BF16 met een maximale tokenlengte van 32K.
vLLM Benchmark Resultaten
De H100 toont een duidelijke prestatieleiderschap en levert een ongeveer 4.2x hogere doorvoer dan de L40S. Dit voordeel is direct te danken aan de verdubbelde Tensor Core-prestaties en de meer dan verdubbelde geheugenbandbreedte van de H100 (2 TB/s versus 864 GB/s).
De prestaties per dollar vertellen echter een ander verhaal. De L40S kost doorgaans minder dan een derde van de prijs van een H100, waardoor hij voor veel inferentieworkloads kosteneffectiever is. Organisaties die inferentiediensten leveren waarbij absolute topprestaties niet cruciaal zijn, merken vaak dat de L40S een lagere totale eigendomskosten biedt.
Als we dubbelklikken op de sectie met lineaire prestaties, zien we dat de L40S een zeer acceptabel prestatieniveau levert en 16 gelijktijdige verzoeken kan verwerken met een SLO van ~52 ms TPOT (Time Per Output Token).
Een belangrijke factor om op te merken is dat AI-inferentie, met name de decodeerfase van tekstgeneratie, in wezen een geheugenintensieve bewerking is. Tijdens de inferentie moet het model herhaaldelijk gewichten in het GPU-geheugen raadplegen om elk nieuw token te genereren, waardoor de geheugendoorvoer een kritieke prestatiebottleneck vormt. Deze eigenschap verklaart waarom de H100, met zijn superieure geheugenbandbreedte en verbeterde Tensor Core-prestaties, van nature een hogere inferentiedoorvoer behaalt.
Voor implementatiescenario's waarbij zowel AI-inferentie als grafische versnelling nodig zijn, zoals realtime rendering met AI-verbeterde effecten en interactieve toepassingen met AI-gestuurde functies, is de L40S echter de enige haalbare optie.
Conclusie
De NVIDIA L40S en de nieuwste opvolgers van de Blackwell RTX Pro 6000 ontpoppen zich tot een strategisch gepositioneerde GPU die voldoet aan de veranderende eisen van moderne datacenters, waar AI-berekeningen en geavanceerde grafische mogelijkheden steeds meer samenkomen. Hoewel de H100- en B200-klassen GPU's de onbetwiste leiders blijven voor pure AI-training en inferentieworkloads, creëert de L40S een unieke en waardevolle niche als universele GPU die de kloof overbrugt tussen op rekenkracht gerichte AI-kaarten en traditionele professionele visualisatieoplossingen.
De unieke waardepropositie van de L40S komt het duidelijkst tot uiting in scenario's die zowel AI-inferentiemogelijkheden als grafische versnelling vereisen. De 142 RT-cores van de derde generatie maken toepassingen mogelijk die simpelweg onmogelijk zijn op GPU's met alleen rekenkracht zoals de H100, van realtime raytracing in professionele workflows tot fotorealistische synthetische datageneratie voor AI-training van de volgende generatie. Deze dubbele functionaliteit maakt hem onmisbaar voor opkomende toepassingen in de ontwikkeling van digitale tweelingen, op fysica gebaseerde AI-training en het groeiende Omniverse-ecosysteem.
Vanuit economisch perspectief biedt de L40S aantrekkelijke waarde voor organisaties die de absolute topprestaties van de AI van de H100 niet nodig hebben. Voor ongeveer een derde van de prijs van een H100 levert de L40S respectabele inferentieprestaties en biedt hij grafische mogelijkheden die datacenterimplementaties enorm veelzijdig maken. Voor veel organisaties maakt deze combinatie van kosteneffectiviteit en veelzijdigheid de L40S een praktischere keuze dan investeren in aparte AI- en grafische oplossingen.




Amazon