Een frisse kijk op AI‑inference

Terwijl de markt steeds meer hongerig is naar snellere en goedkopere kunstmatige‑intelligentie‑diensten, richt de Franse startup Kog zich op een onverwachte bron: de alomtegenwoordige datacenter‑GPU’s. In plaats van te investeren in dure, op maat gemaakte chips, beweert Kog dat er nog veel onbenutte rekencapaciteit schuilt in bestaande hardware, mits deze op een dieper niveau wordt geoptimaliseerd.

De belofte van 30× snellere inferentie

In een demonstratie die de aandacht trok op Hacker News, liet Kog zien dat hun Kog Inference Engine (KIE) een verbluffende 3.000 tokens per seconde per aanvraag kan verwerken. Deze snelheid werd behaald met een relatief klein model van twee miljard parameters, Laneformer 2B, dat open‑source is. Ondanks de bescheiden omvang van het model, claimt CEO Gaël Delalleau dat dezelfde technieken toepasbaar zijn op veel grotere LLM’s, waardoor een versnelling van dertig keer mogelijk wordt.

Software‑optimalisatie versus hardware‑innovatie

De kern van Kog’s aanpak ligt in een grondige analyse van de fysieke eigenschappen van GPU’s – met name hun geheugenbandbreedte en rekenpijplijnen. Door op assemblage‑ en binaire niveau te reverse‑engineeren, kan Kog de standaard CUDA‑stack omzeilen en de GPU’s laten werken alsof ze speciaal voor inferentie zijn ontworpen. Deze benadering doet denken aan het werk van ZML, een andere Franse onderneming die hardware‑agnostische software ontwikkelt, maar Kog gaat nog een stap verder door zich te verdiepen in de onderliggende wet‑ en regelgeving van de chips.

Achtergrond van oprichter Gaël Delalleau

Delalleau’s unieke profiel combineert een opleiding in solid‑state‑fysica aan de École Polytechnique met een carrière in offensieve cybersecurity. Deze mix van wetenschappelijke precisie en hacker‑mentaliteit heeft hem geleerd om complexe systemen tot in de kleinste details te doorgronden. Hij beschouwt elke nieuwe GPU‑generatie als een puzzel die weken of zelfs maanden intensief moet worden ontcijferd, waarna de verkregen kennis direct in de KIE wordt geïntegreerd.

Marktkansen en praktische toepassingen

De eerste interesse komt vooral van bedrijven die lijden onder lange wachttijden bij het genereren van AI‑output, zoals ontwikkelaars die Claude of Anthropic‑modellen gebruiken. Voor hen betekent een snellere respons een directe kostenbesparing, omdat de prijsstructuur van veel AI‑providers gebaseerd is op tijd of token‑verbruik. Daarnaast werkt Kog samen met design‑partners die games en applicaties genereren op basis van prompts; een snellere inferentie vertaalt zich hier naar hogere omzet en een betere gebruikerservaring.

Hoewel de markt voor geoptimaliseerde inferentie nog in de kinderschoenen staat, heeft Kog al meer dan 200 concrete zakelijke leads verzameld. De focus ligt voorlopig op het versnellen van de ontwikkeling van grotere modellen, omdat potentiële klanten nog niet bereid zijn om zelf kleine modellen te fine‑tunen. Het bedrijf hoopt hiermee een brug te slaan tussen de huidige hardware‑capaciteit en de groeiende vraag naar realtime AI‑diensten.

Met een duidelijke visie op de toekomst van GPU‑gebruik en een hands‑on benadering die zowel wetenschappelijk als hacker‑georiënteerd is, positioneert Kog zich als een serieuze uitdager voor zowel traditionele chip‑fabrikanten als andere software‑optimalisatoren.

Source: https://techcrunch.com/2026/08/14/kog-is-going-deeper-to-squeeze-more-inference-out-of-gpus/

Related Articles