Open-source LLM's: De bekendste modellen op een rij

Het ecosysteem van open-source (en open-weights) Large Language Models ontwikkelt zich in hoog tempo. Voor ontwikkelaars bieden deze modellen een onafhankelijk, lokaal draaibaar en kostenefficiënt alternatief voor gesloten API's. Hieronder vind je een overzicht van de meest invloedrijke modellen en hun specifieke kenmerken.

Meta Llama 3

Licentie: Llama 3 Community License

Llama, ontwikkeld door Meta, is de onbetwiste pionier onder de krachtige open-weights modellen. De derde generatie (Llama 3) biedt modellen variërend van 8B tot 70B (en 400B in ontwikkeling) parameters.

  • Sterke punten: Uitzonderlijk goed in logisch redeneren, breed algemeen kennisniveau en uitstekende documentatie vanuit de community.
  • Ideaal voor: Algemene chatbots, complexe RAG (Retrieval-Augmented Generation) pijplijnen en code-generatie.

Mistral & Mixtral (Mistral AI)

Licentie: Apache 2.0 (grotendeels)

De Europese startup Mistral AI verraste de markt met zeer efficiënte modellen. Hun 'Mixtral' modellen maken gebruik van een Sparse Mixture of Experts (MoE) architectuur, wat zorgt voor hoge prestaties bij relatief lage rekenkracht-eisen tijdens inferentie.

  • Sterke punten: Zeer efficiënt geheugengebruik (MoE), native ondersteuning voor lange context-vensters (tot 32k of meer) en een open Apache 2.0 licentie op hun basismodellen.
  • Ideaal voor: Het verwerken van lange documenten, serverloze inferentie en commerciële toepassingen waar een vrije licentie cruciaal is.

Qwen 2 (Alibaba Cloud)

Licentie: Apache 2.0 / Qwen License

De Qwen-modellenfamilie presteert opvallend sterk over een breed scala aan groottes (van 0.5B tot 72B). Qwen 2 heeft significante stappen gezet in wiskundige capaciteiten en meertaligheid.

  • Sterke punten: Superieure ondersteuning voor meerdere talen (inclusief Europese en Aziatische talen), coderen en wiskundige probleemoplossing.
  • Ideaal voor: Multilinguale applicaties en analytische agent-systemen.

Gemma 2 (Google)

Licentie: Gemma License (Toestemming voor commercieel gebruik)

Gemma is gebouwd op dezelfde technologie en onderzoek als Google's Gemini-modellen. Gemma 2 (beschikbaar in formaten zoals 9B en 27B) excelleert in zijn gewichtsklasse en biedt robuuste prestaties op gangbare consumentenhardware.

  • Sterke punten: Hoge efficiëntie-tot-grootte verhouding, sterke focus op veiligheid (safe-by-design) en naadloze integratie met Google Cloud, Kaggle en Hugging Face.
  • Ideaal voor: Lokale implementaties, onderzoek en ontwikkeling op standaard GPU's.