Wat maakt een AI-model écht open source? De definitie die er nu eindelijk is

De term ‘open source AI’ rolt gemakkelijk van de tong, maar wat betekent dat eigenlijk? Na een wereldwijd co-designproces is er een definitie gepubliceerd die de mist rond dit begrip moet wegnemen — en meteen duidelijk maakt welke bekende modellen zich terecht ‘open source’ mogen noemen.

Vier vrijheden die je moet kunnen uitoefenen

De Open Source AI Definition versie 1.0 bouwt voort op het gedachtegoed van traditionele open source software. Een AI-systeem is open source als het vier vrijheden biedt:

  • Gebruiken voor elk doel, zonder toestemming
  • Bestuderen hoe het systeem werkt
  • Aanpassen voor je eigen context
  • Delen — zowel het origineel als aangepaste versies

Dat klinkt bekend, maar AI voegt een complicatie toe: je hebt niet alleen code nodig, maar ook toegang tot de data, parameters en trainingsmethoden die het systeem vorm geven. De definitie vereist daarom dat je beschikt over de ‘preferred form to make modifications’ — een erkenning dat modellen pas echt open zijn als je ze kunt reconstrueren en aanpassen.

Waarom deze definitie nodig is

Klassieke open source-licenties dekken code, maar niet de unieke componenten van AI-systemen zoals trainingsdata en modelarchitectuur. Overheden in Europa en de VS maken regelgeving waarin ‘open source AI’ een specifieke status kan krijgen — zonder gemeenschappelijk begrip wordt dat een rommeltje. En bedrijven doen graag aan ‘openwashing’, waarbij ze hun modellen open source noemen terwijl de licentie beperkingen bevat die dat tegenspreekt.

Welke modellen voldoen aan de definitie?

Opensource.org heeft bekende modellen gevalideerd tegen de nieuwe definitie. De resultaten:

Goedgekeurd zijn Pythia (Eleuther AI), OLMo (AI2), Amber en CrystalCoder (LLM360), en T5 (Google). Deze modellen bieden volledige transparantie: trainingsdata, code, parameters — alles is toegankelijk.

Bijna goedgekeurd zijn BLOOM (BigScience), Starcoder2 (BigCode) en Falcon (TII). Deze modellen komen technisch in de buurt, maar de licentie bevat nog restricties.

Afgekeurd zijn Llama2 (Meta), Grok (X/Twitter), Phi-2 (Microsoft) en Mixtral (Mistral). Deze systemen missen cruciale componenten of hebben licenties die incompatibel zijn met open source-principes.

De validatie is bedoeld als leermomenten, niet als certificeringen. Opensource.org beoordeelt alleen de juridische documentatie, niet de kwaliteit van systemen.

Waarom dit voor jou uitmaakt

Een heldere definitie helpt je betere keuzes maken. Wil je een chatbot bouwen voor een specifieke taal of cultuur? Dan heb je een model nodig dat je kunt aanpassen zonder juridische of technische obstakels. Ontwikkel je een tool voor medische diagnostiek? Transparantie over trainingsdata is dan essentieel om bias te verminderen en verantwoording af te leggen.

Open source AI maakt auditing mogelijk, voorkomt een monocultuur waarin één leverancier de dienst uitmaakt, en geeft meer partijen toegang tot fundamentele technologie.

Een praktisch voorbeeld: je wilt een AI-assistent bouwen die gespecialiseerd is in het Nederlands. Met een écht open model zoals OLMo kun je de trainingsdata aanvullen met Nederlandse tekstcorpora, de fine-tuning aanpassen aan lokale context, en het resultaat delen zonder licentieperikelen. Met Llama2 loop je tegen juridische en technische barrières aan — hoe goed het model ook is.

Meedoen met de beweging

De definitie is geen statisch document. Opensource.org onderhoudt een forum waar je discussies kunt volgen, publiceert maandelijkse voortgangsrapportages, en organiseert workshops en conferenties. Organisaties kunnen de definitie endorsen, individuen kunnen deelnemen aan de community.

Er is ook een white paper beschikbaar (samengesteld door OSI en Open Future) dat dieper ingaat op de achterliggende principes. Town hall-opnames geven inzicht in hoe de definitie tot stand is gekomen — een proces dat wereldwijd input heeft verzameld, inclusief een workshop in Parijs in oktober 2024.

Transparantie als voorwaarde

De definitie maakt één ding glashelder: open source AI draait om volledige transparantie. Geen black boxes, geen verborgen restricties, geen vage beloftes. Je kunt het systeem gebruiken, doorgronden, aanpassen en delen — of het is geen open source.

Kijk verder dan marketingtermen. Check de licentie, vraag naar trainingsdata, controleer of je het model daadwerkelijk kunt aanpassen. De validatielijst van opensource.org is daarbij een handig startpunt — de definitie biedt het kader om zelf te beoordelen of een model voldoet.


AI Generated