<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Clement |</title><link>https://clementgodbarge.com/nl/authors/clement/</link><atom:link href="https://clementgodbarge.com/nl/authors/clement/index.xml" rel="self" type="application/rss+xml"/><description>Clement</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>nl-nl</language><lastBuildDate>Sun, 06 Sep 2026 00:00:00 +0000</lastBuildDate><image><url>https://clementgodbarge.com/media/authors/clement_hu_3c9b888d0ca9e974.webp</url><title>Clement</title><link>https://clementgodbarge.com/nl/authors/clement/</link></image><item><title>Het hek, niet de brandstapel</title><link>https://clementgodbarge.com/nl/post/fence-not-fire/</link><pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/fence-not-fire/</guid><description>&lt;p&gt;In een magazijn in North Las Vegas laat Amazon een machine draaien die de ruggen van tweedehandsboeken afsnijdt. De losse bladen gaan door een scanner, en daarna wordt het papier tot pulp vermalen. Boeken vernietigen om AI te voeden: het verhaal had alles in huis om een cultureel schandaal te worden. De
vergeleek de praktijk met moderne boekverbranding en spaarde daarbij geen enkel cliché: toespelingen op Savonarola, stockfoto&amp;rsquo;s van ogenschijnlijk zeldzame boeken en, uiteraard, de Berlijnse brandstapel. De kwaliteitskranten bleven, zoals te verwachten, koeler, maar lieten dezelfde vergelijking in de lucht hangen. Hoe verontwaardigd ook, deze artikelen lieten de AI-industrie er opvallend genadig van afkomen. Het lot van het papier staat in de schijnwerpers; wie de eigenaar wordt van de digitale bibliotheken die eruit voortkomen, komt nauwelijks ter sprake. Wie krijgt de zeggenschap over de kennis die wordt gescand? Die vraag moet even wachten tot we de onzin over boekverbranding hebben opgeruimd.&lt;/p&gt;
&lt;h2 id="een-scanner-is-geen-brandstapel"&gt;Een scanner is geen brandstapel&lt;/h2&gt;
&lt;p&gt;De analogie met de brandstapels van Savonarola of de nazistische boekverbrandingen is te gek voor woorden: een exemplaar vernietigen is iets anders dan een tekst onderdrukken. De brandstapels waren openbare daden van verwerping. Die arme monnik Savonarola, van stal gehaald bij elke rel over boekverbranding, riep de mensen op om een deel van hun bezittingen te offeren als publieke boetedoening. De nazibrandstapels ensceneerden een ander soort verwerping: door de boeken in het openbaar te verbranden, verklaarde men dat hun auteurs geen plaats hadden in het Duitse culturele leven. In beide gevallen, hoe onverkwikkelijk ook, was de vernietiging een opvoering. Destructief scannen, een gangbare methode bij digitalisering, dient een ander doel: het exemplaar gaat onder de guillotine om de inhoud te bewaren. Het boek wordt vernietigd; de tekst wordt gedematerialiseerd. Wie naar &lt;em&gt;Fahrenheit 451&lt;/em&gt; grijpt, mag zich de centrale les van dat boek herinneren: een tekst is niet het papier waarop hij gedrukt staat.&lt;/p&gt;
&lt;p&gt;Scherper dan de Daily Mail maar niet minder onbeholpen gooide
olie op het vuur door “zeldzame boeken” in zijn kop te zetten. Toch zei een boekhandelaar die in datzelfde onderzoek wordt aangehaald dat deze bulkbestellingen
, wat grotendeels wijst op edities die zijn verschenen na de invoering van het ISBN rond 1970. Dit is het spul van rommelmarkten en kringloopwinkels, vaak maar één zolderopruiming verwijderd van de papiercontainer. Alvorens een culturele catastrofe af te kondigen, zou men de bibliotheekcatalogus kunnen raadplegen. Dit zijn precies de publicaties waarvoor bibliotheken met wettelijk depot bestaan. Toegegeven, een ISBN garandeert niet dat er een depotexemplaar bewaard is gebleven, maar schaarste op de tweedehandsmarkt bewijst evenmin dat een tekst verdwenen is.&lt;/p&gt;
&lt;p&gt;Boeken hebben natuurlijk wel een materiële geschiedenis. Exemplaren die door hun aantekeningen, opdrachten of herkomst historische betekenis hebben, verdienen het om te worden opgespoord en bewaard. Tweedehandsboekhandelaren hebben daar een rol in: wie zo&amp;rsquo;n exemplaar herkent, heeft een reden om het buiten een partij te houden die voor de pulpmolen bestemd is. We mogen ons ook zorgen blijven maken over de slinkende voorraad fysieke exemplaren van uitverkochte titels. Maar dan moeten we ook vragen waarom hun rechthebbenden ze niet herdrukken en evenmin toegang geven tot de bestaande digitale facsimile&amp;rsquo;s. Onderzoekers kennen de frustratie: Google Books vindt de passage die je nodig hebt en biedt je dan een snipper aan van een boek dat je nieuw kunt kopen noch online kunt lezen. Er valt hier dus wel degelijk over verliezen te discussiëren, maar die maken van een scanner nog geen nazibrandstapel.&lt;/p&gt;
&lt;p&gt;De boekhandel zelf vermaalt intussen al lang routineus onverkochte boeken tot pulp. Alleen al in Frankrijk werden in 2023 naar schatting
, ruwweg 60 procent van het tonnage dat onverkocht naar de distributeurs terugging. Dat heet voorraadbeheer. Overtollige exemplaren en schaarse tweedehandstitels roepen elk hun eigen vragen over toegang op, maar papier vernietigen komt op zichzelf niet neer op censuur of tirannie.&lt;/p&gt;
&lt;h2 id="meer-boeken-betere-ai"&gt;Meer boeken, betere AI?&lt;/h2&gt;
&lt;p&gt;Dat AI-bedrijven boeken kopen en scannen is eigenlijk goed nieuws. Een technologie die voortdurend wordt verweten dat ze de menselijke cultuur maar oppervlakkig begrijpt, neemt er meer van in zich op, en men had mogen verwachten dat wetenschappers die inspanning zouden toejuichen.&lt;/p&gt;
&lt;p&gt;Het web is een armzalig surrogaat voor het opgebouwde archief van een taal. Veel van het opgetekende leven van een taal, van romans en memoires tot populaire liedjes en getranscribeerde gesprekken, heeft de sprong van druk naar web nooit gemaakt. Veel van die boeken hebben hun uitgevers overleefd. Ze in de trainingsdata opnemen is het belangrijkst waar weinig anders voorhanden is. Een paar Engelse boeken extra leveren misschien een marginale verbetering op. In een slecht vertegenwoordigde taal kunnen diezelfde boeken echter het verschil betekenen tussen een bruikbaar en een onbruikbaar systeem. Of deze instrumenten thuishoren in onze publieke diensten of in ons dagelijks leven, is een zaak voor het publieke debat. Maar waar we ze ook besluiten te gebruiken, we moeten dat in onze eigen taal kunnen doen.&lt;/p&gt;
&lt;p&gt;De bestellingen waarover in Spanje en Nederland is bericht, maken het taalkundige belang tastbaar. In mei beschreef
een boekhandelaar in Badalona die herhaaldelijk bestellingen kreeg, vooral voor Catalaanse non-fictie: geschiedenisboeken, technische handleidingen en oude congresbundels. In augustus berichtte de Nederlandse pers over een verzoek aan De Slegte om
. De taal van de boeken verdient minstens zoveel aandacht als het lot van hun banden. Van de Daily Mail is dat misschien te veel gevraagd. Maar ook de bezadigdere kranten hebben weinig gezegd over de talen die in het spel zijn.&lt;/p&gt;
&lt;p&gt;Licentieovereenkomsten met grote uitgevers kunnen eveneens waardevol materiaal opleveren, maar hun digitale catalogi dekken maar een fractie van wat ooit in druk is verschenen. Boeken die nooit zijn gedigitaliseerd, of waarvan de uitgever de rechten niet meer bezit, vallen buiten het aanbod. Zelfs een royale licentiedeal kan niet in de plaats treden van de geschiedenis van het uitgeversbedrijf, laat staan van de geschiedenis van een cultuur. Tweedehandsexemplaren opkopen is een manier om voorbij die commerciële grenzen te reiken.&lt;/p&gt;
&lt;h2 id="diefstal-is-geen-argument"&gt;“Diefstal” is geen argument&lt;/h2&gt;
&lt;p&gt;Het “diefstal” noemen helpt evenmin. In juni 2025 oordeelden twee Amerikaanse districtsrechtbanken dat het gebruik van boeken om taalmodellen te trainen in de voorliggende zaken onder fair use viel. In
benadrukte de rechtbank het transformatieve karakter van de training: de boeken werden gebruikt om een systeem te bouwen dat nieuwe uitdrukkingsvormen kan voortbrengen. Modellen kunnen passages memoriseren, maar een boek voor training gebruiken maakt de hele tekst nog niet op afroep opvraagbaar. Evenmin veegt de afwezigheid van letterlijke reproductie elk bezwaar van tafel. In
waarschuwde de rechter dat door AI gegenereerde werken de markt zouden kunnen overspoelen en dat bewijs van zulke schade een beroep op fair use kan doen stranden. Deze eisers hadden echter geen noemenswaardig bewijs geleverd van zulke schade aan hun eigen werk. Geen van beide uitspraken geeft AI-bedrijven vrij spel of beslecht het ethische geschil. Ze verplichten ons onderscheid te maken tussen hoe boeken worden verworven, hoe kopieën worden bewaard en wat de training ermee doet. Dat alles “diefstal” noemen laat die vragen onbeantwoord.&lt;/p&gt;
&lt;p&gt;Terzijde: de uitspraak in de zaak Anthropic levert een rechtvaardiging voor de guillotine. De rechtbank keurde de digitalisering van gekochte exemplaren goed en verwierp het aanleggen van een permanente bibliotheek van illegaal gekopieerde boeken, waarvoor het bedrijf later
. De digitalisering werd mede goedgekeurd omdat elk gedrukt exemplaar bij de omzetting werd vernietigd: de digitale kopie kwam ervoor in de plaats en werd niet buiten het bedrijf gedeeld. De vernietiging waar sommigen zich zo over opwinden, hielp Anthropic aantonen dat zijn digitaliseringsprogramma fair use was. Kopen, scannen en weggooien bood in dat geval een wettige route. De guillotine is hier een instrument om binnen de wet te blijven.&lt;/p&gt;
&lt;p&gt;Er zijn goede redenen om te willen dat AI put uit meer talen, meer wetenschap en meer van de wereld die vóór het internet bestond. Die redenen verdwijnen niet omdat een bedrijf dat we niet mogen er een commerciële kans in heeft gezien.&lt;/p&gt;
&lt;h2 id="geleende-verontwaardiging"&gt;Geleende verontwaardiging&lt;/h2&gt;
&lt;p&gt;Terug dan naar de Daily Mail. Haar artikel maakt deel uit van
, een campagne van kranteneigenaren en uitgevers die streven naar
voor AI. Twee handige substituties doen het werk: Big Tech staat voor AI, en de rechthebbenden staan voor “Britse creativiteit”. De lezer wordt uitgenodigd de cultuur te verdedigen terwijl uitgevers over de voorwaarden van de verkoop onderhandelen. Wetenschappers die het verhaal delen, mogen zich afvragen wiens zaak hun verontwaardiging dient.&lt;/p&gt;
&lt;p&gt;Big Tech en de
kibbelen over de pacht, maar geen van beide heeft iets tegen het hek. Het verhaal van de eenzame auteur die door een techreus wordt beroofd, verhult wat dure licentiedeals beide bedrijfskampen te bieden hebben: de uitgevers worden betaald, en Big Tech krijgt een markt waarin zijn kleinere concurrenten het zich niet kunnen veroorloven mee te dingen. Peter Thiel verwoordde de voorkeur van Silicon Valley botter:
.&lt;/p&gt;
&lt;p&gt;Licenties hoeven niet tot die uitkomst te leiden. Betaalbare, niet-exclusieve toegang zou kleinere ontwikkelaars kunnen helpen. Maar een systeem dat elke nieuwkomer dwingt dure deals te sluiten met de grote rechthebbenden, maakt koopkracht tot toegangsvoorwaarde. Een betaling die wordt voorgesteld als tegemoetkoming aan de cultuurindustrie, koopt uiteindelijk bescherming tegen toekomstige concurrenten.&lt;/p&gt;
&lt;h2 id="ai-is-niet-van-big-tech"&gt;AI is niet van Big Tech&lt;/h2&gt;
&lt;p&gt;Er speelt een dieper probleem. Te veel kritiek op AI houdt de grootste commerciële leveranciers voor het hele veld. De producten domineren de krantenkoppen; het onderzoek en de ontwikkeling buiten die bedrijven verdwijnen uit beeld. Big Tech kon zich nauwelijks een nuttiger misverstand wensen. Zijn ambitie om het veld in bezit te nemen wordt het uitgangspunt van de kritiek die tegen hem wordt gericht. Het monopolie is nog niet binnen. Wie het als een voldongen feit behandelt, bewijst die bedrijven een enorme dienst. Het leidt bovendien de aandacht af van open source: van wat het nodig heeft, van zijn kansen om te bestaan, van zijn belangen, van zijn legitimiteit als alternatief.&lt;/p&gt;
&lt;p&gt;Opensource-AI stelt mensen in staat systemen te bouwen en aan te passen die een grotere verscheidenheid aan talen, culturen en uitdrukkingsvormen weerspiegelen. Voor landen in Europa, Afrika, Latijns-Amerika en Azië is dat een praktische basis voor technologische en culturele soevereiniteit: het vermogen om zelf te bepalen hoe systemen werken, welke talen ze bedienen en waar ze worden ingezet. Of we AI gebruiken, en waarvoor, moet een publieke keuze blijven, geen beslissing die wordt gedicteerd door afhankelijkheid van een buitenlands oligopolie.&lt;/p&gt;
&lt;p&gt;Maar de vrijheid om een systeem aan te passen stelt weinig voor zonder de middelen om dat te doen. Onafhankelijk werk vereist expertise, rekeninfrastructuur en toegang tot trainingsmateriaal. En zo zijn we terug bij de boeken. Als elk onderzoeksteam of elke publieke instelling zijn eigen uitgeversdeals moet sluiten of zijn eigen privébibliotheek moet aanleggen, wordt onafhankelijkheid onbetaalbaar, zelfs voor sommige rijke landen.&lt;/p&gt;
&lt;h2 id="de-boeken-zijn-er-al"&gt;De boeken zijn er al&lt;/h2&gt;
&lt;p&gt;Bibliotheken en archieven hebben generaties lang het materiaal verzameld dat deze systemen nodig hebben. Hun collecties bestaan omdat de toegang tot kennis het commerciële belang om haar te verkopen moet overleven. Veel is al gescand:
bezit zo&amp;rsquo;n negentien miljoen gedigitaliseerde delen uit onderzoeksbibliotheken, waarvan vele nog auteursrechtelijk beschermd zijn. Een bibliotheek scant een boek en bewaart het. Niemand heeft daar een guillotine nodig. HathiTrust
, maar heeft ook
aangekondigd, een project om corpustoegang te bieden voor niet-commercieel AI-onderzoek en niet-commerciële ontwikkeling. Toegang op die voorwaarden zou sommige onafhankelijke ontwikkelaars nog altijd buiten de deur houden.&lt;/p&gt;
&lt;p&gt;Het bezit van de boeken geeft een bibliotheek echter niet het recht om hun auteursrechtelijk beschermde inhoud als trainingscorpus te verspreiden. Het
staat onderzoeksinstellingen en bibliotheken toe om rechtmatig toegankelijke werken te minen voor wetenschappelijk onderzoek, en staat ruimer minen toe waar rechthebbenden hun rechten niet hebben voorbehouden.
: zijn uitzondering voor tekst- en datamining geldt voor niet-commercieel onderzoek en beperkt de overdracht van kopieën. Geen van beide kaders geeft bibliotheken een algemeen recht om hun auteursrechtelijk beschermde collecties te delen zodat anderen erop kunnen voortbouwen.&lt;/p&gt;
&lt;p&gt;We zouden ook kunnen heroverwegen hoe lang rechthebbenden zeggenschap moeten houden over computationeel gebruik van boeken. Farmaceutische octrooien belichamen een ruil: tijdelijke exclusiviteit beloont innovatie, daarna komt de uitvinding beschikbaar voor anderen. Hun gebruikelijke termijn van twintig jaar is veel korter dan de bescherming van het auteursrecht, die het hele leven van de auteur duurt en nog zeventig jaar daarna. Waarom zou een vergelijkbaar beginsel niet gelden voor computationeel gebruik van boeken? Zeg twintig jaar na de eerste publicatie zou een boek beschikbaar kunnen komen voor tekst- en datamining zonder licentiekosten, terwijl de rechten op heruitgave en verkoop beschermd blijven. Auteurs zouden aan hun boeken kunnen blijven verdienen zonder dat generaties onderzoekers om toestemming moeten onderhandelen om ze te analyseren.&lt;/p&gt;
&lt;p&gt;Twee jaar geleden betoogde ik in
dat erfgoeddata als publiek goed moeten worden behandeld. Overheden zouden bibliotheken en archieven moeten financieren om hun collecties te digitaliseren, te transcriberen en te documenteren, en hun de wettelijke bevoegdheid moeten geven om de resulterende corpora beschikbaar te stellen zodat anderen erop kunnen voortbouwen. Big Tech zou via een speciale heffing kunnen meebetalen.&lt;/p&gt;
&lt;p&gt;Publieke financiering moet gepaard gaan met gepubliceerde collectie- en toegangsregels, die zowel academisch als commercieel werk bestrijken, zonder exclusieve deals of voorkeurstoegang voor donateurs. Toegang voor training hoeft niet te betekenen dat auteursrechtelijk beschermde boeken onbeperkt mogen worden herverspreid. Auteurs moeten meedenken over het publieke stelsel, ook over hoe het omgaat met toestemming, vergoeding en concurrentie met hun werk. Gratis toegang voor gebruikers sluit een publiek gefinancierde vergoeding voor auteurs niet uit. Het
, dat auteurs uit publieke middelen betaalt wanneer hun boeken worden uitgeleend, biedt daarvoor een precedent. Om de brandstapel ging het nooit. Om het hek wel.&lt;/p&gt;</description></item><item><title>Beste redacteuren: als u mijn stem wilt, geef me dan mijn taal terug</title><link>https://clementgodbarge.com/nl/post/dear-editors/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/dear-editors/</guid><description>&lt;p&gt;Weer een dag, weer een tijdschrift dat met zijn AI-beleid te koop loopt. Ditmaal is het &lt;em&gt;Progress in Human Geography&lt;/em&gt;, waarvan de redactie
heeft gepubliceerd die waarschuwt dat AI gebruiken als vervanging voor het eigen lezen, denken en schrijven “een schending van de academische ethiek is, vergelijkbaar met plagiaat”. Artikelen die de regels overtreden, “kunnen worden ingetrokken”; in het beste geval worden ze gecorrigeerd, met een rectificatie in het tijdschrift. Auteurs, voegen de redacteuren eraan toe, doen er goed aan “zorgvuldig te overwegen of zij hun naam met intrekkingen en rectificaties in verband gebracht willen zien”.&lt;/p&gt;
&lt;p&gt;Bij die zin mogen we even stilstaan. Intrekking is de zwaarste sanctie die het wetenschappelijk publiceren kent, de straf die normaal is voorbehouden aan vervalsing en fraude. Hier wordt ze gekoppeld aan een vergrijp dat hetzelfde redactioneel niet weet te definiëren. Er zijn, geven de redacteuren toe, “echte grijze zones” en “geen duidelijke lijnen die de zone van ‘onverantwoordelijkheid’ afbakenen”. De handhaving zal berusten op “oordelen die sommige auteurs tegen de borst kunnen stuiten, die dan zullen beweren geen onbehoorlijk gebruik van AI te hebben gemaakt”: iemands eigen verklaring kan met andere woorden terzijde worden geschoven. Het advies dat volgt, luidt: blijf “veilig in de zone van ‘verantwoordelijkheid’”, en men raadt alleen tot veiligheid waar gevaar dreigt. Mensen straffen omdat ze een lijn overschrijden waarvan je zelf toegeeft dat je haar niet kunt trekken, heeft alleen zin als je met angst wilt regeren. Onthoud dat even.&lt;/p&gt;
&lt;h2 id="het-voorwendsel-van-de-stem"&gt;Het voorwendsel van de stem&lt;/h2&gt;
&lt;p&gt;Hoe ziet verantwoord gebruik eruit? Auteurs krijgen te horen: “er moet grote zorg aan worden besteed &amp;hellip; de eigen stem te behouden”. Misbruik is AI inzetten “om te schrijven in een taal die auteurs zelf normaal nooit zouden gebruiken”. Voor een moedertaalspreker is dat zinnig: doe je niet anders voor dan je bent. Maar voor buitenlanders die in een vreemde taal moeten schrijven, spreekt het gebod zichzelf tegen. De stem die het beleid beschermt, is precies wat de regels van het tijdschrift ons ontzeggen.&lt;/p&gt;
&lt;p&gt;Neem mij als proefpersoon. Engels is mijn vierde taal, precies het soort taal dat ik “normaal” nooit zou gebruiken. Engelstalige universiteiten hebben me geleerd het kort, met wegwijzers en bijna mechanisch te schrijven: de kernzin vooraan, de voorbehouden op de voorgeschreven plaatsen, de overgangen uit de goedgekeurde lijst. De training heeft gewerkt: in mijn Engels heeft nooit een stem gezeten die beschermd moest worden; het was het eerste wat eruit moest. Volgens de definitie van de redactie zelf zou alles wat ik ooit in het Engels heb geschreven onbehoorlijk gebruik zijn, met of zonder machine.&lt;/p&gt;
&lt;h2 id="tussen-twee-vuren"&gt;Tussen twee vuren&lt;/h2&gt;
&lt;p&gt;De redacteuren zeggen dat ze aan ons hebben gedacht: het beleid erkent dat niet-moedertaalsprekers er baat bij hebben dat AI hun Engels nakijkt, en zelfs bij zijn “vertaal-, schrijf- en redactiediensten”. Toch mag de rol van AI bij het schrijven “hoogstens neerkomen op hulp bij het redigeren en corrigeren”, en moet ze ophouden vóór “grote brokken door AI geschreven tekst”. Een machinevertaald artikel is van het eerste tot het laatste woord door AI geschreven; het bestaat uit niets anders dan zulke brokken. De concessie houdt dus alleen stand als vertalen geen schrijven is. Waar loopt die grens? Dat hebben ze ons al verteld: “geen duidelijke lijnen”.&lt;/p&gt;
&lt;p&gt;Het wordt nog erger, want de verdenking is niet alleen niet-falsifieerbaar. Er wordt ook nog eens met valse dobbelstenen gespeeld. In 2023 testte een team van Stanford zeven veelgebruikte AI-detectoren op essays van menselijke hand: de detectoren merkten gemiddeld 61% van de TOEFL-essays van niet-moedertaalsprekers aan als machinaal gegenereerd, terwijl ze essays van moedertaalsprekers vrijwel feilloos classificeerden; één detector betrapte 97,8% van de TOEFL-reeks (
). De reden is leerzaam. Detectoren meten voorspelbaarheid, en Engels als tweede taal, getraind naar het gemiddelde toe, is per definitie voorspelbaar: het meest waarschijnlijke woord in de meest waarschijnlijke volgorde. Dezelfde studie vond dat signaal terug in echt wetenschappelijk werk: minder taalkundige variatie in conferentiebijdragen waarvan de eerste auteur geen moedertaalspreker is. De stilistische kenmerken die als “AI” worden gelezen, zijn de kenmerken van bekwaam Engels als tweede taal, en een menselijk oordeel leest dezelfde kenmerken als de machine. Zo zit ik tussen twee vuren: schrijf ik mijn eigen Engels, dan lijk ik een machine; gebruik ik de machine, dan overtreed ik hun regel.&lt;/p&gt;
&lt;h2 id="de-taaltaks"&gt;De taaltaks&lt;/h2&gt;
&lt;p&gt;De paradox zou onschuldig zijn als er geen dreigementen bij kwamen. Maar die dreigementen leggen een dieper en ouder probleem bloot dat het beleid nooit bij naam noemt: eentaligheid. De
vragen om “een zo breed mogelijke internationale dekking”, terwijl op dezelfde pagina staat: “de taal van het tijdschrift is Engels”.&lt;/p&gt;
&lt;p&gt;De kosten van die regeling zijn niet hypothetisch. Amano en collega&amp;rsquo;s ondervroegen 908 milieuwetenschappers en stelden vast dat niet-moedertaalsprekers van het Engels tot 51% meer tijd besteden aan het schrijven van een artikel, het 2,5 keer zo vaak afgewezen zien en 12,5 keer zo vaak gevraagd worden het te herzien, en dat alleen om taalredenen (
). Die taks wordt geheven nog vóór er enig AI-beleid aan te pas komt; het verklaringsformulier en zijn dreigementen zijn een audit die daar nog bovenop komt.&lt;/p&gt;
&lt;h2 id="fin-dempire"&gt;Fin d’empire&lt;/h2&gt;
&lt;p&gt;Eentaligheid is het axioma waarover niemand het heeft. Het is een imperiale erfenis die met de tijd een praktische rechtvaardiging kreeg: vertalen was traag en duur, en geen redactie kon beoordelen wat ze niet kon lezen. Niets daarvan overleeft echter de vooruitgang van de machinevertaling. Machinevertaling van het hoogste niveau kan dienen als betrouwbare tussenlaag tussen auteurs en redacties.&lt;/p&gt;
&lt;p&gt;De ideale uitweg is menselijk: wetenschappers zouden meer dan één taal moeten lezen. In plaats daarvan sluiten Engelstalige universiteiten liever hun talenopleidingen. Merk op dat die sluitingen een Anglo-Amerikaans verschijnsel zijn: wetenschappers elders hebben zich de luxe van eentaligheid nooit kunnen veroorloven. En let op het moment. Een talenopleiding sluiten is een gok: de gok dat het Engels voorgoed heeft gewonnen en dat er nooit meer iets lezenswaardigs in een andere taal zal worden geschreven. Die gok wordt op precies het verkeerde moment gewaagd, en dat om twee redenen. Ten eerste omdat machinevertaling het voor het eerst mogelijk maakt om het helemaal zonder lingua franca te stellen; ten tweede omdat de orde die het Engels tot de norm maakte, terugwijkt: de Engelstalige wereld keert zich naar binnen, de globalisering ebt weg, de vrijhandel wordt betwist tot in zijn eigen bakermat, en er tekent zich een multipolaire wereld af waarin de talen die het lezen waard zijn zich zullen vermenigvuldigen. Universiteiten leveren wetenschappers af die alleen Engels lezen, voor een wereld waarin Engels niet meer zal volstaan. Redacties zullen dat verlies als eerste erven.&lt;/p&gt;
&lt;h2 id="een-test-voor-de-redactie"&gt;Een test voor de redactie&lt;/h2&gt;
&lt;p&gt;Wanneer een redactie klaagt dat ze de eigen stem van haar auteurs niet kan lezen, ligt een deel van het probleem misschien bij de redactie zelf.&lt;/p&gt;
&lt;p&gt;Dat is een zware beschuldiging, en er hoort een serieuze test bij. Zou &lt;em&gt;Progress in Human Geography&lt;/em&gt; een inzending in het Frans, Italiaans of Japans laten beoordelen, vergezeld van een machinevertaalde Engelse versie? De eigen richtlijnen van het tijdschrift erkennen de “vertaaldiensten” die dat mogelijk maken. Een ja maakt een einde aan het probleem. Een nee zou ons vertellen wat het beleid werkelijk beschermt.&lt;/p&gt;
&lt;p&gt;Hoe dan ook is de keuze aan de redactie. Als de stem er, zoals zij beweert, toe doet, dan moet het tijdschrift artikelen aannemen in de talen waarin auteurs denken. Zo niet, dan kan het verklaringsformulier de prullenmand in, en de dreigementen erbij.&lt;/p&gt;</description></item><item><title>tei-mcp v0.3: TEI coderen zonder de bron te herschrijven</title><link>https://clementgodbarge.com/nl/post/tei-mcp-span-locked/</link><pubDate>Tue, 05 May 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/tei-mcp-span-locked/</guid><description>&lt;p&gt;Toen ik
, was het doel te
voorkomen dat AI-assistenten TEI-markup hallucineren. Schemaverankering loste
een deel van het probleem op: met rechtstreekse, op tools gebaseerde toegang
tot de P5-specificatie hoeft het model niet langer te raden wat een element
betekent of welke attributen het aanvaardt. De uitvoer valideert.&lt;/p&gt;
&lt;p&gt;Maar hallucinatie heeft bij TEI-codering twee gezichten, en het schema vangt
er maar één van op. Validatie tegen de specificatie vertelt je dat de &lt;em&gt;markup&lt;/em&gt;
welgevormd is. Ze zegt niets over de &lt;em&gt;tekst&lt;/em&gt; die de markup omsluit. En juist
daar – in de tekst zelf – schuilen de schadelijkste hallucinaties.
Span-locked composition, het paradepaardje van v0.3, is speciaal ontworpen
om die te voorkomen.&lt;/p&gt;
&lt;details class="print:hidden xl:hidden" &gt;
&lt;summary&gt;Inhoudsopgave&lt;/summary&gt;
&lt;div class="text-sm"&gt;
&lt;nav id="TableOfContents"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#de-hallucinatie-die-het-schema-niet-kan-vangen"&gt;De hallucinatie die het schema niet kan vangen&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#span-locked-composition"&gt;Span-locked composition&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#wat-dit-is-en-wat-het-niet-is"&gt;Wat dit is, en wat het niet is&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#waarom-dit-verder-reikt-dan-tei"&gt;Waarom dit verder reikt dan TEI&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#de-update-ophalen"&gt;De update ophalen&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/nav&gt;
&lt;/div&gt;
&lt;/details&gt;
&lt;h2 id="de-hallucinatie-die-het-schema-niet-kan-vangen"&gt;De hallucinatie die het schema niet kan vangen&lt;/h2&gt;
&lt;p&gt;Vraag een model een zestiende-eeuwse Franse brief te coderen en je krijgt vaak
een TEI-document terug dat er onberispelijk uitziet. De header is ingevuld, de
&lt;code&gt;&amp;lt;persName&amp;gt;&lt;/code&gt;-tags staan op de juiste plaats, de &lt;code&gt;&amp;lt;dateline&amp;gt;&lt;/code&gt; is welgevormd. Haal
het door &lt;code&gt;validate_document&lt;/code&gt; en het slaagt.&lt;/p&gt;
&lt;p&gt;Vergelijk dan de lopende tekst met de bron.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;mesme&lt;/code&gt; is &lt;code&gt;même&lt;/code&gt; geworden. Een komma is verhuisd. &lt;code&gt;luy&lt;/code&gt; is stilzwijgend
gemoderniseerd tot &lt;code&gt;lui&lt;/code&gt;. Een zinsdeel dat in het handschrift moeilijk leesbaar
was, is “verbeterd” tot iets netters. Om geen van die wijzigingen is gevraagd.
Geen ervan wordt gemeld. Het document is schemageldig en in alle stilte fout.&lt;/p&gt;
&lt;p&gt;Voor een archivistische workflow – waarin de gecodeerde tekst de blijvende
versie wordt waarop latere lezers, zoekindexen en citaties vertrouwen – is dit
de faalwijze die er het meest toe doet. Een misvormde tag is vervelend. Een
gemoderniseerde spelling die vijf jaar lang niemand opmerkt, is een corruptie.&lt;/p&gt;
&lt;h2 id="span-locked-composition"&gt;Span-locked composition&lt;/h2&gt;
&lt;p&gt;De nieuwe versie (v0.3) bevat een mechanisme tegen hallucinaties dat precies
op deze faalwijze mikt. Het ontwerpdoel is hallucinaties in de lopende tekst
per constructie onmogelijk te maken, niet alleen onwaarschijnlijk.&lt;/p&gt;
&lt;p&gt;Het idee is eenvoudig: &lt;strong&gt;het model typt nooit lopende tekst&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;De workflow ziet er in plaats daarvan zo uit:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Het model roept &lt;code&gt;get_source(&amp;quot;letter_001&amp;quot;)&lt;/code&gt; aan en ontvangt de platte
brontekst als onveranderlijke string.&lt;/li&gt;
&lt;li&gt;Voor elke tag die het wil aanbrengen, roept het
&lt;code&gt;tag_span(&amp;quot;letter_001&amp;quot;, start, end, element_path, attrs)&lt;/code&gt; aan – het
registreert daarmee een TEI-element op een tekenbereik in de bron.&lt;/li&gt;
&lt;li&gt;Is het klaar, dan roept het &lt;code&gt;compose(&amp;quot;letter_001&amp;quot;)&lt;/code&gt; aan. De server vlecht
de geregistreerde tags door de oorspronkelijke platte tekst, rendert de
definitieve TEI en controleert vervolgens &lt;em&gt;byte voor byte&lt;/em&gt; of de platte
tekstinhoud van het gerenderde document gelijk is aan de bron.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Komen de bytes overeen, dan komt het document terug. Zo niet – als de tags van
het model op een of andere manier een lopende tekst impliceren die ook maar één
teken van de bron afwijkt – dan werpt &lt;code&gt;compose()&lt;/code&gt; een fout op in plaats van een
corrupt document terug te geven.&lt;/p&gt;
&lt;p&gt;Er is geen route door deze workflow waarlangs het model een TEI-document
produceert waarvan de lopende tekst van de bron afwijkt. De invariant is
mechanisch, niet gedragsmatig. Je hoeft er niet op te vertrouwen dat het model
niet hallucineert; je hoeft alleen te vertrouwen op een &lt;code&gt;==&lt;/code&gt;-vergelijking
tussen twee bytestrings.&lt;/p&gt;
&lt;h2 id="wat-dit-is-en-wat-het-niet-is"&gt;Wat dit is, en wat het niet is&lt;/h2&gt;
&lt;p&gt;Span-locked composition is een &lt;strong&gt;aanvulling&lt;/strong&gt; op schemaverankering, geen
vervanging ervan. De tools voor schemaverankering (&lt;code&gt;validate_document&lt;/code&gt;,
&lt;code&gt;lookup_element&lt;/code&gt;, &lt;code&gt;valid_children&lt;/code&gt; en de rest van de oorspronkelijke zestien)
helpen het model &lt;em&gt;geldige&lt;/em&gt; TEI te produceren. Span-locked composition
garandeert dat de lopende tekst binnen die TEI &lt;em&gt;trouw&lt;/em&gt; is aan de bron. Een
inzetbare codeerworkflow moet aan beide eisen voldoen, en nu dekt één server
ze allebei.&lt;/p&gt;
&lt;p&gt;Het is ook geen wondermiddel voor alles. &lt;code&gt;compose()&lt;/code&gt; controleert nog niet of
de geregistreerde tags toelaatbaar zijn volgens een geladen ODD-customisatie –
dat komt later. Geregistreerde tags leven in het procesgeheugen en overleven
een herstart niet. En de bronbestanden moeten leesbaar zijn vanaf de plek waar
de server draait. Dat valt allemaal op te lossen; niets ervan ondergraaft de
kerninvariant.&lt;/p&gt;
&lt;h2 id="waarom-dit-verder-reikt-dan-tei"&gt;Waarom dit verder reikt dan TEI&lt;/h2&gt;
&lt;p&gt;Het patroon laat zich veralgemenen. Telkens wanneer een model wordt gevraagd
een stuk tekst te annoteren, te transformeren of te omsluiten – en telkens
wanneer de integriteit van de onderliggende tekst zwaarder weegt dan het
vermogen van het model om die te “verbeteren” – past dezelfde vorm van
oplossing. Vraag het model niet de tekst over te typen. Vraag het instructies
over de tekst te produceren, en laat een deterministische composer die
toepassen onder een gelijkheidsinvariant.&lt;/p&gt;
&lt;p&gt;Voor digitale edities in het bijzonder verandert dit wat je een model
verantwoord kunt vragen. Coderen wordt ineens een taak die je kunt delegeren
zonder elke uitvoer handmatig met de bron te hoeven vergelijken. De machine
neemt de saaie weg; de editeur beoordeelt de markup, niet de spelling.&lt;/p&gt;
&lt;h2 id="de-update-ophalen"&gt;De update ophalen&lt;/h2&gt;
&lt;p&gt;Heb je tei-mcp al geïnstalleerd:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;uvx tei-mcp@latest
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Of bij een nieuwe installatie:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install tei-mcp
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Om span-locked composition te gebruiken, wijs je de server naar een map met
platte bronbestanden:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nb"&gt;export&lt;/span&gt; &lt;span class="nv"&gt;TEI_MCP_SPAN_SOURCE_ROOT&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;/path/to/sources
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;uvx tei-mcp
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;De naam van elk bestand (zonder extensie) wordt zijn document-ID
(&lt;code&gt;letter_001.txt&lt;/code&gt; → &lt;code&gt;letter_001&lt;/code&gt;).&lt;/p&gt;
&lt;p&gt;Broncode, volledige documentatie en de ontwerpnotities bij de invariant:
&lt;/p&gt;</description></item><item><title>Een ander soort digitale editie</title><link>https://clementgodbarge.com/nl/post/cavriana-edition/</link><pubDate>Tue, 24 Mar 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/cavriana-edition/</guid><description>&lt;p&gt;De meeste primaire bronnen worden nooit gepubliceerd. Het model waarop we vertrouwen om daar iets aan te doen – de gesubsidieerde digitale editie – is te duur, te gecentraliseerd en te kwetsbaar om op grote schaal te werken. Ik heb zojuist
gepubliceerd waarin ik uitleg waarom ik de kritische editie van Cavriana’s brieven anders opbouw: gedigitaliseerde primaire bronnen die organisch groeien, met minimale infrastructuur, geautomatiseerd onderhoud, open voor samenwerking, en zo goedkoop dat er niet eens subsidies voor nodig zijn. Het is een pleidooi voor een soort digital humanities dat werkt, met of zonder institutionele steun.&lt;/p&gt;</description></item><item><title>tei-mcp: TEI P5 voor AI-agents</title><link>https://clementgodbarge.com/nl/post/tei-mcp/</link><pubDate>Sun, 15 Mar 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/tei-mcp/</guid><description>&lt;p&gt;Wie ooit een AI-codeerassistent TEI-XML heeft laten schrijven, heeft het vast
gemerkt: het gaat mis. Elementen duiken op waar ze niet horen. Attributen worden
verzonnen. Nestingregels worden genegeerd. Het model heeft een ruw idee van hoe
TEI eruitziet, maar geen betrouwbare kennis van de specificatie.&lt;/p&gt;
&lt;p&gt;tei-mcp lost dat op door AI-agents rechtstreeks, via tools, toegang te geven tot
de TEI P5 Guidelines.&lt;/p&gt;
&lt;details class="print:hidden xl:hidden" &gt;
&lt;summary&gt;Inhoudsopgave&lt;/summary&gt;
&lt;div class="text-sm"&gt;
&lt;nav id="TableOfContents"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#wat-is-mcp"&gt;Wat is MCP?&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#wat-tei-mcp-doet"&gt;Wat tei-mcp doet&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#waarom-het-ertoe-doet"&gt;Waarom het ertoe doet&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#aan-de-slag"&gt;Aan de slag&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/nav&gt;
&lt;/div&gt;
&lt;/details&gt;
&lt;h2 id="wat-is-mcp"&gt;Wat is MCP?&lt;/h2&gt;
&lt;p&gt;Het
(MCP) is een open
standaard waarmee AI-toepassingen verbinding kunnen maken met externe gegevensbronnen
en tools. Zie het als een USB-poort voor AI: één protocol waarmee elke compatibele
client – Claude, Cursor, Windsurf en andere – op gespecialiseerde diensten kan
aansluiten.&lt;/p&gt;
&lt;p&gt;Een MCP-server stelt &lt;em&gt;tools&lt;/em&gt; beschikbaar die de AI tijdens een gesprek kan aanroepen.
In plaats van te vertrouwen op uit het hoofd geleerde trainingsdata kan het model
een actuele, gezaghebbende bron bevragen.&lt;/p&gt;
&lt;h2 id="wat-tei-mcp-doet"&gt;Wat tei-mcp doet&lt;/h2&gt;
&lt;p&gt;tei-mcp parseert de ODD-specificatie van TEI P5 en biedt 16 tools aan die de meest
voorkomende vragen van een editeur of encoder beantwoorden:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Wat is dit element?&lt;/strong&gt; Zoek elk element, elke klasse, macro of module op naam
op, hoofdletterongevoelig en met suggesties bij tikfouten.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Welke attributen neemt het?&lt;/strong&gt; Los attributen op over de hele klassenhiërarchie
– eerst de lokale, dan de geërfde, in volgorde.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Wat mag erin?&lt;/strong&gt; Klap inhoudsmodellen uit tot gestructureerde bomen, of vraag
een platte lijst van geldige kinderen op.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Mag dit element hier staan?&lt;/strong&gt; Controleer de nesting van ouder en kind, of volg
de bereikbaarheid door de volledige elementenhiërarchie.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Is mijn document geldig?&lt;/strong&gt; Valideer een TEI-XML-bestand tegen de specificatie:
inhoudsmodellen, attribuutwaarden, gesloten waardelijsten, referentie-integriteit
en waarschuwingen bij verouderde elementen.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;En mijn projectschema?&lt;/strong&gt; Laad een ODD-customisatiebestand om dit alles te
beperken tot de specifieke TEI-deelverzameling van je project.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="waarom-het-ertoe-doet"&gt;Waarom het ertoe doet&lt;/h2&gt;
&lt;p&gt;TEI-codering vereist dat je voortdurend de Guidelines raadpleegt. Ervaren encoders
kennen de gangbaarste patronen uit het hoofd, maar zelfs zij moeten de specificatie
erbij nemen voor minder vertrouwde elementen of ingewikkelde inhoudsmodellen. Voor
AI-assistenten, die zulke verinnerlijkte kennis niet hebben, is het probleem erger:
ze hallucineren markup die er plausibel uitziet maar niet klopt.&lt;/p&gt;
&lt;p&gt;Met tei-mcp hoeft de AI niet te gokken. Het kan het antwoord in de specificatie
opzoeken voordat het één punthaak schrijft. Het resultaat is markup die voldoet
aan TEI P5 – of aan de ODD-customisatie van je project.&lt;/p&gt;
&lt;h2 id="aan-de-slag"&gt;Aan de slag&lt;/h2&gt;
&lt;p&gt;Installeer vanaf PyPI:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install tei-mcp
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Voeg de server daarna toe aan de configuratie van je MCP-client:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-json" data-lang="json"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;mcpServers&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;tei&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;command&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;uvx&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;args&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;tei-mcp&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;De server downloadt de TEI-specificatie bij de eerste start en werkt met elke
MCP-compatibele client.&lt;/p&gt;
&lt;p&gt;Broncode en volledige documentatie:
&lt;/p&gt;</description></item><item><title>Binaire codering onderwijzen met de ITA2-telegraafemulator</title><link>https://clementgodbarge.com/nl/post/baudot/</link><pubDate>Thu, 13 Feb 2025 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/baudot/</guid><description>&lt;h2 id="abstracte-begrippen-tastbaar-maken"&gt;Abstracte begrippen tastbaar maken&lt;/h2&gt;
&lt;p&gt;Deze ITA2-emulator is een praktisch hulpmiddel voor de les. Door abstracte coderingsbegrippen zichtbaar en interactief te maken, laat hij studenten kennismaken met een kernbegrip uit de informatica en de telecommunicatie: de binaire voorstelling – hoe tekst verandert in patronen van enen en nullen.
Meestal onderwijzen we dat abstract; wie de gaatjes daadwerkelijk ziet verschijnen, begrijpt beter hoe een fysiek systeem digitale informatie kan weergeven.
&lt;div class="baudot-emulator"&gt;
&lt;h2&gt;ITA2 (Baudot-Murray) Telegraph Type Emulator&lt;/h2&gt;
&lt;p&gt;Type a word in the input below to see its representation on the ITA2 tape.&lt;/p&gt;
&lt;div class="baudot-controls"&gt;
&lt;label for="baudot-input"&gt;Type word:&lt;/label&gt;
&lt;input id="baudot-input" class="text-input" size="50" maxlength="50" /&gt;
&lt;button type="button" id="baudot-ltr-button" class="control-button active"&gt;LTR&lt;/button&gt;
&lt;button type="button" id="baudot-fig-button" class="control-button"&gt;FIG&lt;/button&gt;
&lt;/div&gt;
&lt;div class="tape-outer-container"&gt;
&lt;div class="tape-container"&gt;
&lt;table&gt;
&lt;tbody id="baudot-tape"&gt;&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;style&gt;
.baudot-emulator {
--light-color: #f3f4f6;
--dark-color: #1f2937;
--light-alt-color: #e5e7eb;
--dark-alt-color: #374151;
font-family: -apple-system, BlinkMacSystemFont, 'Segoe UI', Roboto, Oxygen-Sans, Ubuntu, Cantarell, 'Helvetica Neue', sans-serif;
max-width: 100%;
margin: 2rem 0;
padding: 0;
box-sizing: border-box;
}
.baudot-emulator {
--tape-bg: var(--light-color);
--hole-bg: var(--light-color);
--hole-border: #d1d5db;
--punched-bg: var(--dark-color);
--punched-border: var(--dark-color);
--sprocket-bg: var(--light-color);
--sprocket-border: #9ca3af;
--button-bg: var(--light-color);
--button-bg-active: #d1d5db;
--button-text: var(--dark-color);
--button-border: #d1d5db;
--input-bg: white;
--input-border: #d1d5db;
--input-text: var(--dark-color);
--line-number: #6b7280;
}
html.dark .baudot-emulator,
html[data-theme='dark'] .baudot-emulator,
body.dark .baudot-emulator {
--tape-bg: var(--dark-alt-color);
--hole-bg: var(--dark-alt-color);
--hole-border: #4b5563;
--punched-bg: var(--light-color);
--punched-border: var(--light-color);
--sprocket-bg: var(--dark-alt-color);
--sprocket-border: #9ca3af;
--button-bg: var(--dark-alt-color);
--button-bg-active: #4b5563;
--button-text: var(--light-color);
--button-border: #4b5563;
--input-bg: var(--dark-alt-color);
--input-border: #4b5563;
--input-text: var(--light-color);
--line-number: #9ca3af;
}
.baudot-controls {
margin-bottom: 1.5rem;
display: flex;
flex-wrap: wrap;
align-items: center;
gap: 0.5rem;
}
.baudot-emulator .text-input {
flex: 1;
min-width: 200px;
padding: 0.5rem;
font-size: 1rem;
border: 1px solid var(--input-border);
border-radius: 4px;
background: var(--input-bg);
color: var(--input-text);
}
.baudot-emulator .control-button {
padding: 0.5rem 1rem;
background: var(--button-bg);
color: var(--button-text);
border: 1px solid var(--button-border);
border-radius: 4px;
cursor: pointer;
font-size: 0.9rem;
}
.baudot-emulator .control-button.active {
background: var(--button-bg-active);
font-weight: bold;
}
.tape-outer-container {
padding: 0;
margin-bottom: 1.5rem;
border-radius: 4px;
overflow: hidden;
}
.tape-container {
width: 100%;
overflow-x: auto;
background: var(--tape-bg);
padding: 1rem 0.5rem;
}
.baudot-emulator table {
border-collapse: collapse;
width: 100%;
table-layout: fixed;
border: none;
}
.baudot-emulator tr {
height: 24px;
border: none;
}
.baudot-emulator td {
border: none;
padding: 0;
}
.baudot-emulator .line-number {
width: 20px;
text-align: center;
color: var(--line-number);
font-size: 0.8rem;
padding: 0 8px 0 0;
font-weight: bold;
}
.baudot-emulator .cell {
position: relative;
width: 20px;
height: 20px;
}
.baudot-emulator .cell-content {
position: absolute;
top: 50%;
left: 50%;
transform: translate(-50%, -50%);
width: 12px;
height: 12px;
border-radius: 50%;
background: var(--hole-bg);
border: 1px solid var(--hole-border);
}
.baudot-emulator .punched .cell-content {
background: var(--punched-bg);
border: 1px solid var(--punched-border);
}
.baudot-emulator .sprocket-hole {
position: absolute;
left: 50%;
top: 100%;
transform: translate(-50%, -50%);
width: 4px;
height: 4px;
border-radius: 50%;
background: var(--sprocket-bg);
border: 1px solid var(--sprocket-border);
z-index: 2;
}
&lt;/style&gt;
&lt;script&gt;
document.addEventListener('DOMContentLoaded', function() {
initBaudotEmulator();
});
function initBaudotEmulator() {
if (!document.getElementById('baudot-input')) return;
const textInput = document.getElementById('baudot-input');
const tape = document.getElementById('baudot-tape');
const ltrButton = document.getElementById('baudot-ltr-button');
const figButton = document.getElementById('baudot-fig-button');
const ita2Code = {
'A': '00011', 'B': '11001', 'C': '01110', 'D': '01001', 'E': '00001',
'F': '01101', 'G': '11010', 'H': '10100', 'I': '00110', 'J': '01011',
'K': '01111', 'L': '10010', 'M': '11100', 'N': '01100', 'O': '11000',
'P': '10110', 'Q': '10111', 'R': '01010', 'S': '00101', 'T': '10000',
'U': '00111', 'V': '11110', 'W': '10011', 'X': '11101', 'Y': '10101',
'Z': '10001',
'1': '00011', '2': '11001', '3': '01110', '4': '01001', '5': '00001',
'6': '01101', '7': '11010', '8': '10100', '9': '01011', '0': '11000',
'-': '00011', '?': '00100', ':': '01010', '(': '11000', ')': '11101',
'.': '01000', ',': '00010', "'": '10001', '=': '01111', '/': '10011',
'+': '11011', ' ': '00100',
'FIG': '11011', 'LTR': '11111',
};
function generateTape() {
let rows = '';
for (let row = 0; row &lt; 5; row++) {
rows += '&lt;tr&gt;';
rows += `&lt;td class="line-number"&gt;${row + 1}&lt;/td&gt;`;
for (let col = 0; col &lt; 50; col++) {
rows += `&lt;td id="baudot_${row}_${col}" class="cell unpunched"&gt;
&lt;div class="cell-content"&gt;&lt;/div&gt;
${row === 2 ? '&lt;div class="sprocket-hole"&gt;&lt;/div&gt;' : ''}
&lt;/td&gt;`;
}
rows += '&lt;/tr&gt;';
}
tape.innerHTML = rows;
}
function updateITA2Code(word) {
clearTape();
word = word.toUpperCase();
let tapePosition = 0;
let currentCharType = 'LTR';
ltrButton.classList.add('active');
figButton.classList.remove('active');
for (let i = 0; i &lt; word.length; i++) {
const char = word[i];
let code = ita2Code[char] || ita2Code[' '];
let requiredCharType = /[A-Z ]/.test(char) ? 'LTR' : 'FIG';
if (requiredCharType !== currentCharType) {
const shiftCode = requiredCharType === 'LTR' ? ita2Code['LTR'] : ita2Code['FIG'];
punchTape(shiftCode, tapePosition++);
currentCharType = requiredCharType;
ltrButton.classList.toggle('active', currentCharType === 'LTR');
figButton.classList.toggle('active', currentCharType === 'FIG');
}
punchTape(code, tapePosition++);
}
}
function punchTape(code, tapePosition) {
if (tapePosition &gt;= 50) return;
for (let bit = 0; bit &lt; 5; bit++) {
const cell = document.getElementById(`baudot_${bit}_${tapePosition}`);
if (cell) {
cell.className = code[bit] === '1' ? 'cell punched' : 'cell unpunched';
}
}
}
function clearTape() {
for (let i = 0; i &lt; 50; i++) {
for (let bit = 0; bit &lt; 5; bit++) {
const cell = document.getElementById(`baudot_${bit}_${i}`);
if (cell) {
cell.className = 'cell unpunched';
}
}
}
}
generateTape();
textInput.addEventListener('input', function() {
updateITA2Code(this.value);
});
ltrButton.addEventListener('click', function() {
this.classList.add('active');
figButton.classList.remove('active');
if (textInput.value) {
updateITA2Code(textInput.value);
}
});
figButton.addEventListener('click', function() {
this.classList.add('active');
ltrButton.classList.remove('active');
if (textInput.value) {
updateITA2Code(textInput.value);
}
});
if (textInput.value) {
updateITA2Code(textInput.value);
}
}
&lt;/script&gt;
&lt;/div&gt;
&lt;/p&gt;
&lt;h2 id="historische-context-van-telegraaf-tot-computer"&gt;Historische context: van telegraaf tot computer&lt;/h2&gt;
&lt;p&gt;De ITA2-code (International Telegraph Alphabet No. 2), ook bekend als de Baudot-Murray-code, werd in de jaren twintig van de vorige eeuw ontwikkeld als verfijning van de oorspronkelijke telegraafcode van Émile Baudot uit de jaren 1870. Deze vroege telecommunicatiesystemen hebben de latere ontwikkeling van de computer rechtstreeks beïnvloed:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;De vijfbitscodering was een vroeg voorbeeld van tekencodering&lt;/li&gt;
&lt;li&gt;De beperkte tekenset (met vijf bits zijn maar 32 combinaties mogelijk) leidde tot het vernuftige LETTERS/FIGURES-schakelmechanisme&lt;/li&gt;
&lt;li&gt;Het systeem bleef tot ver in de twintigste eeuw in gebruik voor telexapparaten&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="toestandsmachines-leren-door-te-spelen"&gt;Toestandsmachines leren door te spelen&lt;/h2&gt;
&lt;p&gt;Het LETTERS/FIGURES-schakelmechanisme is een natuurlijke inleiding tot toestandsmachines. Studenten ontdekken al experimenterend dat hetzelfde patroon verschillende tekens kan voorstellen, afhankelijk van de actieve modus. Wie zo hands-on ervaring opdoet met toestandsafhankelijke codering, is beter voorbereid op ingewikkelder concepten uit de informatica.
Het bitpatroon &lt;code&gt;00011&lt;/code&gt; staat bijvoorbeeld voor:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;de letter ‘A’ in de LETTERS-modus&lt;/li&gt;
&lt;li&gt;het cijfer ‘1’ in de FIGURES-modus
Deze dubbele lezing, afhankelijk van de toestand, ligt aan de basis van hoe computers met gegevens omgaan.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="lesactiviteiten"&gt;Lesactiviteiten&lt;/h2&gt;
&lt;p&gt;Enkele manieren om de ITA2-emulator in het onderwijs in te zetten:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;Codekraken&lt;/strong&gt;: laat studenten berichten ontcijferen die als ITA2-patronen zijn gecodeerd&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Zuinig coderen&lt;/strong&gt;: bespreek waarom het schakelmechanisme belangrijk was om bandbreedte te sparen&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Evolutie van de codering&lt;/strong&gt;: vergelijk de vijfbitscode van ITA2 met ASCII (7 bits) en Unicode&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Physical computing&lt;/strong&gt;: leg het verband tussen dit historische systeem en moderne microcontrollers zoals Arduino&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="winst-voor-de-toegankelijkheid"&gt;Winst voor de toegankelijkheid&lt;/h2&gt;
&lt;p&gt;Los van het historische belang komt deze aanpak tegemoet aan uiteenlopende leerstijlen:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;visueel ingestelde studenten zien de patronen&lt;/li&gt;
&lt;li&gt;wie al doende leert, grijpt rechtstreeks in het coderingsproces in&lt;/li&gt;
&lt;li&gt;conceptuele denkers kunnen de wiskundige kant van de informatietheorie verkennen&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="technische-details"&gt;Technische details&lt;/h2&gt;
&lt;p&gt;De emulator is geschreven in JavaScript en laat zich eenvoudig in elk webgebaseerd leerplatform inbouwen. De code is modulair en kan aan verschillende onderwijscontexten worden aangepast.
De broncode vind je hier, en je kunt de emulator er meteen zelf uitproberen:
&lt;/p&gt;</description></item><item><title>Een perceptuele geografie van de Levante</title><link>https://clementgodbarge.com/nl/post/levante/</link><pubDate>Sat, 29 Oct 2022 10:02:52 -0500</pubDate><guid>https://clementgodbarge.com/nl/post/levante/</guid><description>&lt;h1 id="inleiding"&gt;Inleiding&lt;/h1&gt;
&lt;p&gt;De &lt;em&gt;Levante&lt;/em&gt; is een ongrijpbare plek. Doorgaans gedefinieerd in relatie tot – of in tegenstelling tot – een ander gebied, heeft de term zelden een vaste betekenis gehad: naargelang van waar en wanneer hij werd gebruikt, riep hij andere geografieën op. Maar al valt een objectieve en precieze definitie moeilijk te formuleren, men kan toch hopen een subjectieve kaart van die regio te tekenen, op basis van de correlaties die binnen een bepaald tekstcorpus bestaan. Met andere woorden: welke ruimte kon de &lt;em&gt;Levante&lt;/em&gt; voor een specifieke groep lezers oproepen?&lt;br&gt;
In dit bericht laat ik zien hoe je met gegevens uit de
van het Medici Archive Project
de specifieke plaatsen kunt visualiseren waarmee het toponiem werd geassocieerd.&lt;/p&gt;
&lt;h1 id="de-mia-database"&gt;De MIA-database&lt;/h1&gt;
&lt;p&gt;De MIA-database is een samenwerkingsplatform voor onderzoekers die hun eigen foto&amp;rsquo;s van archiefmateriaal uit het
willen uploaden en delen. Het afgelopen jaar heeft ons team, met steun van het
, duizenden documenten uit de &lt;em&gt;avvisi&lt;/em&gt;-afdeling van het archief &lt;em&gt;Mediceo del Principato&lt;/em&gt; in Florence gefotografeerd, getranscribeerd, samengevat en geclassificeerd. Onze database was weliswaar niet in de eerste plaats voor statistische analyse bedoeld, maar de metadata die we beschikbaar hebben gesteld, kunnen wel worden gedownload en als dataset worden gebruikt.&lt;/p&gt;
&lt;h1 id="de-dataset"&gt;De dataset&lt;/h1&gt;
&lt;p&gt;De dataset die ik in dit geval heb aangemaakt, omvat alle nieuwsberichten uit de &lt;em&gt;Levante&lt;/em&gt; van 1543 tot 1566, dat wil zeggen van de eerste in het archief geregistreerde avviso tot het sterfjaar van sultan
. Hier is een staaltje van de gegevens die ik van de server heb gehaald. Ze bestaan uit drie kolommen: een uniek documentnummer, een plaatsnaam en een datum.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-csv" data-lang="csv"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386 Malta / Europe / World / Top of the TGN hierarchy 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386 Modon / Messinias&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt; Nomos / Peloponnisos / Ellas 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386 Al-Iskandariyah / Muhafazat al Iskandariyah / Egypt / Africa 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386 Evvoia / Evvoias&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt; Nomos / Sterea Ellas-Evvoia / Ellas 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386 Venetian Republic / Italia / Europe / World 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386 Arsenale / Istanbul / Istanbul / Marmara 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386 Black Sea / Asia / World / Top of the TGN hierarchy 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389 Otranto / Lecce / Puglia / Italia 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389 Nisoi Aiyaiou / Ellas / Europe / World 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389 Malta / Europe / World / Top of the TGN hierarchy 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389 Buda / Budapest / Budapest / Magyarorszag 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389 Al-Iskandariyah / Muhafazat al Iskandariyah / Egypt / Africa 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389 Kipros / Asia / World / Top of the TGN hierarchy 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389 Rodhos / Rodos&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt; Nisos / Sporadhes / Nisoi Aiyaiou 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389 Arsenale / Istanbul / Istanbul / Marmara 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389 Çorlu / Thraki / Ellas / Europe 1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="de-gegevens-opschonen"&gt;De gegevens opschonen&lt;/h2&gt;
&lt;p&gt;Om deze gegevens te visualiseren, moeten we ze leesbaar maken als csv-dataset (comma separated values). Ook moeten we de geografische informatie omzetten in een “machinevriendelijker” formaat: gps-coördinaten. Omdat de dataset honderden regels telt, automatiseren we dat liever. Dat kan vrij snel en behoorlijk nauwkeurig met voorgetrainde taalmodellen als
,
of
, om er maar een paar te noemen. De operatie vraagt wel om nauwlettend toezicht, want voorgetrainde taalmodellen hebben een lichte neiging tot hallucineren.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-csv" data-lang="csv"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;documentId&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;latitude&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;longitude&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;documentDate&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;35.899167&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;14.514167&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;37.05&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;22.116667&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;31.200028&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;29.918719&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;38.366667&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;23.666667&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;45.438333&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;12.331333&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;41.018611&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;28.984444&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57386&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;42.7&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;18.8&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;40.216667&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;18.166667&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;37.966667&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;23.716667&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;35.899167&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;14.514167&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;47.4925&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;19.051389&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;31.200028&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;29.918719&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;34.916667&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;33.616667&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;36.405419&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;28.227778&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;41.018611&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;28.984444&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;57389&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;41.133333&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;27.416667&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s"&gt;1565-1-3&lt;/span&gt;&lt;span class="p"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h1 id="de-dichtheidskaart"&gt;De dichtheidskaart.&lt;/h1&gt;
&lt;p&gt;Een dichtheidskaart is een visualisatie die laat zien hoe vaak een plaats in een bepaalde dataset wordt genoemd. Dat is bijzonder nuttig om niet alleen de geografische reikwijdte van je gegevens te begrijpen, maar ook hun brandpunten. Welke plaatsen op de kaart worden vaker genoemd? En welke slechts af en toe? Waar liggen de centra, en hoe ver reikt de periferie? Waar op de kaart richt de aandacht van een lezer zich het waarschijnlijkst?&lt;/p&gt;
&lt;iframe width='100%' height='600px' src="https://api.mapbox.com/styles/v1/clemclem/cl9q7c77p004y14mqytjrfnex.html?title=false&amp;access_token=pk.eyJ1IjoiY2xlbWNsZW0iLCJhIjoiY2lmbGpvbjMwZjh3NnJ5bHg4ZzkzeWZzeCJ9.IgOF4fphVbsWAIKyzAV-DQ&amp;zoomwheel=false#3.83/43.29/33.61" title="Levante" style="border:none;"&gt;&lt;/iframe&gt;
&lt;p&gt;Voor dit experiment – en omdat ik haast had – gebruikte ik een van de API&amp;rsquo;s van
. Maar ook heel wat visualisatiebibliotheken en geografische informatiesystemen laten je hetzelfde soort dichtheidskaart maken.&lt;/p&gt;
&lt;h1 id="enkele-observaties"&gt;Enkele observaties&lt;/h1&gt;
&lt;p&gt;Het resultaat is eerder een impressionistisch tableau dan de nauwkeurige weergave van een scherp omlijnd begrip, en dat is precies wat me aan dit experiment bevalt.
&lt;mark&gt;Datawetenschap kan immers een machtige bondgenoot van de geesteswetenschappen zijn, maar dat betekent nog niet dat we ons aan haar regels moeten houden.&lt;/mark&gt;
&lt;/p&gt;
&lt;p&gt;Een ander interessant aspect van dit experiment is dat de kaart een &lt;em&gt;Levante&lt;/em&gt; laat zien die volledig verweven is met de rest van Europa en de Middellandse Zee. Ook wordt duidelijk hoe centraal Edirne stond in de politieke geografie van het Ottomaanse Rijk. Bovendien is de belangrijkste Spaanse stad op de kaart Madrid noch het Escorial, maar Napels. En last but not least lijken eilanden en kleine stadstaten als Ragusa een belangrijke bemiddelende rol te hebben gespeeld tussen de verschillende mogendheden in de regio.&lt;/p&gt;
&lt;h1 id="gegevens-opvragen-bij-mia"&gt;Gegevens opvragen bij MIA&lt;/h1&gt;
&lt;p&gt;MIA is weliswaar een uitstekend samenwerkingsinstrument voor onderzoekers, maar de gegevens op zijn servers zijn niet gemakkelijk toegankelijk. De back-end is bijvoorbeeld niet in openbare repository&amp;rsquo;s gepubliceerd. Toch kun je de gegevens bemachtigen door je bij MIA te registreren en met Python verzoeken naar de server te sturen.&lt;/p&gt;
&lt;h3 id="verzoek"&gt;Verzoek&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;url&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;https://mia.medici.org/Mia/json/de/advancedsearch/advancedSearchResults/0/90/docYear/asc/?isNewsFeedSearch=False&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;payload&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;searchSection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;archivalLocationSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;type&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;archivalLocationAdvancedSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;isActiveFilter&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;True&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;repository&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;None&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;collection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;Mediceo del Principato&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;series&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;None&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;volume&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;2863&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;insert&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;None&lt;/span&gt;&lt;span class="p"&gt;},{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;searchSection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;categoryAndTypologySearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;type&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;categoryAndTypologyAdvancedSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;isActiveFilter&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;True&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;category&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;News&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;typology&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;None&lt;/span&gt;&lt;span class="p"&gt;},{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;searchSection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;transcriptionSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;type&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;transcriptionAdvancedSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;isActiveFilter&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;False&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;transcription&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;},{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;isActiveFilter&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;False&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;searchSection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;synopsisSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;type&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;synopsisAdvancedSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;synopsis&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;},{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;searchSection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;placesSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;type&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;placesAdvancedSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;isActiveFilter&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;False&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;places&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:[]},{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;searchSection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;peopleSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;type&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;peopleAdvancedSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;isActiveFilter&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;False&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;people&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:[]},{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;searchSection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;topicsSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;type&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;topicsAdvancedSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;isActiveFilter&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;True&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;topics&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:[{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;topicTitle&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;Place Index&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;topicId&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;51&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;placeAllId&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;}]},{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;searchSection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;dateSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;type&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;dateAdvancedSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;isActiveFilter&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;False&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;dateFilterType&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;dateYear&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;dateMonth&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;dateDay&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;dateBYear&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;dateBMonth&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;dateBDay&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;},{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;searchSection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;documentOwnerSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;type&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;documentOwnerAdvancedSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;isActiveFilter&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;False&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;editType&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;owner&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;account&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;},{&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;searchSection&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;languagesSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;type&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;languagesAdvancedSearch&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;isActiveFilter&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="kc"&gt;False&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;languages&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:[]}]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;headers&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;Content-type&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;application/json&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;Accept&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;*/*&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;r&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;post&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;url&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;data&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;json&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;dumps&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;payload&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="n"&gt;headers&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;headers&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;auth&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;LOGIN&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;PASSWORD&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Vervang LOGIN en PASSWORD wel door je eigen inloggegevens.&lt;/p&gt;
&lt;h3 id="antwoord-naar-een-bestand-schrijven"&gt;Antwoord naar een bestand schrijven&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;with&lt;/span&gt; &lt;span class="nb"&gt;open&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;response.json&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;wb&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;fd&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;chunk&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;r&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;iter_content&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;chunk_size&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;128&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;fd&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;write&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;chunk&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="json-openen"&gt;JSON openen&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;f&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nb"&gt;open&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;response.json&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;encoding&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;utf8&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="json-object-als-dictionary-teruggeven"&gt;JSON-object als dictionary teruggeven&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;json_complete&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;json&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;load&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="gegevens-uit-de-json-selecteren-en-in-csv-formaat-wegschrijven"&gt;Gegevens uit de JSON selecteren en in csv-formaat wegschrijven&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;with&lt;/span&gt; &lt;span class="nb"&gt;open&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;results.csv&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;w&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;newline&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;csvfile&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;fieldnames&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;documentId&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;placeCited&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;documentDate&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;writer&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;csv&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;DictWriter&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;csvfile&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;fieldnames&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;fieldnames&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;writer&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;writeheader&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;i&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;json_complete&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;data&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;i&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;topics&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt; &lt;span class="o"&gt;!=&lt;/span&gt; &lt;span class="kc"&gt;None&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;x&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;i&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;topics&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;documentId&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;x&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;documentId&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;placeCited&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;x&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;topicPlaceName&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;year&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;i&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;date&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;][&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;docYear&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;month&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;i&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;date&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;][&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;docMonth&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;day&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;i&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;date&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;][&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;docDay&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;documentDate&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="nb"&gt;str&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;year&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;-&amp;#34;&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="nb"&gt;str&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;month&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="o"&gt;+&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;-&amp;#34;&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="nb"&gt;str&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;day&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;writer&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;writerow&lt;/span&gt;&lt;span class="p"&gt;({&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;documentId&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;documentId&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;placeCited&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;placeCited&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;documentDate&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;documentDate&lt;/span&gt;&lt;span class="p"&gt;})&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Zodra je het bestand &lt;code&gt;results.csv&lt;/code&gt; hebt gedownload, kun je de gegevens opschonen zoals hierboven beschreven.&lt;/p&gt;</description></item><item><title>Grootschalig bibliografisch parsen met voorgetrainde taalmodellen</title><link>https://clementgodbarge.com/nl/post/bibliography/</link><pubDate>Thu, 07 Jul 2022 19:04:14 +0200</pubDate><guid>https://clementgodbarge.com/nl/post/bibliography/</guid><description>&lt;p&gt;Automatisering is de sleutel om de kosten van projecten in de digital humanities te drukken. Tot op heden werden de repetitieve en saaie klussen die bij editoriaal werk in academische kringen komen kijken, ofwel tegen hoge kosten verricht door overbelaste onderzoekers, ofwel “uitbesteed” aan studenten. In deze
betoog ik dat de meeste van die ondankbare taken niet alleen &lt;em&gt;kunnen&lt;/em&gt;, maar ook &lt;em&gt;moeten&lt;/em&gt; worden geautomatiseerd. Automatisering van editoriale taken drukt de totale kosten van projecten in de digital humanities. En wat vooral telt: ze stelt onderzoekers uit armere regio&amp;rsquo;s in staat om waardevolle documenten snel en betaalbaar te publiceren.&lt;/p&gt;
&lt;p&gt;In
heb ik bijvoorbeeld laten zien hoe voorgetrainde taalmodellen het grootste deel van het XML-labelwerk van een digitale editie voor hun rekening kunnen nemen.&lt;/p&gt;
&lt;p&gt;In dit bericht geef ik een tweede voorbeeld, ditmaal met bibliografie.&lt;/p&gt;
&lt;h2 id="het-probleem"&gt;Het probleem&lt;/h2&gt;
&lt;p&gt;Een bibliografische database aanleggen op basis van de verwijzingen in een wetenschappelijk artikel is vrij eenvoudig. Je zoekt even in een catalogus als
, downloadt de verwijzing in een bepaald formaat, of importeert ze automatisch uit een lokale database. Met een of twee artikelen werkt dat prima.
Boven een bepaald aantal verwijzingen wordt de klus echter afstompend en tijdrovend. Om daar iets aan te doen kun je parsingalgoritmen als
gebruiken. Maar zulke algoritmes laten zich moeilijk opschalen.
Toen ik anystyle inzette om de meer dan 150 wetenschappelijke essays van onze
om te zetten, stapelden de fouten zich op tot een onbeheersbare berg. Het herkende veel van onze bronnen niet goed – zo zag het de lange titels van vroegmoderne boeken voor iets anders aan – en het struikelde over minder gangbare documenten, zoals specifieke webpagina&amp;rsquo;s, onlinevideo&amp;rsquo;s enzovoort. Parsers werken goed, mits de auteur zich strikt houdt aan de regels van een bekende conventie als Chicago, Turabian of MLA. Elke afwijking van de norm levert fouten op.&lt;/p&gt;
&lt;h2 id="de-oplossing"&gt;De oplossing&lt;/h2&gt;
&lt;p&gt;Hier kunnen
&lt;mark&gt;voorgetrainde taalmodellen&lt;/mark&gt;
uitkomst bieden: ze
&lt;mark&gt;doorgronden razendsnel de patronen van welke bibliografische stijl dan ook&lt;/mark&gt;
, zelfs een die je zelf hebt bedacht, en hebben maar een handvol voorbeelden nodig om grote hoeveelheden opgemaakte bibliografie correct om te zetten in een
.&lt;/p&gt;
&lt;p&gt;Begin 2021 had ik het geluk vroegtijdig toegang te krijgen tot
van OpenAI. Codex is een model waarmee je natuurlijke taal naar code vertaalt en omgekeerd. Volgens OpenAI beheerst het meer dan een dozijn programmeertalen, en hoewel de API op het moment dat ik dit schrijf nog als bètaversie beschikbaar is, draait er al populaire software op, zoals GitHubs
.&lt;/p&gt;
&lt;p&gt;Na wat experimenteren met deze API merkte ik dat ze ook uitstekend overweg kan met eenvoudiger code zoals &lt;code&gt;BibTeX&lt;/code&gt;.&lt;/p&gt;
&lt;p&gt;Sterker nog: vier voorbeelden in de invoerprompt volstonden om het betrouwbaar te laten werken.&lt;/p&gt;
&lt;h3 id="invoerprompt"&gt;Invoerprompt&lt;/h3&gt;
&lt;p&gt;References:
Bayle, Ariane. “Patients exemplaires: la correspondance médicale de Fioravanti.” In &lt;em&gt;Vulgariser la médecine. Du style médical en France et en Italie&lt;/em&gt;, edited by Andrea Carlino and Michel Jeanneret, 181–212. Geneva: Droz, 2009.&lt;/p&gt;
&lt;p&gt;Berns, Andrew D. &lt;em&gt;The Bible and Natural Philosophy in Renaissance Italy: Jewish and Christian Physicians in Search of Truth&lt;/em&gt;. Cambridge: Cambridge University Press, 2015.&lt;/p&gt;
&lt;p&gt;Gabler, Hans Walter. “Theorizing the Digital Scholarly Edition.” &lt;em&gt;Literature Compass&lt;/em&gt; 7, no. 2 (2010): 43–56.
.&lt;/p&gt;
&lt;p&gt;Findlen, Paula. &lt;em&gt;Possessing Nature: Museums, Collecting, and Scientific Culture in Early Modern Italy&lt;/em&gt;. Berkeley: University of California Press, 1994.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-BibTeX" data-lang="BibTeX"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@incollection&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;bayle2009&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Bayle, Ariane}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;booktitle&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Vulgariser la médecine. Du style médical en France et en Italie}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Patients exemplaires: la correspondance médicale de Fioravanti}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;editor&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Carlino, Andrea and Michel Jeanneret}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;year&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2009}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Geneva}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;publisher&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Droz}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{french}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@book&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;berns2015&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{The Bible and Natural Philosophy in Renaissance Italy: Jewish and Christian Physicians in Search of Truth}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Berns, Andrew D.}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Cambridge}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;publisher&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Cambridge University Press}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{english}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;date&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2015}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@article&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;gabler2010&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Gabler, Hans Walter}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Theorizing the Digital Scholarly Edition}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;journal&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Literature Compass}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;volume&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{7}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;number&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;pages&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{43-56}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;doi&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{10.1111/j.1741-4113.2009.00675.x}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{english}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;year&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2010}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@book&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;findlen1994&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Possessing Nature: Museums, Collecting, and Scientific Culture in Early Modern Italy}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Findlen, Paula}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Berkeley}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;publisher&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{University of California Press}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{english}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;date&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{1994}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="resultaten"&gt;Resultaten&lt;/h3&gt;
&lt;p&gt;De
&lt;mark&gt;zijn opzienbarend: meer dan 2.000 literatuurverwijzingen werden in een paar dagen omgezet.&lt;/mark&gt;
Deze aanpak reproduceerde niet alleen getrouw het patroon uit mijn invoerprompt, maar voegde ook correct entry- en veldtypes toe die daar niet in voorkwamen. &lt;code&gt;GPT-3&lt;/code&gt; spreekt met andere woorden vloeiend &lt;code&gt;BibTeX&lt;/code&gt;. Verrassender nog voor een model dat hoofdzakelijk in het Engels is getraind: het herkende alle talen (Russisch, Frans, Italiaans, Latijn, Grieks, Duits, Spaans enzovoort) en voegde telkens het juiste &lt;code&gt;langid&lt;/code&gt;-veld toe.&lt;/p&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;Let op&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;GPT-3 kent momenteel beperkingen op de omvang van invoer en uitvoer: het verwerkt maximaal 2048 taaltokens. Zodra die beperking wegvalt, zou dezelfde klus waarschijnlijk een uur of minder vergen.&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;Enigszins onverwacht voegde GPT-3 ook informatie toe die niet in de oorspronkelijke verwijzingen stond.&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;Baillot, Anne, and Anna Busch. “Editing for Man and Machine.” In &lt;em&gt;Users of Scholarly Editions: Editorial Anticipations of Reading, Studying and Consulting&lt;/em&gt;, Vol. 13. Variants (Journal of the European Society for Textual Scholarship). Leicester, 2015.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;In deze verwijzing bijvoorbeeld voegde GPT-3 de permanente link toe naar het open-accessarchief (
) waar het artikel te lezen is, inclusief de speciale velden &lt;code&gt;HAL_ID&lt;/code&gt; en &lt;code&gt;HAL_VERSION&lt;/code&gt; die HAL zelf heeft bedacht:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-BibTeX" data-lang="BibTeX"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@inproceedings&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;baillot2015&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Editing for Man and Machine}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Baillot, Anne and Busch, Anna}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;year&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="m"&gt;2015&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;booktitle&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Users of Scholarly Editions: Editorial Anticipations of Reading, Studying and Consulting}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Leicester}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;series&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Variants (Journal of the European Society for Textual Scholarship)}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;volume&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="m"&gt;13&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;editor&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Bruhn, Siglinde and Schreiber, Manfred}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{english}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;hal_id&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{halshs-01233380}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;hal_version&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{v1}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Uit die toevoegingen blijkt dat
&lt;mark&gt;GPT-3 een literatuurverwijzing niet alleen parseert, maar ze ook aanvult op grond van wat het eerder heeft geleerd.&lt;/mark&gt;
Het zou in dat opzicht interessant zijn om te zien of het zich net zo gedraagt bij verwijzingen van na zijn trainingsperiode&amp;hellip;&lt;/p&gt;
&lt;h2 id="beperkingen"&gt;Beperkingen&lt;/h2&gt;
&lt;p&gt;GPT-3 is echter niet volmaakt. Het heeft menselijk toezicht nodig. Een van zijn bekende zwakke plekken is
: soms verzint het dingen en doet het onwaarschijnlijke aannames.&lt;/p&gt;
&lt;p&gt;In mijn experiment kwam de warrigheid van GPT-3 aan het licht toen het uit eigen beweging de familienaam van een auteur veranderde van “Ruscelli” in “Ruscello”. Strikt genomen is dat geen fout: vroegmoderne Italiaanse familienamen konden zonder onderscheid in het meervoud of het enkelvoud worden gebruikt. Tegenwoordig is de conventie echter dat je een naam laat zoals hij is, of hij nu in het meervoud of in het enkelvoud staat. Niemand zou Machiavelli vandaag nog Machiavello noemen, net zoals we geacht worden Rossello te schrijven en niet Rosselli. Heeft GPT-3 die conventie genegeerd bij gebrek aan chronologisch besef? Of heeft het een aanname gedaan op grond van de omringende namen, die in dit deel van de bibliografie toevallig allemaal in het enkelvoud staan (Bariletto, Cesano, Rossello)?
Wie zal het zeggen.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-Bibtex" data-lang="Bibtex"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@book&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;rossello1565&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Della summa de’ secreti universali}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Rossello, Timoteo}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Venice}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;publisher&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Giovanni Bariletto}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{italian}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;date&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{1565}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@book&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;ruscello1559&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{La seconda parte de’ secreti del Reverendo Donno Alessio Piemontese}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Ruscello, Girolamo}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Pesaro}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;publisher&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Bartolomeo Cesano}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{italian}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;date&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{1559}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="conclusie"&gt;Conclusie&lt;/h2&gt;
&lt;p&gt;De ruim 150 essays
, geschreven tijdens vier jaar van intensieve samenwerking, bevatten niet alleen cruciale informatie over het handschrift dat we hebben geëditeerd en vertaald, maar ook waardevolle bibliografische gegevens.&lt;/p&gt;
&lt;p&gt;Door die literatuurverwijzingen in een database samen te brengen, kunnen editeurs de bibliografische opmaak in een oogwenk veranderen en hebben ze meer vrijheid om die informatie naar eigen inzicht te tonen. Zo&amp;rsquo;n database vertelt bovendien veel over de editie en het project dat haar mogelijk maakte, en opent nieuwe analytische perspectieven voor onderzoekers. En ze kan met grote nauwkeurigheid en in recordtijd worden aangelegd.&lt;/p&gt;
&lt;p&gt;Er kunnen weliswaar fouten insluipen, met name door de neiging van GPT-3 om te hallucineren. Maar toekomstige generaties voorgetrainde taalmodellen zullen dat probleem verkleinen.&lt;/p&gt;</description></item><item><title>Markup automatiseren in digitale wetenschappelijke edities</title><link>https://clementgodbarge.com/nl/post/gpt3/</link><pubDate>Mon, 22 Nov 2021 18:15:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/gpt3/</guid><description>&lt;h1 id="inleiding"&gt;Inleiding&lt;/h1&gt;
&lt;p&gt;Hoe maak je digitale wetenschappelijke edities zonder je te ruïneren? In dit bericht, het eerste van een reeks over efficiënt editeren, ga ik na welke rol voorgetrainde taalmodellen kunnen spelen bij het automatiseren van editoriale taken zoals semantische markup.&lt;/p&gt;
&lt;details class="print:hidden xl:hidden" &gt;
&lt;summary&gt;Inhoudsopgave&lt;/summary&gt;
&lt;div class="text-sm"&gt;
&lt;nav id="TableOfContents"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#een-werk-van-liefde"&gt;Een werk van liefde&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#een-hoge-drempel"&gt;Een hoge drempel&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#transformers-de-kortste-weg-naar-automatisering"&gt;Transformers: de kortste weg naar automatisering?&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#codex"&gt;Codex&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#voorbij-openai"&gt;Voorbij OpenAI&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#experiment-1--tekstcategorisering"&gt;Experiment 1 – Tekstcategorisering.&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#prompt-engineering"&gt;Prompt engineering&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#test"&gt;Test&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#resultaat"&gt;Resultaat&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;a href="#experiment-2--semantische-markup"&gt;Experiment 2 – Semantische markup&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#prompt-engineering-1"&gt;Prompt engineering&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#test-1"&gt;Test&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/nav&gt;
&lt;/div&gt;
&lt;/details&gt;
&lt;h1 id="het-probleem"&gt;Het probleem&lt;/h1&gt;
&lt;h2 id="een-werk-van-liefde"&gt;Een werk van liefde&lt;/h2&gt;
&lt;p&gt;Op liefde staat geen prijs&amp;hellip; zo luidt althans het spreekwoord. Voor digitale wetenschappelijke edities gaat dat zeker op: de transcriptie, vertaling en annotatie die bij hun totstandkoming komen kijken, vergen duizenden uren werk, verricht – zoals in het geval van
– door honderden hooggekwalificeerde medewerkers.&lt;/p&gt;
&lt;p&gt;In zekere zin is het een zegen dat prestigieuze projecten in de digital humanities de enorme bedragen kunnen binnenhalen die ze nodig hebben om te draaien. Toch is een model dat zo zwaar leunt op de vrijgevigheid van rijke stichtingen, universiteiten en overheidsinstanties, en dat jarenlang veel menskracht vergt, economisch niet houdbaar op de lange termijn.&lt;/p&gt;
&lt;p&gt;Sterker nog: willen we onderzoekers van over de hele wereld aanmoedigen om historische documenten voor een breder publiek toegankelijk te maken, dan
&lt;mark&gt;moeten de kosten van digitale kritische edities met enkele ordes van grootte omlaag&lt;/mark&gt;
.&lt;/p&gt;
&lt;h2 id="een-hoge-drempel"&gt;Een hoge drempel&lt;/h2&gt;
&lt;p&gt;Paradoxaal genoeg
&lt;mark&gt;komt de oplossing misschien juist van arbeidsintensieve projecten als
: ze vormen een waardevolle trainingsset&lt;/mark&gt;
waarmee enkele van de meest afstompende en repetitieve taken van het digitaal editeren, zoals markup, kunnen worden geautomatiseerd.&lt;/p&gt;
&lt;p&gt;Niet dat markup onbelangrijk zou zijn. Integendeel:
&lt;mark&gt;markup is het onmisbare bestanddeel van elk serieus digitaal wetenschappelijk project geworden.&lt;/mark&gt;
Gestandaardiseerd door het
stelt het ons in staat zoveel mogelijk aspecten van het document en van de tekst die het overlevert vast te leggen: structuur, kanttekeningen, doorhalingen, varianten, papiersoort, vlekken, handschrift&amp;hellip; noem maar op.&lt;/p&gt;
&lt;p&gt;Het volgende voorbeeld, ontleend aan
, laat zien hoe markup de tekst verrijkt met extra informatie (categorie, structuur, semantische velden, doorhalingen enzovoort), waardoor digitale edities uiteindelijk een flinke voorsprong nemen op hun papieren voorouders.&lt;/p&gt;
&lt;table&gt;
&lt;tr&gt;
&lt;th&gt; Plain Text &lt;/th&gt;
&lt;th&gt; XML Markup&lt;/th&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Pour rompre grenades et donner
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;violence aux artifices de foeu
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Mects parmy la pouldre et la sixiesme
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;partye dicelle de vif argent
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/td&gt;
&lt;td&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;div&lt;/span&gt; &lt;span class="na"&gt;id=&lt;/span&gt;&lt;span class="s"&gt;&amp;#34;p008r_2&amp;#34;&lt;/span&gt; &lt;span class="na"&gt;categories=&lt;/span&gt;&lt;span class="s"&gt;&amp;#34;arms and armor&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;head&amp;gt;&lt;/span&gt;Pour rompre &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;grenades&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; et donner&lt;span class="nt"&gt;&amp;lt;lb/&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;violence aux &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;artifices de foeu&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&amp;lt;/head&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;ab&amp;gt;&lt;/span&gt;Mects parmy la &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;pouldre&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;del&amp;gt;&amp;lt;ms&amp;gt;&lt;/span&gt;six fois autant&lt;span class="nt"&gt;&amp;lt;/ms&amp;gt;&lt;/span&gt; de
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;vif argent&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&amp;lt;/del&amp;gt;&amp;lt;lb/&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;del&amp;gt;&lt;/span&gt;et&lt;span class="nt"&gt;&amp;lt;/del&amp;gt;&lt;/span&gt; &lt;span class="nt"&gt;&amp;lt;ms&amp;gt;&lt;/span&gt;la sixiesme partye&lt;span class="nt"&gt;&amp;lt;/ms&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; dicelle de &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;vif argent&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&amp;lt;/ab&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;/div&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/table&gt;
&lt;p&gt;Deze informatie is niet alleen waardevol voor archivering, maar ook – zoals ik bij eerdere gelegenheden heb laten zien – voor synthese en analyse. Dit soort annotatie kan echter buitengewoon tijdrovend zijn, omdat dezelfde tekst vaak in verschillende gedaanten beschikbaar moet zijn: als vertaling, als transcriptie, als gemoderniseerde versie enzovoort.&lt;/p&gt;
&lt;h1 id="de-oplossing"&gt;De oplossing&lt;/h1&gt;
&lt;h2 id="transformers-de-kortste-weg-naar-automatisering"&gt;Transformers: de kortste weg naar automatisering?&lt;/h2&gt;
&lt;p&gt;In 2020 bracht
met veel tamtam zijn nieuwste familie van grootschalige, algemeen inzetbare taalmodellen uit: GPT-3, wat staat voor “Generative Pre-trained Transformer 3”. Transformers zijn een vrij recente doorbraak in de kunstmatige intelligentie. Ze leren nieuwe taken verbluffend snel, gewoon door een prompt te lezen en naar een zeer beperkt aantal voorbeelden te kijken. Ze kunnen ook worden bijgetraind met een dataset op maat (fine-tuning), wat de responstijd en de nauwkeurigheid verbetert. Daarom noemt men GPT-3 en vergelijkbare transformers
.&lt;/p&gt;
&lt;p&gt;Volgens OpenAI telt GPT-3 een recordaantal van 175 miljard parameters en is het getraind op meer dan 570 GB tekst, grotendeels Engelstalige documenten die vermoedelijk van
zijn geplukt. Door zijn enorme omvang heeft GPT-3 een nieuwe maatstaf gezet: zonder verdere voorbereiding voert het de meest uiteenlopende taken uit met een realisme dat verontrust. Het schrijft geloofwaardige
, het
in chatrooms,
,
, vertaalt documenten, legt jargon uit, enzovoort.&lt;/p&gt;
&lt;p&gt;Sinds mei 2021 heb ik vroegtijdig toegang tot de API van OpenAI, en zo heb ik kunnen uitproberen hoe het model een aantal notoir lastige taken aanpakt: Franse poëzie en Neolatijnse teksten in het Engels vertalen, analogieën uitleggen, en zelfs boek 4 van Kants &lt;em&gt;Fundering voor de metafysica van de zeden&lt;/em&gt; uitleggen aan een kind van zeven (al was dat weinig overtuigend).&lt;/p&gt;
&lt;h3 id="codex"&gt;Codex&lt;/h3&gt;
&lt;p&gt;Een van de jongste loten aan de GPT-3-stam richt zich op programmeertalen. Dit model, &lt;em&gt;Codex&lt;/em&gt; gedoopt, vertaalt natuurlijke taal naar computertaal en omgekeerd. Zoek ik bijvoorbeeld een reguliere expressie om “alleen woorden te vinden die met een hoofdletter beginnen”, dan vertaalt GPT-3 dat meteen in een werkende reguliere expressie: &lt;code&gt;[A-Z]+\w+&lt;/code&gt;.&lt;/p&gt;
&lt;p&gt;Volgens OpenAI kan &lt;em&gt;Codex&lt;/em&gt; overweg met een dozijn programmeertalen, waaronder Python, JavaScript, Go, Perl, PHP, Ruby en Swift. Doordat het pseudocode naadloos in code omzet, hoeft men zich niet langer te bekommeren om de pietluttige syntaxis van een programmeertaal, maar kan men zich concentreren op de logische stappen en strategieën waarmee een toepassing problemen oplost.&lt;/p&gt;
&lt;h3 id="voorbij-openai"&gt;Voorbij OpenAI&lt;/h3&gt;
&lt;p&gt;OpenAI is natuurlijk niet de enige speler op het veld. Zoals gezegd kondigde de Beijing Academy for Artificial Intelligence in 2021 een nog groter en krachtiger model aan, &lt;em&gt;Wu Dao 2&lt;/em&gt;. Nvidia en Microsoft bundelden hun krachten voor het toepasselijk genaamde &lt;em&gt;Megatron-Turing NLG 530B&lt;/em&gt;. Kleinere start-ups als
en
bieden het publiek eveneens API&amp;rsquo;s aan. Ook opensource-initiatieven zoals
verdienen vermelding. De AI-wereld verandert uiteraard razendsnel; wie de nieuwe initiatieven in het veld wil volgen, kijkt bij
.&lt;/p&gt;
&lt;h1 id="de-experimenten"&gt;De experimenten&lt;/h1&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;Let op&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;Het doel van deze experimenten is de zuinigste weg naar een betrouwbare automatisering van editoriale taken te vinden. Men kan tegenwerpen dat sommige van die taken ook met algoritmen voor supervised learning te automatiseren zijn. Die hypothese onderzoeken we in een volgend bericht.&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;Kan een transformer als GPT-3 leren om bijvoorbeeld een technisch en wetenschappelijk handschrift uit de zestiende eeuw te annoteren?&lt;/p&gt;
&lt;h2 id="experiment-1--tekstcategorisering"&gt;Experiment 1 – Tekstcategorisering.&lt;/h2&gt;
&lt;p&gt;Laten we beginnen met iets betrekkelijk eenvoudigs. Als “few-shot learner” zou GPT-3 snel moeten doorhebben hoe onze redactie de items in Ms Fr 640 heeft ingedeeld.&lt;/p&gt;
&lt;h3 id="prompt-engineering"&gt;Prompt engineering&lt;/h3&gt;
&lt;p&gt;Om het te trainen gebruikte ik een zeer minimale prompt en koos ik vier korte items in platte tekst als voorbeeld, waaronder één over “geneeskunde”, één over “wapens en wapenrustingen” en één over “schilderkunst”.&lt;/p&gt;
&lt;h3 id="test"&gt;Test&lt;/h3&gt;
&lt;p&gt;Daarna plakte ik een andere passage die niet in de oorspronkelijke reeks zat:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Working neatly
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Never put down, if you can, two colors one on top of the other.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;But next, having made your design carefully, keep the place of shadows for them alone,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;amp; also separately that of lights &amp;amp; highlights, without layering one color all over &amp;amp; then highlighting or else shading on it.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;And in this way, you further your work, economize your colors &amp;amp; work neatly.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Which is the reason that, the colors not being muddled nor mixed together, they do not die &amp;amp; you soften the colors better, since they are not so thick.
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;De uitvoer sluit perfect aan bij de inhoud:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;categories&lt;/span&gt;&lt;span class="err"&gt;=&amp;#34;painting&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Proberen we het met een item uit een categorie die niet eens voorkwam in de teksten waarmee GPT-3 was getraind, dan is het resultaat verrassend.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;categories&lt;/span&gt;&lt;span class="err"&gt;=&amp;#34;jewelry&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="resultaat"&gt;Resultaat&lt;/h3&gt;
&lt;p&gt;De categorie “jewelry” bestaat niet in onze editie van Ms. Fr. 640. De redactie
aan de bredere categorie “Stones”. De intuïtie van GPT-3 is echter goed en wijst erop dat het met wat extra training elk item van Ms. Fr. 640 kan leren indelen, en misschien zelfs dat van vergelijkbare technische teksten uit de zestiende eeuw.&lt;/p&gt;
&lt;h2 id="experiment-2--semantische-markup"&gt;Experiment 2 – Semantische markup&lt;/h2&gt;
&lt;p&gt;Leggen we de lat wat hoger. Als transformers als GPT-3 kunnen leren teksten volgens specifieke editoriale criteria in te delen, kunnen ze dan ook een deel van de markup van de tekst herkennen?&lt;/p&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;Let op&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;&lt;em&gt;Secrets of Craft and Nature&lt;/em&gt; biedt een
van semantische en structurele labels. Helaas verwerkt GPT-3 geen afbeeldingen, in tegenstelling tot andere projecten zoals
. Waarschijnlijk krijgen toekomstige versies van GPT die mogelijkheid wel; ze is nodig om de meeste structurele en materiële aspecten van een document te herkennen. Die tags slaan we hier over; we richten ons op markup waarvoor geen beeldherkenning nodig is.&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;h3 id="prompt-engineering-1"&gt;Prompt engineering&lt;/h3&gt;
&lt;p&gt;Semantische tags verwijzen onder meer naar dieren, planten, plaatsnamen, zintuiglijke waarnemingen enzovoort. Voor de trainingsprompt koos ik een paar voorbeelden uit de editie:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Input prompt--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;The following is a list of words and their corresponding semantic tags
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;cannons: &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;cannons&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;flasks: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;flasks&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;wooden: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;wooden&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;iron: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;iron&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;parchment: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;parchment&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;goats: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;goats&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;lambs: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;lambs&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;leather: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;leather&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;earth: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;earth&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;fine fatty earth: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;fine fatty earth&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Venice: &lt;span class="nt"&gt;&amp;lt;pl&amp;gt;&lt;/span&gt;Venice&lt;span class="nt"&gt;&amp;lt;/pl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Flemish: &lt;span class="nt"&gt;&amp;lt;pl&amp;gt;&lt;/span&gt;Flemish&lt;span class="nt"&gt;&amp;lt;/pl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;almond: &lt;span class="nt"&gt;&amp;lt;pa&amp;gt;&lt;/span&gt;almond&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;almond oil: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;almond&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; oil&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;walnuts skin: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;walnuts&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; skin&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;molten lead: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;molten lead&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;today: &lt;span class="nt"&gt;&amp;lt;tmp&amp;gt;&lt;/span&gt;today&lt;span class="nt"&gt;&amp;lt;/tmp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;In the past: &lt;span class="nt"&gt;&amp;lt;tmp&amp;gt;&lt;/span&gt;In the past&lt;span class="nt"&gt;&amp;lt;/tmp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Clockmakers: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;Clockmakers&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;red copper: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;red copper&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;crucible: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;crucible&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bellows: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;bellows&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;charcoal: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;charcoal&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;founders: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;founders&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="test-1"&gt;Test&lt;/h3&gt;
&lt;p&gt;Laten we een paar makkelijke woorden proberen met het model &lt;code&gt;Davinci-codex&lt;/code&gt;: &lt;em&gt;Apothecary&lt;/em&gt;, &lt;em&gt;smoke&lt;/em&gt;, &lt;em&gt;glassmakers&lt;/em&gt;, &lt;em&gt;latten&lt;/em&gt; en &lt;em&gt;snake&lt;/em&gt;. De resultaten komen meteen en zijn foutloos:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Apothecary: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;Apothecary&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;smoke: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;smoke&lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;glassmakers: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;glassmakers&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;latten: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;latten&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;snake: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;snake&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Een pittiger test werkt met samengestelde woorden als &lt;em&gt;copper plates&lt;/em&gt;, &lt;em&gt;walnut oil&lt;/em&gt; en &lt;em&gt;wood block&lt;/em&gt;. Daarmee willen we nagaan of GPT-3 geneste tags correct verwerkt.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;copper plates: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;copper plates&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;walnut oil: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;walnut&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; oil&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;wood block: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;wood block&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;De resultaten zijn echter gemengd: &lt;code&gt;Davinci-codex&lt;/code&gt; labelde alleen &lt;em&gt;walnut oil&lt;/em&gt; correct en zag de geneste tags &lt;code&gt;tl&lt;/code&gt; en &lt;code&gt;m&lt;/code&gt; in &lt;em&gt;copper plates&lt;/em&gt; en &lt;em&gt;wood block&lt;/em&gt; over het hoofd. Zoals de volgende test laat zien, zijn die fouten wel te ondervangen met een betere trainingsprompt. Na toevoeging van vijf extra voorbeelden van geneste tags gaf &lt;code&gt;Davinci-codex&lt;/code&gt; een vrijwel foutloos resultaat terug, met één enkele misser (&lt;em&gt;oil paintbrushes&lt;/em&gt;):&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;cannon powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;wp&amp;gt;&lt;/span&gt;cannon&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;arquebus powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;wp&amp;gt;&lt;/span&gt;arquebus&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;oil paintbrushes: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;al&amp;gt;&lt;/span&gt;oil&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt; paintbrushes&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;sheep footbones: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;al&amp;gt;&lt;/span&gt;sheep&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt; footbones&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bronze mortar: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&amp;lt;m&amp;gt;&lt;/span&gt;bronze&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt; mortar&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h1 id="conclusie"&gt;Conclusie&lt;/h1&gt;
&lt;p&gt;Vergeet niet dat deze tests met korte tekstfragmenten zijn uitgevoerd. Ik vermoed dat GPT-3-modellen nog betere resultaten zouden geven als de voorbeelden en de prompt meer context boden. Bovendien zou fine-tuning van het model met datasets op maat de nauwkeurigheid van de labels ongetwijfeld verder verbeteren.&lt;br&gt;
Deze experimenten moeten weliswaar nog op grotere schaal worden herhaald om de betrouwbaarheid van voorgetrainde taalmodellen aan te tonen, maar we kunnen nu al concluderen dat
&lt;mark&gt;editeurs met deze aanpak verschillende annotatietaken in een paar eenvoudige stappen kunnen automatiseren, wat potentieel enorm veel tijd en geld bespaart.&lt;/mark&gt;
&lt;/p&gt;</description></item><item><title>Handschriften visualiseren 2 (update)</title><link>https://clementgodbarge.com/nl/post/treemap2/</link><pubDate>Sat, 20 Nov 2021 16:00:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/treemap2/</guid><description>&lt;p&gt;Zoals beloofd: een nieuwe versie van de interactieve treemap uit een
, ditmaal met twee weergavemodi.&lt;/p&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;Let op&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;Voor een betere weergave zorg je ervoor dat de webpagina in de lichte modus staat (klik op het maanpictogram rechtsboven).&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;head&gt;
&lt;meta charset="UTF-8" /&gt;
&lt;meta http-equiv="X-UA-Compatible" content="IE=edge" /&gt;
&lt;meta name="viewport" content="width=device-width, initial-scale=1.0" /&gt;
&lt;title&gt;&lt;/title&gt;
&lt;link rel="preconnect" href="https://fonts.gstatic.com" /&gt;
&lt;link
href="https://fonts.googleapis.com/css2?family=Open+Sans:wght@400;700&amp;display=swap"
rel="stylesheet"
/&gt;
&lt;link rel="stylesheet" href="css/index.css" /&gt;
&lt;link rel="stylesheet" href="css/vis-treemap.css" /&gt;
&lt;link rel="stylesheet" href="css/vis-tooltip.css" /&gt;
&lt;/head&gt;
&lt;body&gt;
&lt;div class="stacked"&gt;
&lt;div class="switch"&gt;
&lt;input
type="checkbox"
name="group-by-category-switch"
id="group-by-category-switch"
checked
/&gt;
&lt;label for="group-by-category-switch"&gt; Group folios by category &lt;/label&gt;
&lt;/div&gt;
&lt;div id="treemap"&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;script src="https://cdn.jsdelivr.net/npm/d3@7.9.0/dist/d3.min.js" integrity="sha384-CjloA8y00+1SDAUkjs099PVfnY2KmDC2BZnws9kh8D/lX1s46w6EPhpXdqMfjK6i" crossorigin="anonymous" referrerpolicy="no-referrer"&gt;&lt;/script&gt;
&lt;script src="js/vis-treemap.js"&gt;&lt;/script&gt;
&lt;script src="js/vis-tooltip.js"&gt;&lt;/script&gt;
&lt;script src="js/index.js"&gt;&lt;/script&gt;
&lt;/body&gt;</description></item><item><title>Een visuele browser voor het archief</title><link>https://clementgodbarge.com/nl/post/treemap/</link><pubDate>Sun, 20 Jun 2021 16:00:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/treemap/</guid><description>&lt;h1 id="het-probleem"&gt;Het probleem&lt;/h1&gt;
&lt;p&gt;Digitale edities lijden aan een paradox: ze maken obscure documenten weliswaar voor een breder publiek beschikbaar, maar het verlies aan zintuiglijke prikkels dat met hun dematerialisering gepaard gaat, werkt desoriënterend en schrikt lezers zelfs af om zich in de inhoud te verdiepen. Ze maken het navigeren door omvangrijke documentverzamelingen nogal omslachtig en intimiderend. Dat geldt niet alleen voor gebruikers zonder ervaring met archiefonderzoek, maar ook voor lezers met een cognitieve beperking.&lt;/p&gt;
&lt;h1 id="de-oplossing"&gt;De oplossing&lt;/h1&gt;
&lt;p&gt;Hier kunnen archiefmetadata ons helpen. Met zulke gegevens kunnen we namelijk interactieve visuele abstracties maken die lezers een alternatieve zintuiglijke ingang bieden, en zo zowel de ergonomie als de toegankelijkheid vergroten. Om het archief visueel navigeerbaar te maken, volstaat een treemap, of om het even welk diagram dat hiërarchische gegevens efficiënt ontleedt.&lt;/p&gt;
&lt;h1 id="het-experiment"&gt;Het experiment&lt;/h1&gt;
&lt;p&gt;Mijn eerste experiment bewerkt de
voor &lt;code&gt;D3.js&lt;/code&gt; en voegt er hyperlinks aan toe. De treemap stelt het handschrift BnF Ms Fr 640 voor, met zijn folio&amp;rsquo;s en de items op elk folio. De kleuren geven de overheersende categorie aan. Wie met de muis over een item gaat, krijgt meer gegevens te zien, waaronder de hyperlink naar het handschrift.&lt;br&gt;
Zo wordt de treemap een interactieve visuele index die lezers een razendsnel en responsief overzicht geeft, niet alleen van de inhoud van het handschrift, maar ook van de omvang van elk folio en elk item.&lt;br&gt;
&lt;del&gt;De komende maanden experimenteer ik verder met dit idee en probeer ik andere diagrammen en andere hiërarchieën uit&amp;hellip; Wordt vervolgd!&lt;/del&gt; Voor een nieuwe versie van de treemap klik je
.&lt;/p&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;Let op&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;Voor een betere weergave zorg je ervoor dat de webpagina in de lichte modus staat (klik op het maanpictogram rechtsboven).&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;head&gt;
&lt;meta charset="UTF-8" /&gt;
&lt;meta http-equiv="X-UA-Compatible" content="IE=edge" /&gt;
&lt;meta name="viewport" content="width=device-width, initial-scale=1.0" /&gt;
&lt;title&gt;&lt;/title&gt;
&lt;link rel="preconnect" href="https://fonts.gstatic.com" /&gt;
&lt;link
href="https://fonts.googleapis.com/css2?family=Open+Sans:wght@400;700&amp;display=swap"
rel="stylesheet" /&gt;
&lt;link rel="stylesheet" href="css/index.css" /&gt;
&lt;link rel="stylesheet" href="css/vis-treemap.css" /&gt;
&lt;link rel="stylesheet" href="css/vis-tooltip.css" /&gt;
&lt;/head&gt;
&lt;body&gt;
&lt;p&gt;Click any cell to zoom in, or the top to zoom out.&lt;/p&gt;
&lt;div id="treemap"&gt;&lt;/div&gt;
&lt;script src="https://cdn.jsdelivr.net/npm/d3@7.9.0/dist/d3.min.js" integrity="sha384-CjloA8y00+1SDAUkjs099PVfnY2KmDC2BZnws9kh8D/lX1s46w6EPhpXdqMfjK6i" crossorigin="anonymous" referrerpolicy="no-referrer"&gt;&lt;/script&gt;
&lt;script src="js/vis-treemap.js"&gt;&lt;/script&gt;
&lt;script src="js/vis-tooltip.js"&gt;&lt;/script&gt;
&lt;script src="js/index.js"&gt;&lt;/script&gt;
&lt;/body&gt;</description></item><item><title>Het archief in één oogopslag</title><link>https://clementgodbarge.com/nl/post/dashboard/</link><pubDate>Mon, 24 May 2021 16:00:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/dashboard/</guid><description>&lt;h1 id="het-probleem"&gt;Het probleem&lt;/h1&gt;
&lt;p&gt;Historische archieven kunnen ontmoedigend rommelig zijn. Het &lt;em&gt;Mediceo del Principato&lt;/em&gt; in het
is daar een schoolvoorbeeld van. Slechts een klein deel ervan is geïnventariseerd, en veel documenten liggen zonder aanwijsbare reden verspreid over meer dan 6.500 delen. Om het nog ingewikkelder te maken, mag je in het archief maar een beperkt aantal delen (of &lt;em&gt;filze&lt;/em&gt;, bundels, zoals ze daar heten) raadplegen. In normale tijden ligt de grens op 4 &lt;em&gt;filze&lt;/em&gt; per dag. In tijden van pandemie is dat aantal echter gezakt tot 4 per twee weken. Bij gebrek aan gedetailleerde inventarissen dwingt de enorme omvang van het archief onderzoekers om strategieën te bedenken waarmee ze de gezochte documenten snel kunnen vinden.&lt;/p&gt;
&lt;h1 id="de-oplossing"&gt;De oplossing&lt;/h1&gt;
&lt;p&gt;Sommigen vertrouwen liever op het toeval, anderen proberen daarnaast onderbouwde gissingen te doen op basis van chronologie, geadresseerden, auteurs, herkomst van het archieffonds, taal enzovoort. Wie al die variabelen tegelijk &lt;em&gt;bekijkt&lt;/em&gt;, kan echter onverwachte patronen in de structuur van het archief ontdekken en zijn vermoedens aanscherpen. Mijn ervaring leert dat de metadata die onderzoekers doorgaans in een spreadsheet verzamelen, eenmaal in grafiekvorm, het overzicht in het archief aanzienlijk vergroten.&lt;/p&gt;
&lt;h1 id="het-experiment"&gt;Het experiment&lt;/h1&gt;
&lt;p&gt;Mijn huidige onderzoek richt zich op de correspondentie van een zestiende-eeuwse spion. Zijn brieven liggen verspreid over honderden &lt;em&gt;filze&lt;/em&gt;. Ze zijn geschreven onder verschillende identiteiten, aan verschillende en soms onverwachte geadresseerden, vanuit verschillende plaatsen, enzovoort. Om de &lt;em&gt;filze&lt;/em&gt; op te sporen waarin de gezochte brieven het waarschijnlijkst zitten, heb ik een dashboard opgezet: een interactieve webapplicatie voor datavisualisatie (
) die allerlei gegevens, waaronder geografische en chronologische informatie, koppelt aan een hiërarchisch diagram (
) van het archieffonds. Het dashboard toont me in één oogopslag wat er al gevonden is, hoeveel dat voorstelt, en geeft me een ruw idee van waar ik nog nieuwe brieven zou kunnen zoeken. Klik ik bovendien op specifieke variabelen, dan worden alle diagrammen bijgewerkt en tonen ze specifieke correlaties.&lt;/p&gt;
&lt;h1 id="volgende-stappen"&gt;Volgende stappen&lt;/h1&gt;
&lt;p&gt;Belangrijker misschien nog: dit dashboard kan worden omgebouwd tot een visuele index. Wanneer de kritische editie van deze brieven online verschijnt, zal het dashboard dienen als alternatieve ingang, van waaruit lezers door de gegevens kunnen bladeren. Om redenen van vertrouwelijkheid kan ik op dit moment alleen een schermafbeelding tonen waarop delen zijn weggelakt, maar volgend jaar geef ik het volledige dashboard vrij. Intussen komt er binnenkort een prototype beschikbaar. Wordt vervolgd!&lt;/p&gt;</description></item><item><title>Semantische markup visualiseren in BnF Ms. Fr. 640</title><link>https://clementgodbarge.com/nl/post/visualization/</link><pubDate>Sun, 20 Dec 2020 18:15:00 +0000</pubDate><guid>https://clementgodbarge.com/nl/post/visualization/</guid><description>&lt;h1 id="overzicht"&gt;Overzicht&lt;/h1&gt;
&lt;p&gt;Datarijke wetenschappelijke edities bevatten waardevolle editoriale annotaties die je voor allerlei wetenschappelijke doeleinden kunt extraheren, analyseren en visualiseren. Dat geldt voor
, verschenen in 2020, dat zijn metadatabestand ter download aanbiedt op zijn GitHub-repository. In dit bericht laat ik zien hoe je al die variabelen in een correlatiematrix samenbrengt en op verschillende manieren visualiseert.&lt;/p&gt;
&lt;h1 id="de-gegevens"&gt;De gegevens&lt;/h1&gt;
&lt;p&gt;Het Making and Knowing Project genereert een spreadsheet met actuele informatie over de inhoud van het handschrift: &lt;code&gt;entry_metadata.csv&lt;/code&gt;. Het bestand is te vinden in de
van Making &amp;amp; Knowing. Je kunt ook .csv-bestanden op maat genereren en er meer markup aan toevoegen dankzij het uitstekende
van Matthew Kumar, een Python-versie van BnF Ms. Fr. 640.&lt;/p&gt;
&lt;h2 id="python-klaarzetten"&gt;Python klaarzetten&lt;/h2&gt;
&lt;p&gt;We gebruiken Pandas voor het bewerken van de gegevens, Matplotlib en seaborn voor de heatmaps en tot slot NetworkX om netwerken op basis van correlaties te maken.&lt;br&gt;
Voor dit soort variabelen mijden we de methode van Pearson en gebruiken we in plaats daarvan de 𝜙𝐾-methode.
over deze correlatiemethode en de bijbehorende bibliotheek &lt;code&gt;PhiK&lt;/code&gt;.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;#install packages&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;pip&lt;/span&gt; &lt;span class="n"&gt;install&lt;/span&gt; &lt;span class="n"&gt;phik&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# import modules&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;pandas&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;pd&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;matplotlib.pyplot&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;plt&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;seaborn&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;sns&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="nn"&gt;networkx&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="nn"&gt;nx&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="de-gegevens-voorbereiden"&gt;De gegevens voorbereiden&lt;/h2&gt;
&lt;p&gt;Download eerst het meest recente metadatabestand van de editie uit de map metadata van hun
.
We selecteren alleen de kolommen die we nodig hebben. Voor deze demonstratie kies ik alle semantische tags uit de Engelse vertaling &lt;code&gt;tl&lt;/code&gt;, maar je kunt ook tags kiezen uit de Franse transcriptie &lt;code&gt;tc&lt;/code&gt; of de genormaliseerde versie &lt;code&gt;tcn&lt;/code&gt;.
De gegevens komen als door puntkomma&amp;rsquo;s gescheiden waarden, en we moeten ze door Python laten tellen. Daarvoor gebruiken we de stack-unstack-methode met de reguliere expressie &lt;code&gt;[^;\s][^\;]*[^;\s]*&lt;/code&gt;.
Om de matrix leesbaarder te maken, hernoemen we elke kolom. Wie haast heeft, kan deze stap overslaan; onthoud alleen dat ons dataframe in dit stadium &lt;code&gt;tagsrn&lt;/code&gt; heet.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# load the edition&amp;#39;s metadata&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;df&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;pd&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;read_csv&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;entry_metadata.csv&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# select the tags you want to correlate&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;dftags&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;df&lt;/span&gt;&lt;span class="p"&gt;[[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;al_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;bp_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;cn_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;df_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;env_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;m_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;md_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;ms_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;mu_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;pa_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;pl_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;pn_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;pro_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;sn_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;tl_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;tmp_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;wp_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;de_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;el_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;it_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;la_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;oc_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;po_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# count comma separated values&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;tagcount&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;dftags&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;stack&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;dropna&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="kc"&gt;False&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;str&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;count&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sa"&gt;r&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;[^;\s][^\;]*[^;\s]*&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;unstack&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# rename columns&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;tagsrn&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;tagcount&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;rename&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;columns&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;al_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;animals&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;bp_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;body parts&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;cn_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;currency&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;df_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;definitions&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;env_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;environment&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;m_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;material&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;md_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;medical&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;ms_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;measurement&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;mu_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;music&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;pa_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;plant&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;pl_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;toponym&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;pn_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;person&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;pro_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;profession&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;sn_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;sensory&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;tl_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;tool&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;tmp_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;temporal&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;wp_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;weapons&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;de_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;German&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;el_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;Greek&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;it_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;Italian&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;la_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;Italian&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;oc_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;Occitan&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;po_tl&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;Poitevin&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;})&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h1 id="correleren"&gt;Correleren&lt;/h1&gt;
&lt;p&gt;Zodra het dataframe schoon is, kunnen we de correlatiecoëfficiënten tussen de variabelen berekenen. Het is in dit stadium belangrijk je gegevens te begrijpen en de meest geschikte correlatiemethode te kiezen. Het pakket &lt;code&gt;pandas-profiling&lt;/code&gt; is daarbij bijzonder handig.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# calculate correlation coefficient with the phi k method&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;cortag&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;tagsrn&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;phik_matrix&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;&lt;code&gt;cortag&lt;/code&gt; is onze correlatiematrix. We kunnen nu verschillende soorten visualisatie uitproberen.&lt;/p&gt;
&lt;h1 id="visualiseren"&gt;Visualiseren&lt;/h1&gt;
&lt;p&gt;Het eerste wat we kunnen proberen, is de matrix weergeven als kleurgecodeerde matrix, met de
van &lt;code&gt;seaborn&lt;/code&gt;.&lt;/p&gt;
&lt;h3 id="correlatieheatmap"&gt;Correlatieheatmap&lt;/h3&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;f&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;ax&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;plt&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;subplots&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;figsize&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;16&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;14&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;ax&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;sns&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;heatmap&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;cortag&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;linewidths&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;.03&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;vmin&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;cmap&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;Oranges&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;square&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="kc"&gt;True&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Correlatieheatmap van BnF Ms. Fr. 640"
srcset="https://clementgodbarge.com/post/visualization/heatmap_hu_943abdd98e24b0a3.webp 320w, https://clementgodbarge.com/post/visualization/heatmap_hu_eca41311a0e0ac17.webp 480w, https://clementgodbarge.com/post/visualization/heatmap_hu_1650defb643c0285.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://clementgodbarge.com/post/visualization/heatmap_hu_943abdd98e24b0a3.webp"
width="760"
height="665"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;Wie de tekst goed kent, ziet meteen dat de heatmap heel zinnig is. Namen zijn bijvoorbeeld sterk gecorreleerd met Latijn, want het was gebruikelijk, vooral onder zestiende-eeuwse humanisten, om ze te latiniseren.&lt;/p&gt;
&lt;p&gt;Sommigen zullen tegenwerpen dat deze heatmap alleen maar open deuren intrapt. Helemaal ongelijk hebben ze niet, en op het eerste gezicht lijken de medische tags dat te bevestigen: ze correleren, zoals te verwachten, met lichaamsdelen, maten en planten.&lt;/p&gt;
&lt;p&gt;Maar wie de heatmap aandachtiger leest, regel voor regel, stuit op interessante en onverwachte correlaties. Dat de medische tags bijvoorbeeld correleren met Italiaanse en Latijnse woorden, geeft ons aanwijzingen over de herkomst van de medische recepten in Ms. Fr. 640. Zo ook laat de correlatie tussen beroepen, definities en maten zien in hoeverre de beroepsidentiteit de technische vertogen van de zestiende eeuw structureert.&lt;/p&gt;
&lt;h3 id="correlatieclustermap"&gt;Correlatieclustermap&lt;/h3&gt;
&lt;p&gt;Heatmaps zijn nuttig in een “verkennende” context, maar kunnen er voor je publiek wat rommelig uitzien, vooral als je het over specifieke semantische clusters in het handschrift hebt – of er nog naar zoekt. De &lt;code&gt;clustermap&lt;/code&gt;-module van seaborn kan dan interessante resultaten opleveren.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;clustermap&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;sns&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;clustermap&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;cortag&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;figsize&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;12&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;13&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="n"&gt;dendrogram_ratio&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mf"&gt;.1&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mf"&gt;.2&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="n"&gt;vmin&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;cmap&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;Oranges&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;cbar_pos&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="o"&gt;-&lt;/span&gt;&lt;span class="mf"&gt;.06&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mf"&gt;.12&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mf"&gt;.03&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mf"&gt;.68&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Correlatieclustermap van BnF Ms. Fr. 640"
srcset="https://clementgodbarge.com/post/visualization/clustermap_hu_677e6e5028f9d902.webp 320w, https://clementgodbarge.com/post/visualization/clustermap_hu_2dac945fa40a8ac6.webp 480w, https://clementgodbarge.com/post/visualization/clustermap_hu_3abaf7b36a53572.webp 753w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://clementgodbarge.com/post/visualization/clustermap_hu_677e6e5028f9d902.webp"
width="753"
height="760"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;Behalve dat de clustermap op een gepixeld insect lijkt (ja, dat woord staat echt in het woordenboek), onderscheidt ze duidelijk de geïsoleerde tags (bovenaan en links) van de tags die sterker met elkaar verbonden zijn. We zien ook geïsoleerde clusters, zoals muziek en Poitevin (wie had dat gedacht!), naast meer centrale zoals maten, materiaal, definities en wapens. Beroepen zijn sterker verbonden, maar maken, althans in deze specifieke correlatiematrix, geen deel uit van een bepaald cluster.&lt;/p&gt;
&lt;h3 id="correlatienetwerk"&gt;Correlatienetwerk&lt;/h3&gt;
&lt;p&gt;Willen we de correlaties in onze matrix nog verder samenvatten, dan bieden netwerkgrafen een elegante oplossing. Dat geldt vooral wanneer we over de inhoud van het handschrift willen communiceren.&lt;br&gt;
Daarvoor moeten we onze matrix omzetten in een lijst van kanten en knopen, en een drempel vastleggen om zwakkere correlaties uit de graaf te weren.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# transform the data&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;links&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;cortag&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;stack&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;reset_index&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;links&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;columns&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;var1&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;var2&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;value&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# threshold &lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;links_filtered&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;links&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;loc&lt;/span&gt;&lt;span class="p"&gt;[(&lt;/span&gt;&lt;span class="n"&gt;links&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;value&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt; &lt;span class="o"&gt;&amp;gt;&lt;/span&gt; &lt;span class="mf"&gt;.6&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;&amp;amp;&lt;/span&gt; &lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;links&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;var1&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt; &lt;span class="o"&gt;!=&lt;/span&gt; &lt;span class="n"&gt;links&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;var2&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;])]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;links_filtered&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# create edges&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;G&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;nx&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;from_pandas_edgelist&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;links_filtered&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;var1&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;var2&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# draw network using Kamada &amp;amp; Kawai&amp;#39;s algorithm &lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;plt&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;figure&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;3&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="n"&gt;figsize&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;12&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="mi"&gt;12&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;nx&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;draw_kamada_kawai&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;G&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;with_labels&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="kc"&gt;True&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;node_color&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;red&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;node_size&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="mi"&gt;400&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;edge_color&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;black&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;linewidths&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;font_size&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="mi"&gt;14&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Correlatiegraaf van BnF Ms. Fr. 640"
srcset="https://clementgodbarge.com/post/visualization/graph_hu_396032c00cb7f7f3.webp 320w, https://clementgodbarge.com/post/visualization/graph_hu_85295e5fba6293bc.webp 480w, https://clementgodbarge.com/post/visualization/graph_hu_4190dbca7e86ffc1.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://clementgodbarge.com/post/visualization/graph_hu_396032c00cb7f7f3.webp"
width="760"
height="760"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;Zijn er te veel kanten en knopen, dan kun je altijd de drempel aanpassen voor een schoner resultaat. Je kunt de graaf ook exporteren om er in &lt;code&gt;Gephi&lt;/code&gt; mee te spelen, met de functie &lt;code&gt;.write_gexf()&lt;/code&gt;.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;nx&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;write_gexf&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;G&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;graph.gexf&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Het resultaat zie je aan het begin van dit bericht.&lt;/p&gt;
&lt;h3 id="update-circulair-gewogen-netwerk"&gt;Update: circulair gewogen netwerk&lt;/h3&gt;
&lt;p&gt;Ik zocht naar manieren om correlatiematrices als gewogen netwerken weer te geven en stuitte op deze interessante aanpak,
, die ik hier aanpas aan onze dataset.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# create graph weighted by correlation coefficients (unfiltered)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;Gx&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;nx&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;from_pandas_edgelist&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;links&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;var1&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;var2&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;edge_attr&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;value&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;])&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# determine a threshold to remove some edges&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;threshold&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="mf"&gt;0.4&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# list to store edges to remove&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;remove&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# loop through edges in Gx and find correlations which are below the threshold&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;var1&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;var2&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;Gx&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;edges&lt;/span&gt;&lt;span class="p"&gt;():&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;corr&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;Gx&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="n"&gt;var1&lt;/span&gt;&lt;span class="p"&gt;][&lt;/span&gt;&lt;span class="n"&gt;var2&lt;/span&gt;&lt;span class="p"&gt;][&lt;/span&gt;&lt;span class="s1"&gt;&amp;#39;value&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="c1"&gt;#add to remove node list if abs(corr) &amp;lt; threshold&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="nb"&gt;abs&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;corr&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;&amp;lt;&lt;/span&gt; &lt;span class="n"&gt;threshold&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;remove&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;append&lt;/span&gt;&lt;span class="p"&gt;((&lt;/span&gt;&lt;span class="n"&gt;var1&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;var2&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# remove edges contained in the remove list&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;Gx&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;remove_edges_from&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;remove&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nb"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nb"&gt;str&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nb"&gt;len&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;remove&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39; edges removed&amp;#39;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Zodra we een paar kanten hebben verwijderd, kunnen we hun kleur en dikte bepalen.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# determine the colors of edges&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;assign_colour&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;correlation&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;correlation&lt;/span&gt; &lt;span class="o"&gt;&amp;lt;=&lt;/span&gt; &lt;span class="mf"&gt;0.8&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;#ff872c&amp;#39;&lt;/span&gt; &lt;span class="c1"&gt;# orange&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;else&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;#f11d28&amp;#39;&lt;/span&gt; &lt;span class="c1"&gt;# red&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;assign_thickness&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;correlation&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;benchmark_thickness&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;3&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;scaling_factor&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;3&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;benchmark_thickness&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="nb"&gt;abs&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;correlation&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="o"&gt;**&lt;/span&gt;&lt;span class="n"&gt;scaling_factor&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;assign_node_size&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;degree&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;scaling_factor&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;50&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="n"&gt;degree&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="n"&gt;scaling_factor&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;We geven de knopen ook een grootte die evenredig is met hun aantal verbindingen.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# assign node size depending on number of connections (degree)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;node_size&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;key&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;value&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="nb"&gt;dict&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;Gx&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;degree&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;items&lt;/span&gt;&lt;span class="p"&gt;():&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="n"&gt;node_size&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;append&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;assign_node_size&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;value&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Het resultaat is een gewogen graaf die meer knopen en aanzienlijk meer kanten toelaat en toch leesbaar en informatief blijft.&lt;/p&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Gewogen correlatiegraaf van BnF Ms. Fr. 640"
srcset="https://clementgodbarge.com/post/visualization/weightedgraph_hu_7b75f2e5fc7edb1b.webp 320w, https://clementgodbarge.com/post/visualization/weightedgraph_hu_9f0550eb49c17f11.webp 480w, https://clementgodbarge.com/post/visualization/weightedgraph_hu_a9106989817361fb.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://clementgodbarge.com/post/visualization/weightedgraph_hu_7b75f2e5fc7edb1b.webp"
width="760"
height="760"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;</description></item></channel></rss>