<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Java |</title><link>https://clementgodbarge.com/de/tag/java/</link><atom:link href="https://clementgodbarge.com/de/tag/java/index.xml" rel="self" type="application/rss+xml"/><description>Java</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>de-de</language><lastBuildDate>Fri, 28 Mar 2025 00:00:00 +0000</lastBuildDate><image><url>https://clementgodbarge.com/media/icon_hu_64a6c3bec25b3d7b.png</url><title>Java</title><link>https://clementgodbarge.com/de/tag/java/</link></image><item><title>Multi-Saxon</title><link>https://clementgodbarge.com/de/code/multi-saxon/</link><pubDate>Fri, 28 Mar 2025 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/de/code/multi-saxon/</guid><description>&lt;h2 id="multi-saxon-parallele-xslt-verarbeitung-für-große-tei-korpora"&gt;Multi-Saxon: Parallele XSLT-Verarbeitung für große TEI-Korpora&lt;/h2&gt;
&lt;p&gt;Multi-Saxon schließt eine empfindliche Lücke im Werkzeugkasten der XML-Verarbeitung: Es führt XSLT-2.0- und -3.0-Transformationen parallel aus, an denen LXML (die verbreitete Python-Bibliothek für XML) scheitert. Eigens für große Sammlungen von XML-TEI-Dokumenten gebaut, verkürzt Multi-Saxon die Verarbeitungszeit durch effiziente Parallelisierung beträchtlich.&lt;/p&gt;
&lt;h2 id="hauptmerkmale"&gt;Hauptmerkmale&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Erweiterte XSLT-Unterstützung&lt;/strong&gt;: Verarbeitet XSLT-2.0- und -3.0-Transformationen, die LXML nicht beherrscht&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Parallele Verarbeitung&lt;/strong&gt;: Verkürzt die Transformationszeit großer Dokumentsammlungen durch Parallelisierung drastisch&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;TEI-optimiert&lt;/strong&gt;: Eigens für XML-Dokumente der Text Encoding Initiative (TEI) ausgelegt&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Skalierbare Leistung&lt;/strong&gt;: Verarbeitet Korpora von Hunderten bis Tausenden von Dokumenten effizient&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Plattformübergreifend&lt;/strong&gt;: Läuft unter verschiedenen Betriebssystemen und in verschiedenen Umgebungen&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="das-problem-das-multi-saxon-löst"&gt;Das Problem, das Multi-Saxon löst&lt;/h2&gt;
&lt;p&gt;Wer in den Digital Humanities mit TEI arbeitet, stößt regelmäßig auf zwei Hindernisse:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;LXML (die gängige Python-Bibliothek zur XML-Verarbeitung) unterstützt nur XSLT 1.0; die weiterentwickelten Möglichkeiten von XSLT 2.0/3.0 bleiben damit außer Reichweite&lt;/li&gt;
&lt;li&gt;Große TEI-Korpora Dokument für Dokument zu verarbeiten kann unzumutbar lange dauern&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Multi-Saxon räumt beide Hindernisse aus dem Weg: Es nutzt die fortgeschrittenen XSLT-Fähigkeiten von Saxon und verteilt die Arbeit auf mehrere Prozessorkerne, was erhebliche Geschwindigkeitsgewinne bringt.&lt;/p&gt;
&lt;h2 id="implementierung"&gt;Implementierung&lt;/h2&gt;
&lt;p&gt;Multi-Saxon verbindet Python mit dem Java-Prozessor Saxon zu einer leistungsfähigen Transformations-Pipeline:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Nutzt die Java-Bibliothek Saxon für robuste XSLT-2.0/3.0-Verarbeitung&lt;/li&gt;
&lt;li&gt;Verteilt die Transformationen per Multiprocessing auf die verfügbaren CPU-Kerne&lt;/li&gt;
&lt;li&gt;Verwaltet die Prozessor-Pools so, dass der Durchsatz maximal wird&lt;/li&gt;
&lt;li&gt;Bietet eine schlichte Schnittstelle für die Stapelverarbeitung von TEI-Dokumenten&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="anwendungsbeispiel"&gt;Anwendungsbeispiel&lt;/h2&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="nn"&gt;multi_saxon&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;MultiSaxon&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Initialize with your XSLT stylesheet&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;transformer&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;MultiSaxon&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;transform.xsl&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Transform a single document&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;transformer&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;transform&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;input.xml&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;output.xml&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c1"&gt;# Transform an entire directory in parallel&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="n"&gt;transformer&lt;/span&gt;&lt;span class="o"&gt;.&lt;/span&gt;&lt;span class="n"&gt;transform_directory&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;input_dir&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;output_dir&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="was-das-für-die-digital-humanities-bedeutet"&gt;Was das für die Digital Humanities bedeutet&lt;/h2&gt;
&lt;p&gt;Projekten der Digital Humanities mit großen TEI-Dokumentsammlungen eröffnet Multi-Saxon:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Komplexe korpusweite Transformationen, die mit LXML unmöglich wären&lt;/li&gt;
&lt;li&gt;Drastisch kürzere Verarbeitungszeiten (auf Mehrkernsystemen oft um den Faktor 5–10)&lt;/li&gt;
&lt;li&gt;Anspruchsvollere Analysen dank der fortgeschrittenen Funktionen von XSLT 2.0/3.0&lt;/li&gt;
&lt;li&gt;Einfachere Arbeitsabläufe bei der Verarbeitung ganzer Dokumentsammlungen&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Quellcode und Dokumentation finden Sie im
.&lt;/p&gt;</description></item></channel></rss>