<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Ediciones Críticas Digitales |</title><link>https://clementgodbarge.com/es/tag/ediciones-criticas-digitales/</link><atom:link href="https://clementgodbarge.com/es/tag/ediciones-criticas-digitales/index.xml" rel="self" type="application/rss+xml"/><description>Ediciones Críticas Digitales</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>es-es</language><lastBuildDate>Mon, 22 Nov 2021 18:15:00 +0000</lastBuildDate><image><url>https://clementgodbarge.com/media/icon_hu_64a6c3bec25b3d7b.png</url><title>Ediciones Críticas Digitales</title><link>https://clementgodbarge.com/es/tag/ediciones-criticas-digitales/</link></image><item><title>Automatizar el marcado en las ediciones críticas digitales</title><link>https://clementgodbarge.com/es/post/gpt3/</link><pubDate>Mon, 22 Nov 2021 18:15:00 +0000</pubDate><guid>https://clementgodbarge.com/es/post/gpt3/</guid><description>&lt;h1 id="introducción"&gt;Introducción&lt;/h1&gt;
&lt;p&gt;¿Cómo producir ediciones críticas digitales sin dejarse en ellas el presupuesto? En esta entrada, primera de una serie dedicada a la edición eficiente, examino el papel que pueden desempeñar los modelos de lenguaje preentrenados en la automatización de tareas editoriales como el marcado semántico.&lt;/p&gt;
&lt;details class="print:hidden xl:hidden" &gt;
&lt;summary&gt;Índice&lt;/summary&gt;
&lt;div class="text-sm"&gt;
&lt;nav id="TableOfContents"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#una-labor-de-amor"&gt;Una labor de amor&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#un-listón-muy-alto"&gt;Un listón muy alto&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#los-transformadores-el-camino-más-corto-hacia-la-automatización"&gt;Los transformadores: ¿el camino más corto hacia la automatización?&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#codex"&gt;Codex&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#más-allá-de-openai"&gt;Más allá de OpenAI&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#experimento-1-categorizar-textos"&gt;Experimento 1: categorizar textos&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#diseño-del-prompt"&gt;Diseño del prompt&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#prueba"&gt;Prueba&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#resultado"&gt;Resultado&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;a href="#experimento-2-marcado-semántico"&gt;Experimento 2: marcado semántico&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#diseño-del-prompt-1"&gt;Diseño del prompt&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#prueba-1"&gt;Prueba&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/nav&gt;
&lt;/div&gt;
&lt;/details&gt;
&lt;h1 id="el-problema"&gt;El problema&lt;/h1&gt;
&lt;h2 id="una-labor-de-amor"&gt;Una labor de amor&lt;/h2&gt;
&lt;p&gt;En el amor no se mira el gasto&amp;hellip; o eso dice el refrán. Y a las ediciones críticas digitales se les aplica con especial justicia: la transcripción, la traducción y la anotación que exigen suman miles de horas de trabajo, a cargo —como en el caso de
— de cientos de colaboradores altamente cualificados.&lt;/p&gt;
&lt;p&gt;En cierto modo, es una suerte que los proyectos más visibles de las humanidades digitales consigan las enormes sumas que necesitan para funcionar. Ahora bien, depender de la munificencia de fundaciones acaudaladas, universidades y organismos públicos, y necesitar durante años un despliegue considerable de recursos humanos, no es un modelo económico con futuro.&lt;/p&gt;
&lt;p&gt;En rigor, si queremos animar a investigadores de todo el mundo a poner los documentos históricos al alcance de un público más amplio,
&lt;mark&gt;el coste de las ediciones críticas digitales tendría que bajar varios órdenes de magnitud&lt;/mark&gt;
.&lt;/p&gt;
&lt;h2 id="un-listón-muy-alto"&gt;Un listón muy alto&lt;/h2&gt;
&lt;p&gt;Paradójicamente,
&lt;mark&gt;la solución puede venir de proyectos tan intensivos en trabajo como
, pues constituyen un valioso conjunto de entrenamiento&lt;/mark&gt;
con el que automatizar algunas de las tareas más ingratas y repetitivas de la edición digital, empezando por el marcado.&lt;/p&gt;
&lt;p&gt;No es que el marcado sea cosa menor. Al contrario:
&lt;mark&gt;se ha convertido en el componente indispensable de cualquier proyecto digital serio.&lt;/mark&gt;
Normalizado por la
, permite registrar cuantos aspectos se quiera del documento y del texto que transmite: estructura, notas marginales, tachaduras, variantes, tipo de papel, manchas, caligrafía&amp;hellip; Lo que se le ocurra.&lt;/p&gt;
&lt;p&gt;El siguiente ejemplo, tomado de
, muestra cómo el marcado enriquece el texto con información añadida (categoría, estructura, campos semánticos, tachaduras, etc.), y da así a las ediciones digitales una ventaja considerable sobre sus antepasadas de papel.&lt;/p&gt;
&lt;table&gt;
&lt;tr&gt;
&lt;th&gt; Texto plano &lt;/th&gt;
&lt;th&gt; Marcado XML&lt;/th&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Pour rompre grenades et donner
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;violence aux artifices de foeu
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Mects parmy la pouldre et la sixiesme
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;partye dicelle de vif argent
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/td&gt;
&lt;td&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;div&lt;/span&gt; &lt;span class="na"&gt;id=&lt;/span&gt;&lt;span class="s"&gt;&amp;#34;p008r_2&amp;#34;&lt;/span&gt; &lt;span class="na"&gt;categories=&lt;/span&gt;&lt;span class="s"&gt;&amp;#34;arms and armor&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;head&amp;gt;&lt;/span&gt;Pour rompre &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;grenades&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; et donner&lt;span class="nt"&gt;&amp;lt;lb/&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;violence aux &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;artifices de foeu&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&amp;lt;/head&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;ab&amp;gt;&lt;/span&gt;Mects parmy la &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;pouldre&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;del&amp;gt;&amp;lt;ms&amp;gt;&lt;/span&gt;six fois autant&lt;span class="nt"&gt;&amp;lt;/ms&amp;gt;&lt;/span&gt; de
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;vif argent&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&amp;lt;/del&amp;gt;&amp;lt;lb/&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;del&amp;gt;&lt;/span&gt;et&lt;span class="nt"&gt;&amp;lt;/del&amp;gt;&lt;/span&gt; &lt;span class="nt"&gt;&amp;lt;ms&amp;gt;&lt;/span&gt;la sixiesme partye&lt;span class="nt"&gt;&amp;lt;/ms&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; dicelle de &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;vif argent&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&amp;lt;/ab&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;/div&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/table&gt;
&lt;p&gt;Esta información no solo vale con fines archivísticos; como he mostrado en otras ocasiones, sirve también para la síntesis y el análisis. Con todo, anotar así un texto puede llevar muchísimo tiempo, sobre todo porque el mismo texto suele tener que existir en varias versiones: traducción, transcripción, modernización, etc.&lt;/p&gt;
&lt;h1 id="la-solución"&gt;La solución&lt;/h1&gt;
&lt;h2 id="los-transformadores-el-camino-más-corto-hacia-la-automatización"&gt;Los transformadores: ¿el camino más corto hacia la automatización?&lt;/h2&gt;
&lt;p&gt;En 2020,
presentó a bombo y platillo su última familia de modelos de lenguaje de gran escala y propósito general, GPT-3, siglas de «Generative Pre-trained Transformer 3». Los transformadores son un avance reciente de la inteligencia artificial: aprenden tareas nuevas con una rapidez asombrosa, con solo leer una instrucción (&lt;em&gt;prompt&lt;/em&gt;) y ver un puñado de ejemplos. Admiten además un entrenamiento adicional con datos ad hoc (el &lt;em&gt;fine-tuning&lt;/em&gt; o ajuste fino), que mejora la latencia y la precisión. De ahí que se diga que GPT-3 y sus semejantes son
(&lt;em&gt;few-shot learners&lt;/em&gt;).&lt;/p&gt;
&lt;p&gt;Según OpenAI, GPT-3 contiene la cifra récord de 175 000 millones de parámetros y se ha entrenado con más de 570 GB de texto, en su mayoría documentos en inglés extraídos, cabe suponer, de
. Por su mero tamaño, GPT-3 ha fijado un nuevo estándar en el campo, y ejecuta de entrada las tareas más variadas con un realismo inquietante: escribe
verosímiles,
en salas de chat,
,
, traduce documentos, explica la jerga de las profesiones, etc.&lt;/p&gt;
&lt;p&gt;Con acceso anticipado a la API de OpenAI desde mayo de 2021, he podido poner a prueba la capacidad del modelo para resolver tareas de reconocida dificultad: traducir al inglés poesía francesa y textos neolatinos, explicar analogías e incluso simplificar el libro 4 de la &lt;em&gt;Fundamentación de la metafísica de las costumbres&lt;/em&gt; de Kant para un niño de siete años (sin demasiado éxito, hay que decirlo).&lt;/p&gt;
&lt;h3 id="codex"&gt;Codex&lt;/h3&gt;
&lt;p&gt;Uno de los últimos desarrollos de GPT-3 se ocupa de los lenguajes de programación. Se llama &lt;em&gt;Codex&lt;/em&gt; y traduce el lenguaje natural a código, y viceversa. Si busco, por ejemplo, una expresión regular que me permita «encontrar solo las palabras que empiezan por mayúscula», GPT-3 la convierte al instante en una expresión regular que funciona: &lt;code&gt;[A-Z]+\w+&lt;/code&gt;.&lt;/p&gt;
&lt;p&gt;OpenAI asegura que &lt;em&gt;Codex&lt;/em&gt; maneja una docena de lenguajes, entre ellos Python, JavaScript, Go, Perl, PHP, Ruby y Swift. Al pasar del pseudocódigo al código sin fisuras, &lt;em&gt;Codex&lt;/em&gt; permite concentrarse no en la sintaxis puntillosa de un lenguaje, sino en los pasos lógicos y las estrategias con que una aplicación resuelve un problema.&lt;/p&gt;
&lt;h3 id="más-allá-de-openai"&gt;Más allá de OpenAI&lt;/h3&gt;
&lt;p&gt;OpenAI no es, desde luego, el único actor en escena. Como ya se ha dicho, la Academia de Inteligencia Artificial de Pekín anunció en 2021 un modelo aún mayor y más capaz, &lt;em&gt;Wu Dao 2&lt;/em&gt;. Nvidia y Microsoft unieron fuerzas para producir el modelo &lt;em&gt;Megatron-Turing NLG 530B&lt;/em&gt;, de nombre bien elegido. Empresas emergentes de menor tamaño, como
y
, ofrecen también sus API al público, y merecen mención iniciativas de código abierto como
. El panorama, claro está, cambia a gran velocidad; para seguir las novedades del campo, consulte
.&lt;/p&gt;
&lt;h1 id="los-experimentos"&gt;Los experimentos&lt;/h1&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;Nota&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;El objetivo de estos experimentos es dar con el camino más económico hacia una automatización fiable de las tareas editoriales. Se dirá que algunas podrían automatizarse también con algoritmos de aprendizaje supervisado; exploraremos esa hipótesis en una próxima entrada.&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;¿Puede un transformador como GPT-3 aprender a anotar, pongamos por caso, un manuscrito técnico y científico del siglo XVI?&lt;/p&gt;
&lt;h2 id="experimento-1-categorizar-textos"&gt;Experimento 1: categorizar textos&lt;/h2&gt;
&lt;p&gt;Empecemos por algo relativamente sencillo. Como «aprendiz con pocos ejemplos», GPT-3 debería captar en poco tiempo el modo en que nuestro equipo editorial ha clasificado las entradas del Ms. Fr. 640.&lt;/p&gt;
&lt;h3 id="diseño-del-prompt"&gt;Diseño del prompt&lt;/h3&gt;
&lt;p&gt;Para entrenarlo usé un prompt mínimo y elegí como ejemplos cuatro entradas breves en texto plano, entre ellas una de «medicina», otra de «armas y armaduras» y otra de «pintura».&lt;/p&gt;
&lt;h3 id="prueba"&gt;Prueba&lt;/h3&gt;
&lt;p&gt;Después copié un pasaje que no formaba parte de la secuencia inicial:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Working neatly
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Never put down, if you can, two colors one on top of the other.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;But next, having made your design carefully, keep the place of shadows for them alone,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;amp; also separately that of lights &amp;amp; highlights, without layering one color all over &amp;amp; then highlighting or else shading on it.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;And in this way, you further your work, economize your colors &amp;amp; work neatly.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Which is the reason that, the colors not being muddled nor mixed together, they do not die &amp;amp; you soften the colors better, since they are not so thick.
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;El resultado se ajusta perfectamente al contenido:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;categories&lt;/span&gt;&lt;span class="err"&gt;=&amp;#34;painting&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Si probamos con una entrada de una categoría que ni siquiera figuraba entre los textos elegidos para entrenar a GPT-3, el resultado sorprende.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;categories&lt;/span&gt;&lt;span class="err"&gt;=&amp;#34;jewelry&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="resultado"&gt;Resultado&lt;/h3&gt;
&lt;p&gt;La categoría «jewelry» (joyería) no existe en nuestra edición del Ms. Fr. 640: el equipo editorial
la más amplia de «Stones» (piedras). La intuición de GPT-3, sin embargo, es buena, y hace pensar que con un poco más de entrenamiento podría aprender a categorizar cualquier entrada del Ms. Fr. 640, y acaso las de otros textos técnicos del siglo XVI.&lt;/p&gt;
&lt;h2 id="experimento-2-marcado-semántico"&gt;Experimento 2: marcado semántico&lt;/h2&gt;
&lt;p&gt;Subamos el listón. Si un transformador como GPT-3 puede aprender a categorizar textos según criterios editoriales concretos, ¿podrá también identificar parte de su marcado?&lt;/p&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;Nota&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;&lt;em&gt;Secrets of Craft and Nature&lt;/em&gt; ofrece una
de etiquetas semánticas y estructurales. Por desgracia, GPT-3 no procesa imágenes, a diferencia de otros proyectos como
. Es probable que futuras versiones de GPT incorporen esa capacidad, imprescindible para reconocer la mayoría de los aspectos estructurales y materiales de un documento. Dejaremos de lado esas etiquetas y nos centraremos en el marcado que no exige reconocer imágenes.&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;h3 id="diseño-del-prompt-1"&gt;Diseño del prompt&lt;/h3&gt;
&lt;p&gt;Las etiquetas semánticas señalan animales, plantas, topónimos, percepciones sensoriales, etc. Para el prompt de entrenamiento escogí unos cuantos ejemplos de la edición:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Input prompt--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;The following is a list of words and their corresponding semantic tags
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;cannons: &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;cannons&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;flasks: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;flasks&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;wooden: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;wooden&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;iron: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;iron&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;parchment: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;parchment&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;goats: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;goats&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;lambs: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;lambs&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;leather: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;leather&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;earth: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;earth&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;fine fatty earth: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;fine fatty earth&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Venice: &lt;span class="nt"&gt;&amp;lt;pl&amp;gt;&lt;/span&gt;Venice&lt;span class="nt"&gt;&amp;lt;/pl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Flemish: &lt;span class="nt"&gt;&amp;lt;pl&amp;gt;&lt;/span&gt;Flemish&lt;span class="nt"&gt;&amp;lt;/pl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;almond: &lt;span class="nt"&gt;&amp;lt;pa&amp;gt;&lt;/span&gt;almond&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;almond oil: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;almond&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; oil&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;walnuts skin: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;walnuts&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; skin&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;molten lead: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;molten lead&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;today: &lt;span class="nt"&gt;&amp;lt;tmp&amp;gt;&lt;/span&gt;today&lt;span class="nt"&gt;&amp;lt;/tmp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;In the past: &lt;span class="nt"&gt;&amp;lt;tmp&amp;gt;&lt;/span&gt;In the past&lt;span class="nt"&gt;&amp;lt;/tmp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Clockmakers: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;Clockmakers&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;red copper: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;red copper&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;crucible: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;crucible&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bellows: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;bellows&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;charcoal: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;charcoal&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;founders: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;founders&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="prueba-1"&gt;Prueba&lt;/h3&gt;
&lt;p&gt;Probemos con el modelo &lt;code&gt;Davinci-codex&lt;/code&gt; unas cuantas palabras fáciles: &lt;em&gt;Apothecary&lt;/em&gt; (boticario), &lt;em&gt;smoke&lt;/em&gt; (humo), &lt;em&gt;glassmakers&lt;/em&gt; (vidrieros), &lt;em&gt;latten&lt;/em&gt; (latón) y &lt;em&gt;snake&lt;/em&gt; (serpiente). El resultado es inmediato e impecable:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Apothecary: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;Apothecary&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;smoke: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;smoke&lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;glassmakers: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;glassmakers&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;latten: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;latten&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;snake: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;snake&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Una prueba más exigente es la de las palabras compuestas, como &lt;em&gt;copper plates&lt;/em&gt; (planchas de cobre), &lt;em&gt;walnut oil&lt;/em&gt; (aceite de nuez) y &lt;em&gt;wood block&lt;/em&gt; (taco de madera): se trata de ver si GPT-3 maneja bien las etiquetas anidadas.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;copper plates: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;copper plates&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;walnut oil: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;walnut&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; oil&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;wood block: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;wood block&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Aquí el resultado es desigual: &lt;code&gt;Davinci-codex&lt;/code&gt; solo etiquetó bien &lt;em&gt;walnut oil&lt;/em&gt;, y no detectó las etiquetas anidadas &lt;code&gt;tl&lt;/code&gt; y &lt;code&gt;m&lt;/code&gt; en &lt;em&gt;copper plates&lt;/em&gt; y &lt;em&gt;wood block&lt;/em&gt;. Ahora bien, como muestra la siguiente prueba, estos errores se corrigen con un prompt de entrenamiento mejor. Tras añadir cinco ejemplos más de etiquetas anidadas, &lt;code&gt;Davinci-codex&lt;/code&gt; devolvió un resultado casi perfecto, con un solo fallo (&lt;em&gt;oil paintbrushes&lt;/em&gt;):&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;cannon powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;wp&amp;gt;&lt;/span&gt;cannon&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;arquebus powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;wp&amp;gt;&lt;/span&gt;arquebus&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;oil paintbrushes: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;al&amp;gt;&lt;/span&gt;oil&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt; paintbrushes&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;sheep footbones: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;al&amp;gt;&lt;/span&gt;sheep&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt; footbones&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bronze mortar: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&amp;lt;m&amp;gt;&lt;/span&gt;bronze&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt; mortar&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h1 id="conclusión"&gt;Conclusión&lt;/h1&gt;
&lt;p&gt;Conviene no olvidar que estas pruebas se hicieron con fragmentos de texto muy breves. Sospecho que, con más contexto en los ejemplos y en el prompt, los modelos GPT-3 rendirían aún mejor; y el ajuste fino con datos de entrenamiento ad hoc mejoraría sin duda la precisión del etiquetado.&lt;br&gt;
Aunque haría falta repetir estos experimentos a mayor escala para demostrar la fiabilidad de los modelos de lenguaje preentrenados, sí cabe concluir que
&lt;mark&gt;este enfoque permite a los editores automatizar varias tareas de anotación en unos pocos pasos, con un ahorro potencial enorme de tiempo y dinero.&lt;/mark&gt;
&lt;/p&gt;</description></item></channel></rss>