<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>تصحیح کارآمد |</title><link>https://clementgodbarge.com/fa/category/%D8%AA%D8%B5%D8%AD%DB%8C%D8%AD-%DA%A9%D8%A7%D8%B1%D8%A7%D9%85%D8%AF/</link><atom:link href="https://clementgodbarge.com/fa/category/%D8%AA%D8%B5%D8%AD%DB%8C%D8%AD-%DA%A9%D8%A7%D8%B1%D8%A7%D9%85%D8%AF/index.xml" rel="self" type="application/rss+xml"/><description>تصحیح کارآمد</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>fa</language><lastBuildDate>Thu, 07 Jul 2022 19:04:14 +0200</lastBuildDate><image><url>https://clementgodbarge.com/media/icon_hu_64a6c3bec25b3d7b.png</url><title>تصحیح کارآمد</title><link>https://clementgodbarge.com/fa/category/%D8%AA%D8%B5%D8%AD%DB%8C%D8%AD-%DA%A9%D8%A7%D8%B1%D8%A7%D9%85%D8%AF/</link></image><item><title>تجزیهٔ کتاب‌شناختی در مقیاس بزرگ با مدل‌های زبانی پیش‌آموخته</title><link>https://clementgodbarge.com/fa/post/bibliography/</link><pubDate>Thu, 07 Jul 2022 19:04:14 +0200</pubDate><guid>https://clementgodbarge.com/fa/post/bibliography/</guid><description>&lt;p&gt;خودکارسازی کلید کاهش هزینهٔ پروژه‌های علوم انسانی دیجیتال است. تا امروز، کارهای تکراری و ملال‌آور تصحیح در محیط‌های دانشگاهی یا با هزینهٔ گزاف بر دوش پژوهشگرانِ غرق در کار افتاده، یا به دانشجویان «برون‌سپاری» شده است. در این
استدلال می‌کنم که بیشتر این کارهای ناسپاس نه‌فقط &lt;em&gt;می‌توانند&lt;/em&gt;، بلکه &lt;em&gt;باید&lt;/em&gt; خودکار شوند. خودکارسازی کارهای تصحیح هزینهٔ کلی پروژه‌های علوم انسانی دیجیتال را پایین می‌آورد. و مهم‌تر از آن، به پژوهشگران مناطق کم‌درآمد امکان می‌دهد اسناد ارزشمند را سریع و ارزان منتشر کنند.&lt;/p&gt;
&lt;p&gt;در
برای نمونه نشان دادم که مدل‌های زبانی پیش‌آموخته چگونه می‌توانند بیشتر کار برچسب‌زنی XML یک نسخهٔ دیجیتال را بر عهده بگیرند.&lt;/p&gt;
&lt;p&gt;در این یادداشت نمونهٔ دومی می‌آورم، این بار با کتاب‌شناسی.&lt;/p&gt;
&lt;h2 id="مسئله"&gt;مسئله&lt;/h2&gt;
&lt;p&gt;ساختن یک پایگاه‌دادهٔ کتاب‌شناختی از ارجاع‌های یک مقالهٔ علمی کار چندان پیچیده‌ای نیست. می‌توان در فهرستی مانند
جست‌وجویی سریع کرد و ارجاع را در قالبی مشخص دانلود کرد، یا آن را خودکار از پایگاه‌داده‌ای محلی وارد کرد. این روش برای یکی دو مقاله خوب جواب می‌دهد.
اما از شمار معینی ارجاع به بعد، کار خشک و وقت‌گیر می‌شود. برای چاره، می‌توان از الگوریتم‌های تجزیه مانند
کمک گرفت. اما مقیاس دادن به این الگوریتم‌ها دشوار است.
وقتی anystyle را برای تبدیل بیش از 150 جستار علمیِ گنجانده‌شده در
به کار بردم، حجم خطاهای انباشته به‌سادگی مدیریت‌شدنی نبود. بسیاری از منابع ما را درست تشخیص نداد؛ مثلاً عنوان‌های بلند کتاب‌های اوایل دورهٔ مدرن را با چیز دیگری اشتباه گرفت، و اسناد کمتر متعارف مانند صفحه‌های وب خاص، ویدئوهای آنلاین و مانند این‌ها را نشناخت. تجزیه‌گرها به شرطی خوب کار می‌کنند که نویسنده مو به مو از قواعد یک شیوه‌نامهٔ شناخته‌شده مانند Chicago، Turabian یا MLA پیروی کند. هر انحرافی از هنجار به خطا می‌انجامد.&lt;/p&gt;
&lt;h2 id="راه-حل"&gt;راه حل&lt;/h2&gt;
&lt;p&gt;اینجاست که
&lt;mark&gt;مدل‌های زبانی پیش‌آموخته&lt;/mark&gt;
به کار می‌آیند، چون
&lt;mark&gt;الگوهای هر سبک کتاب‌شناختی را به‌سرعت درمی‌یابند&lt;/mark&gt;
، حتی سبکی که خودتان ابداع کرده باشید، و تنها با چند مثال، حجم بزرگی از کتاب‌شناسیِ قالب‌بندی‌شده را به‌درستی به
برمی‌گردانند.&lt;/p&gt;
&lt;p&gt;در اوایل 2021 این بخت را داشتم که به
شرکت OpenAI دسترسی زودهنگام پیدا کنم. Codex مدلی است که به کاربران امکان می‌دهد زبان طبیعی را به کد ترجمه کنند و برعکس. OpenAI مدعی است این مدل در بیش از ده‌دوازده زبان برنامه‌نویسی چیره‌دست است، و هرچند API آن در زمان نوشتن این یادداشت هنوز به‌صورت بتا در دسترس است، همین حالا موتور برنامه‌های محبوبی مانند
گیت‌هاب است.&lt;/p&gt;
&lt;p&gt;پس از کمی ور رفتن با این API، دریافتم که با کدهای ساده‌تری مانند &lt;code&gt;BibTeX&lt;/code&gt; هم بسیار خوب کار می‌کند.&lt;/p&gt;
&lt;p&gt;و در واقع تنها با چهار مثال در پرامپت ورودی توانستم آن را به‌طور قابل اعتمادی به کار بیندازم.&lt;/p&gt;
&lt;h3 id="پرامپت-ورودی"&gt;پرامپت ورودی&lt;/h3&gt;
&lt;p&gt;References:
Bayle, Ariane. “Patients exemplaires: la correspondance médicale de Fioravanti.” In &lt;em&gt;Vulgariser la médecine. Du style médical en France et en Italie&lt;/em&gt;, edited by Andrea Carlino and Michel Jeanneret, 181–212. Geneva: Droz, 2009.&lt;/p&gt;
&lt;p&gt;Berns, Andrew D. &lt;em&gt;The Bible and Natural Philosophy in Renaissance Italy: Jewish and Christian Physicians in Search of Truth&lt;/em&gt;. Cambridge: Cambridge University Press, 2015.&lt;/p&gt;
&lt;p&gt;Gabler, Hans Walter. “Theorizing the Digital Scholarly Edition.” &lt;em&gt;Literature Compass&lt;/em&gt; 7, no. 2 (2010): 43–56.
.&lt;/p&gt;
&lt;p&gt;Findlen, Paula. &lt;em&gt;Possessing Nature: Museums, Collecting, and Scientific Culture in Early Modern Italy&lt;/em&gt;. Berkeley: University of California Press, 1994.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-BibTeX" data-lang="BibTeX"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@incollection&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;bayle2009&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Bayle, Ariane}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;booktitle&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Vulgariser la médecine. Du style médical en France et en Italie}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Patients exemplaires: la correspondance médicale de Fioravanti}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;editor&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Carlino, Andrea and Michel Jeanneret}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;year&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2009}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Geneva}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;publisher&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Droz}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{french}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@book&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;berns2015&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{The Bible and Natural Philosophy in Renaissance Italy: Jewish and Christian Physicians in Search of Truth}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Berns, Andrew D.}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Cambridge}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;publisher&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Cambridge University Press}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{english}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;date&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2015}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@article&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;gabler2010&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Gabler, Hans Walter}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Theorizing the Digital Scholarly Edition}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;journal&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Literature Compass}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;volume&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{7}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;number&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;pages&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{43-56}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;doi&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{10.1111/j.1741-4113.2009.00675.x}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{english}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;year&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{2010}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@book&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;findlen1994&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Possessing Nature: Museums, Collecting, and Scientific Culture in Early Modern Italy}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Findlen, Paula}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Berkeley}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;publisher&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{University of California Press}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{english}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;date&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{1994}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="نتایج"&gt;نتایج&lt;/h3&gt;
&lt;p&gt;
&lt;mark&gt;چشمگیر است: بیش از 2,000 ارجاع کتاب‌شناختی ظرف چند روز تبدیل شد.&lt;/mark&gt;
این رویکرد نه‌فقط الگوی پرامپت ورودی مرا دقیق بازتولید کرد، بلکه انواع مدخل و فیلدهایی را هم که در پرامپت ورودی نبودند به‌درستی افزود. به عبارت دیگر، &lt;code&gt;GPT-3&lt;/code&gt; به &lt;code&gt;BibTeX&lt;/code&gt; کاملاً مسلط است. و شاید شگفت‌انگیزتر، برای مدلی که اساساً به انگلیسی آموزش دیده، همهٔ زبان‌ها (روسی، فرانسوی، ایتالیایی، لاتین، یونانی، آلمانی، اسپانیایی و جز این‌ها) را تشخیص داد و هر بار فیلد &lt;code&gt;langid&lt;/code&gt; درست را افزود.&lt;/p&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;نکته&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;GPT-3 در حال حاضر اندازهٔ ورودی و خروجی محدودی دارد و حداکثر 2048 توکن زبانی را پردازش می‌کند. به محض برداشته شدن این محدودیت، همین کار احتمالاً یک ساعت یا کمتر طول خواهد کشید.&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;تا حدی غیرمنتظره، GPT-3 اطلاعاتی را هم افزود که در ارجاع‌های اصلی نبود.&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;Baillot, Anne, and Anna Busch. “Editing for Man and Machine.” In &lt;em&gt;Users of Scholarly Editions: Editorial Anticipations of Reading, Studying and Consulting&lt;/em&gt;, Vol. 13. Variants (Journal of the European Society for Textual Scholarship). Leicester, 2015.&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;در این ارجاع کتاب‌شناختی، برای نمونه، GPT-3 پیوند دائمی مخزن دسترسی آزاد (
) را که مقاله در آن خواندنی است افزود، همراه با فیلدهای اختصاصی &lt;code&gt;HAL_ID&lt;/code&gt; و &lt;code&gt;HAL_VERSION&lt;/code&gt; که مخزن HAL ساخته است:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-BibTeX" data-lang="BibTeX"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@inproceedings&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;baillot2015&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Editing for Man and Machine}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Baillot, Anne and Busch, Anna}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;year&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="m"&gt;2015&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;booktitle&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Users of Scholarly Editions: Editorial Anticipations of Reading, Studying and Consulting}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Leicester}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;series&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Variants (Journal of the European Society for Textual Scholarship)}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;volume&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="m"&gt;13&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;editor&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Bruhn, Siglinde and Schreiber, Manfred}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{english}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;hal_id&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{halshs-01233380}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;hal_version&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{v1}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;این افزوده‌ها نشان می‌دهند که
&lt;mark&gt;GPT-3 تنها ارجاع کتاب‌شناختی را تجزیه نمی‌کند، بلکه آن را بر پایهٔ آنچه در آموزش اولیه آموخته تکمیل هم می‌کند.&lt;/mark&gt;
از این نظر جالب خواهد بود ببینیم با ارجاع‌هایی که تاریخشان پس از آموزش GPT-3 است نیز همین رفتار را دارد یا نه&amp;hellip;&lt;/p&gt;
&lt;h2 id="محدودیتها"&gt;محدودیت‌ها&lt;/h2&gt;
&lt;p&gt;با این حال GPT-3 بی‌عیب نیست و به نظارت انسانی نیاز دارد. یکی از محدودیت‌های شناخته‌شده‌اش
است: گاهی چیزهایی از خود می‌سازد و فرض‌های نامحتملی می‌کند.&lt;/p&gt;
&lt;p&gt;در آزمایش من، ناسازگاری‌های GPT-3 آنجا آشکار شد که خودسرانه نام خانوادگی نویسنده‌ای را از «Ruscelli» به «Ruscello» تغییر داد. این از نظر فنی خطا نیست، چون نام‌های خانوادگی ایتالیایی در اوایل دورهٔ مدرن را می‌شد بی‌تفاوت به صورت جمع یا مفرد به کار برد. اما قرارداد امروز این است که نام خانوادگی، جمع باشد یا مفرد، همان‌طور که هست نگه داشته شود. امروز هیچ‌کس ماکیاوللی را ماکیاوللو نمی‌خواند، همان‌طور که از ما انتظار می‌رود به جای Rosselli بگوییم Rossello. آیا GPT-3 این قرارداد را از سر بی‌خبری از گاه‌شماری نادیده گرفته؟ یا بر پایهٔ نام‌های خانوادگی همسایه، که در این بخش از کتاب‌شناسی همگی اتفاقاً مفردند (Bariletto، Cesano، Rossello)، فرضی کرده است؟
که می‌داند.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-Bibtex" data-lang="Bibtex"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@book&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;rossello1565&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Della summa de’ secreti universali}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Rossello, Timoteo}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Venice}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;publisher&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Giovanni Bariletto}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{italian}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;date&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{1565}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nc"&gt;@book&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;ruscello1559&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;title&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{La seconda parte de’ secreti del Reverendo Donno Alessio Piemontese}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;author&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Ruscello, Girolamo}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;address&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Pesaro}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;publisher&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{Bartolomeo Cesano}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;langid&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{italian}&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="na"&gt;date&lt;/span&gt; &lt;span class="p"&gt;=&lt;/span&gt; &lt;span class="s"&gt;{1559}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="نتیجهگیری"&gt;نتیجه‌گیری&lt;/h2&gt;
&lt;p&gt;بیش از 150 جستارِ
، که حاصل چهار سال همکاری فشرده است، نه‌فقط اطلاعات حیاتی‌ای دربارهٔ دست‌نویسی که تصحیح و ترجمه کردیم به دست می‌دهند، بلکه اطلاعات کتاب‌شناختی ارزشمندی نیز در خود دارند.&lt;/p&gt;
&lt;p&gt;گرد آوردن این ارجاع‌های کتاب‌شناختی در یک پایگاه‌داده به مصححان امکان می‌دهد قالب کتاب‌شناسی را در چشم‌به‌هم‌زدنی تغییر دهند و این اطلاعات را هر طور که می‌خواهند نمایش دهند. این پایگاه‌داده اطلاعات ارزشمندی نیز دربارهٔ نسخه و پروژه‌ای که آن را ممکن ساخت به دست می‌دهد و چشم‌اندازهای تحلیلی تازه‌ای پیش روی پژوهشگران می‌گشاید. چنین پایگاه‌داده‌ای را می‌توان با دقتی بالا و در زمانی بی‌سابقه تکمیل کرد.&lt;/p&gt;
&lt;p&gt;البته ممکن است خطاهایی رخنه کنند، به‌ویژه به سبب گرایش GPT-3 به توهم. اما نسل‌های آیندهٔ مدل‌های زبانی پیش‌آموخته این مشکل را کاهش خواهند داد.&lt;/p&gt;</description></item><item><title>خودکارسازی نشانه‌گذاری در نسخه‌های علمی دیجیتال</title><link>https://clementgodbarge.com/fa/post/gpt3/</link><pubDate>Mon, 22 Nov 2021 18:15:00 +0000</pubDate><guid>https://clementgodbarge.com/fa/post/gpt3/</guid><description>&lt;h1 id="مقدمه"&gt;مقدمه&lt;/h1&gt;
&lt;p&gt;چگونه می‌توان نسخه‌های علمی دیجیتال را بی‌آنکه خزانه را خالی کند تولید کرد؟ در این یادداشت، که نخستین از سلسله‌یادداشت‌هایی دربارهٔ تصحیح کارآمد است، نقشی را می‌سنجم که مدل‌های زبانی پیش‌آموخته می‌توانند در خودکارسازی کارهای تصحیح، از جمله نشانه‌گذاری معنایی، ایفا کنند.&lt;/p&gt;
&lt;details class="print:hidden xl:hidden" &gt;
&lt;summary&gt;فهرست مطالب&lt;/summary&gt;
&lt;div class="text-sm"&gt;
&lt;nav id="TableOfContents"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#کار-عاشقانه"&gt;کار عاشقانه&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#آستانهای-بلند"&gt;آستانه‌ای بلند&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#ترنسفورمرها-سادهترین-راه-خودکارسازی"&gt;ترنسفورمرها: ساده‌ترین راه خودکارسازی؟&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#codex"&gt;Codex&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#فراتر-از-openai"&gt;فراتر از OpenAI&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#آزمایش-1--دستهبندی-متن"&gt;آزمایش 1 &amp;ndash; دسته‌بندی متن.&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#مهندسی-پرامپت"&gt;مهندسی پرامپت&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#آزمون"&gt;آزمون&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#نتیجه"&gt;نتیجه&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;a href="#آزمایش-2--نشانهگذاری-معنایی"&gt;آزمایش 2 &amp;ndash; نشانه‌گذاری معنایی&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#مهندسی-پرامپت-1"&gt;مهندسی پرامپت&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#آزمون-1"&gt;آزمون&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/nav&gt;
&lt;/div&gt;
&lt;/details&gt;
&lt;h1 id="مسئله"&gt;مسئله&lt;/h1&gt;
&lt;h2 id="کار-عاشقانه"&gt;کار عاشقانه&lt;/h2&gt;
&lt;p&gt;در کار عشق حساب و کتاب نمی‌کنند&amp;hellip; یا دست‌کم ضرب‌المثل قدیمی چنین می‌گوید. این حرف دربارهٔ نسخه‌های علمی دیجیتال به‌ویژه صادق است، چرا که بازنویسی، ترجمه و حاشیه‌نویسیِ لازم برای ساختن آن‌ها هزاران ساعت کار می‌طلبد؛ کاری که در مورد
صدها همکار بسیار متخصص بر عهده گرفتند.&lt;/p&gt;
&lt;p&gt;از یک نظر، اینکه پروژه‌های پرآوازهٔ علوم انسانی دیجیتال می‌توانند بودجه‌های هنگفتِ لازم برای ادامهٔ کار را به دست آورند، موهبتی است. اما اتکای سنگین به دست‌ودل‌بازی بنیادهای ثروتمند، دانشگاه‌ها و نهادهای دولتی، و نیاز درازمدت به نیروی انسانی فراوان، الگوی اقتصادی پایداری برای آینده نیست.&lt;/p&gt;
&lt;p&gt;در واقع، اگر می‌خواهیم پژوهشگران سراسر جهان را تشویق کنیم که اسناد تاریخی را در دسترس عموم بگذارند،
&lt;mark&gt;هزینهٔ تصحیح‌های انتقادی دیجیتال باید چندین مرتبهٔ بزرگی کاهش یابد&lt;/mark&gt;
.&lt;/p&gt;
&lt;h2 id="آستانهای-بلند"&gt;آستانه‌ای بلند&lt;/h2&gt;
&lt;p&gt;شاید کمی تناقض‌آمیز بنماید، اما
&lt;mark&gt;راه حل چه بسا از دل همین پروژه‌های پرزحمت مانند
بیرون بیاید، زیرا این‌ها مجموعهٔ آموزشی ارزشمندی‌اند&lt;/mark&gt;
برای خودکار کردن برخی از خشک‌ترین و تکراری‌ترین کارهای تصحیح دیجیتال، از جمله نشانه‌گذاری.&lt;/p&gt;
&lt;p&gt;نه اینکه نشانه‌گذاری بی‌اهمیت باشد. برعکس،
&lt;mark&gt;نشانه‌گذاری به جزء جدایی‌ناپذیر هر پروژهٔ علمی دیجیتالِ جدی بدل شده است.&lt;/mark&gt;
این کار، که
آن را استاندارد کرده، به ما امکان می‌دهد تا آنجا که ممکن است جنبه‌های سند و متنی را که سند حامل آن است ثبت کنیم: ساختار، حاشیه‌نوشته‌ها، خط‌خوردگی‌ها، نسخه‌بدل‌ها، نوع کاغذ، لکه‌ها، خوشنویسی&amp;hellip; هر چه بخواهید.&lt;/p&gt;
&lt;p&gt;نمونهٔ زیر، برگرفته از
، نشان می‌دهد که نشانه‌گذاری چگونه متن را با اطلاعات افزوده (مقوله، ساختار، حوزه‌های معنایی، خط‌خوردگی‌ها و جز آن) غنی می‌کند و در نهایت به نسخه‌های دیجیتال برتری چشمگیری بر نیاکان کاغذی‌شان می‌بخشد.&lt;/p&gt;
&lt;table&gt;
&lt;tr&gt;
&lt;th&gt; Plain Text &lt;/th&gt;
&lt;th&gt; XML Markup&lt;/th&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Pour rompre grenades et donner
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;violence aux artifices de foeu
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Mects parmy la pouldre et la sixiesme
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;partye dicelle de vif argent
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/td&gt;
&lt;td&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;div&lt;/span&gt; &lt;span class="na"&gt;id=&lt;/span&gt;&lt;span class="s"&gt;&amp;#34;p008r_2&amp;#34;&lt;/span&gt; &lt;span class="na"&gt;categories=&lt;/span&gt;&lt;span class="s"&gt;&amp;#34;arms and armor&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;head&amp;gt;&lt;/span&gt;Pour rompre &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;grenades&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; et donner&lt;span class="nt"&gt;&amp;lt;lb/&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;violence aux &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;artifices de foeu&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&amp;lt;/head&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;ab&amp;gt;&lt;/span&gt;Mects parmy la &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;pouldre&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;del&amp;gt;&amp;lt;ms&amp;gt;&lt;/span&gt;six fois autant&lt;span class="nt"&gt;&amp;lt;/ms&amp;gt;&lt;/span&gt; de
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;vif argent&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&amp;lt;/del&amp;gt;&amp;lt;lb/&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;del&amp;gt;&lt;/span&gt;et&lt;span class="nt"&gt;&amp;lt;/del&amp;gt;&lt;/span&gt; &lt;span class="nt"&gt;&amp;lt;ms&amp;gt;&lt;/span&gt;la sixiesme partye&lt;span class="nt"&gt;&amp;lt;/ms&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; dicelle de &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;vif argent&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&amp;lt;/ab&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;/div&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/table&gt;
&lt;p&gt;این اطلاعات نه‌فقط برای آرشیو ارزشمند است، بلکه چنان‌که پیش‌تر در جاهای دیگر نشان داده‌ام، به کار ترکیب و تحلیل هم می‌آید. با این حال، این نوع حاشیه‌نویسی می‌تواند بی‌اندازه وقت‌گیر باشد، چرا که یک متن واحد اغلب باید به چند صورت در دسترس باشد: به‌صورت ترجمه، بازنویسی، نسخهٔ امروزی‌شده و جز آن.&lt;/p&gt;
&lt;h1 id="راه-حل"&gt;راه حل&lt;/h1&gt;
&lt;h2 id="ترنسفورمرها-سادهترین-راه-خودکارسازی"&gt;ترنسفورمرها: ساده‌ترین راه خودکارسازی؟&lt;/h2&gt;
&lt;p&gt;در سال 2020،
با سر و صدای بسیار تازه‌ترین خانوادهٔ مدل‌های زبانی بزرگ و همه‌منظوره‌اش را با نام GPT-3 عرضه کرد؛ نامی که کوتاه‌شدهٔ «Generative Pre-trained Transformer 3» است. ترنسفورمرها دستاورد نسبتاً تازه‌ای در هوش مصنوعی‌اند. با سرعتی چشمگیر کارهای تازه می‌آموزند: کافی است یک پرامپت بخوانند و شمار بسیار اندکی مثال ببینند. می‌توان آن‌ها را با مجموعه‌داده‌ای اختصاصی نیز آموزش تکمیلی داد (ریزتنظیم) تا سرعت پاسخ و دقتشان بهتر شود. از همین رو می‌گوییم GPT-3 و ترنسفورمرهای همانند آن
(few-shot) هستند.&lt;/p&gt;
&lt;p&gt;OpenAI مدعی است که GPT-3 رقم بی‌سابقهٔ 175 میلیارد پارامتر دارد و بر بیش از 570 گیگابایت متن آموزش دیده که بیشترشان اسناد انگلیسی‌اند و احتمالاً از
گرفته شده‌اند. GPT-3 به لطف ابعاد عظیمش معیار تازه‌ای در این حوزه گذاشته و بی‌هیچ آماده‌سازی، کارهای گوناگونی را با واقع‌نمایی نگران‌کننده‌ای انجام می‌دهد.
باورپذیر می‌نویسد، در اتاق‌های گفت‌وگو
،
،
، اسناد را ترجمه می‌کند، اصطلاحات تخصصی را توضیح می‌دهد، و جز این‌ها.&lt;/p&gt;
&lt;p&gt;از مه 2021 به API شرکت OpenAI دسترسی زودهنگام داشته‌ام و توانسته‌ام توان این مدل را در حل شماری از کارهای به‌اصطلاح دشوار بیازمایم: ترجمهٔ شعر فرانسوی و متون نولاتین به انگلیسی، توضیح قیاس‌ها، و حتی ساده کردن کتاب چهارم &lt;em&gt;بنیاد مابعدالطبیعهٔ اخلاق&lt;/em&gt; کانت برای کودکی هفت‌ساله (هرچند نه چندان قانع‌کننده).&lt;/p&gt;
&lt;h3 id="codex"&gt;Codex&lt;/h3&gt;
&lt;p&gt;یکی از تازه‌ترین تحولات GPT-3 بر زبان‌های رایانه‌ای متمرکز است. این مدل، که &lt;em&gt;Codex&lt;/em&gt; نام دارد، زبان طبیعی را به زبان رایانه ترجمه می‌کند و برعکس. مثلاً اگر دنبال عبارتی باقاعده باشم که «فقط واژه‌هایی را پیدا کند که با حرف بزرگ آغاز می‌شوند»، GPT-3 بی‌درنگ آن را به یک عبارت باقاعدهٔ کارآمد برمی‌گرداند: &lt;code&gt;[A-Z]+\w+&lt;/code&gt;.&lt;/p&gt;
&lt;p&gt;OpenAI مدعی است که &lt;em&gt;Codex&lt;/em&gt; با ده‌دوازده زبان رایانه‌ای، از جمله Python، JavaScript، Go، Perl، PHP، Ruby و Swift کار می‌کند. &lt;em&gt;Codex&lt;/em&gt; با تبدیل روان شبه‌کد به کد، به آدم‌ها امکان می‌دهد به جای نحو خسته‌کنندهٔ یک زبان رایانه‌ای، بر گام‌های منطقی و راهبردهایی تمرکز کنند که برنامه‌ها به کمکشان مسئله حل می‌کنند.&lt;/p&gt;
&lt;h3 id="فراتر-از-openai"&gt;فراتر از OpenAI&lt;/h3&gt;
&lt;p&gt;البته OpenAI تنها بازیگر این میدان نیست. چنان‌که پیش‌تر اشاره شد، آکادمی هوش مصنوعی پکن در 2021 مدلی حتی بزرگ‌تر و تواناتر به نام &lt;em&gt;Wu Dao 2&lt;/em&gt; را اعلام کرد. Nvidia و Microsoft دست به دست هم دادند و مدلی با نام برازندهٔ &lt;em&gt;Megatron-Turing NLG 530B&lt;/em&gt; ساختند. استارتاپ‌های کوچک‌تری مانند
و
نیز APIهایی به عموم عرضه می‌کنند. ابتکارهای متن‌باز مانند
هم شایان ذکرند. صحنهٔ هوش مصنوعی البته با شتاب دگرگون می‌شود؛ برای دنبال کردن ابتکارهای تازهٔ این حوزه، به
سر بزنید.&lt;/p&gt;
&lt;h1 id="آزمایشها"&gt;آزمایش‌ها&lt;/h1&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;نکته&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;هدف این آزمایش‌ها یافتن اقتصادی‌ترین راه به خودکارسازی قابل اعتماد کارهای تصحیح است. می‌توان گفت برخی از این کارها را با الگوریتم‌های یادگیری بانظارت نیز می‌توان خودکار کرد. این فرضیه را در یادداشتی دیگر خواهیم کاوید.&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;آیا ترنسفورمری مانند GPT-3 می‌تواند یاد بگیرد که مثلاً یک دست‌نویس فنی و علمی سدهٔ شانزدهم را حاشیه‌نویسی کند؟&lt;/p&gt;
&lt;h2 id="آزمایش-1--دستهبندی-متن"&gt;آزمایش 1 &amp;ndash; دسته‌بندی متن.&lt;/h2&gt;
&lt;p&gt;با چیزی نسبتاً ساده شروع کنیم. GPT-3، به‌عنوان «یادگیرندهٔ چندنمونه‌ای»، باید بتواند به‌سرعت دریابد که گروه تصحیح ما مدخل‌های Ms Fr 640 را چگونه دسته‌بندی کرده است.&lt;/p&gt;
&lt;h3 id="مهندسی-پرامپت"&gt;مهندسی پرامپت&lt;/h3&gt;
&lt;p&gt;برای آموزش آن، پرامپتی بسیار کمینه به کار بردم و چهار مدخل کوتاه متن ساده را به‌عنوان مثال برگزیدم، از جمله یکی دربارهٔ «پزشکی»، یکی «سلاح و زره» و یکی «نقاشی».&lt;/p&gt;
&lt;h3 id="آزمون"&gt;آزمون&lt;/h3&gt;
&lt;p&gt;سپس قطعهٔ دیگری را که در توالی اولیه نبود کپی کردم:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Working neatly
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Never put down, if you can, two colors one on top of the other.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;But next, having made your design carefully, keep the place of shadows for them alone,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;amp; also separately that of lights &amp;amp; highlights, without layering one color all over &amp;amp; then highlighting or else shading on it.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;And in this way, you further your work, economize your colors &amp;amp; work neatly.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Which is the reason that, the colors not being muddled nor mixed together, they do not die &amp;amp; you soften the colors better, since they are not so thick.
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;خروجی کاملاً با محتوا سازگار است:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;categories&lt;/span&gt;&lt;span class="err"&gt;=&amp;#34;painting&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;اگر مدخلی را بیازماییم که به مقوله‌ای تعلق دارد که حتی در گزینش اولیهٔ متن‌های آموزشی GPT-3 نبوده، نتیجه شگفت‌آور است.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;categories&lt;/span&gt;&lt;span class="err"&gt;=&amp;#34;jewelry&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="نتیجه"&gt;نتیجه&lt;/h3&gt;
&lt;p&gt;مقولهٔ «jewelry» (جواهرات) در نسخهٔ ما از Ms. Fr. 640 وجود ندارد. گروه تصحیح مقولهٔ گسترده‌تر «Stones» (سنگ‌ها) را
. با این حال شمّ GPT-3 خوب است و نشان می‌دهد که با اندکی آموزش بیشتر می‌تواند دسته‌بندی هر مدخل Ms. Fr. 640، و شاید حتی متون فنی مشابه سدهٔ شانزدهم، را بیاموزد.&lt;/p&gt;
&lt;h2 id="آزمایش-2--نشانهگذاری-معنایی"&gt;آزمایش 2 &amp;ndash; نشانه‌گذاری معنایی&lt;/h2&gt;
&lt;p&gt;سطح کار را کمی بالاتر ببریم. اگر ترنسفورمرهایی چون GPT-3 می‌توانند دسته‌بندی متن‌ها را بر پایهٔ معیارهای خاص یک تصحیح بیاموزند، آیا می‌توانند بخشی از نشانه‌گذاری متن را هم تشخیص دهند؟&lt;/p&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;نکته&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;&lt;em&gt;Secrets of Craft and Nature&lt;/em&gt;
از برچسب‌های معنایی و ساختاری به کار می‌برد. متأسفانه GPT-3، برخلاف پروژه‌هایی مانند
، تصویر پردازش نمی‌کند. به احتمال زیاد نسل‌های بعدی GPT این قابلیت را، که برای تشخیص بیشتر جنبه‌های ساختاری و مادی یک سند ضروری است، خواهند داشت. از این برچسب‌های خاص می‌گذریم و در عوض بر نشانه‌گذاری‌ای تمرکز می‌کنیم که به تشخیص تصویر نیاز ندارد.&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;h3 id="مهندسی-پرامپت-1"&gt;مهندسی پرامپت&lt;/h3&gt;
&lt;p&gt;برچسب‌های معنایی شامل ارجاع به جانوران، گیاهان، جای‌نام‌ها، داده‌های حسی و مانند این‌هاست. در پرامپت آموزشی، چند نمونه از نسخه را برگزیدم:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Input prompt--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;The following is a list of words and their corresponding semantic tags
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;cannons: &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;cannons&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;flasks: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;flasks&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;wooden: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;wooden&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;iron: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;iron&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;parchment: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;parchment&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;goats: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;goats&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;lambs: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;lambs&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;leather: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;leather&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;earth: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;earth&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;fine fatty earth: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;fine fatty earth&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Venice: &lt;span class="nt"&gt;&amp;lt;pl&amp;gt;&lt;/span&gt;Venice&lt;span class="nt"&gt;&amp;lt;/pl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Flemish: &lt;span class="nt"&gt;&amp;lt;pl&amp;gt;&lt;/span&gt;Flemish&lt;span class="nt"&gt;&amp;lt;/pl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;almond: &lt;span class="nt"&gt;&amp;lt;pa&amp;gt;&lt;/span&gt;almond&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;almond oil: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;almond&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; oil&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;walnuts skin: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;walnuts&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; skin&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;molten lead: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;molten lead&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;today: &lt;span class="nt"&gt;&amp;lt;tmp&amp;gt;&lt;/span&gt;today&lt;span class="nt"&gt;&amp;lt;/tmp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;In the past: &lt;span class="nt"&gt;&amp;lt;tmp&amp;gt;&lt;/span&gt;In the past&lt;span class="nt"&gt;&amp;lt;/tmp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Clockmakers: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;Clockmakers&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;red copper: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;red copper&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;crucible: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;crucible&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bellows: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;bellows&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;charcoal: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;charcoal&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;founders: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;founders&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="آزمون-1"&gt;آزمون&lt;/h3&gt;
&lt;p&gt;چند واژهٔ ساده را با مدل &lt;code&gt;Davinci-codex&lt;/code&gt; بیازماییم، مانند &lt;em&gt;Apothecary&lt;/em&gt;، &lt;em&gt;smoke&lt;/em&gt;، &lt;em&gt;glassmakers&lt;/em&gt;، &lt;em&gt;latten&lt;/em&gt; و &lt;em&gt;snake&lt;/em&gt;. نتیجه فوری و بی‌نقص است:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Apothecary: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;Apothecary&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;smoke: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;smoke&lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;glassmakers: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;glassmakers&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;latten: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;latten&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;snake: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;snake&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;آزمون دشوارتر، واژه‌های مرکبی چون &lt;em&gt;copper plates&lt;/em&gt;، &lt;em&gt;walnut oil&lt;/em&gt; و &lt;em&gt;wood block&lt;/em&gt; را به میان می‌آورد. هدف این آزمون آن است که ببینیم GPT-3 برچسب‌های تودرتو را درست به کار می‌برد یا نه.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;copper plates: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;copper plates&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;walnut oil: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;walnut&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; oil&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;wood block: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;wood block&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;نتیجه اما دوگانه است: &lt;code&gt;Davinci-codex&lt;/code&gt; تنها &lt;em&gt;walnut oil&lt;/em&gt; را درست برچسب زد و برچسب‌های تودرتوی &lt;code&gt;tl&lt;/code&gt; و &lt;code&gt;m&lt;/code&gt; را در &lt;em&gt;copper plates&lt;/em&gt; و &lt;em&gt;wood block&lt;/em&gt; تشخیص نداد. با این حال، چنان‌که آزمون بعدی در زیر نشان می‌دهد، این خطاها را می‌توان با پرامپت آموزشی بهتری کاهش داد. پس از افزودن پنج نمونهٔ دیگر از برچسب‌های تودرتو، &lt;code&gt;Davinci-codex&lt;/code&gt; نتیجه‌ای تقریباً بی‌نقص برگرداند، با تنها یک خطا (&lt;em&gt;oil paintbrushes&lt;/em&gt;):&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;cannon powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;wp&amp;gt;&lt;/span&gt;cannon&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;arquebus powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;wp&amp;gt;&lt;/span&gt;arquebus&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;oil paintbrushes: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;al&amp;gt;&lt;/span&gt;oil&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt; paintbrushes&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;sheep footbones: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;al&amp;gt;&lt;/span&gt;sheep&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt; footbones&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bronze mortar: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&amp;lt;m&amp;gt;&lt;/span&gt;bronze&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt; mortar&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h1 id="نتیجهگیری"&gt;نتیجه‌گیری&lt;/h1&gt;
&lt;p&gt;نباید از یاد برد که این آزمون‌ها با قطعه‌های کوتاهی از متن انجام شد. گمان می‌کنم اگر در مثال‌ها و پرامپت زمینهٔ بیشتری فراهم شود، مدل‌های GPT-3 نتایج بهتری هم بدهند. افزون بر این، ریزتنظیم مدل با مجموعه‌داده‌های آموزشی اختصاصی بی‌تردید دقت برچسب‌زنی را باز هم بالا خواهد برد.&lt;br&gt;
هرچند این آزمایش‌ها باید در مقیاسی بزرگ‌تر تکرار شوند تا قابل اعتماد بودن مدل‌های زبانی پیش‌آموخته اثبات شود، همین حالا می‌توان نتیجه گرفت که
&lt;mark&gt;این رویکرد به مصححان امکان می‌دهد چندین کار حاشیه‌نویسی را در چند گام ساده خودکار کنند و از این راه بالقوه زمان و هزینهٔ هنگفتی را صرفه‌جویی کنند.&lt;/mark&gt;
&lt;/p&gt;</description></item></channel></rss>