<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>मशीन लर्निंग |</title><link>https://clementgodbarge.com/hi/tag/%E0%A4%AE%E0%A4%B6%E0%A5%80%E0%A4%A8-%E0%A4%B2%E0%A4%B0%E0%A4%A8%E0%A4%BF%E0%A4%97/</link><atom:link href="https://clementgodbarge.com/hi/tag/%E0%A4%AE%E0%A4%B6%E0%A5%80%E0%A4%A8-%E0%A4%B2%E0%A4%B0%E0%A4%A8%E0%A4%BF%E0%A4%97/index.xml" rel="self" type="application/rss+xml"/><description>मशीन लर्निंग</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>hi-in</language><lastBuildDate>Mon, 22 Nov 2021 18:15:00 +0000</lastBuildDate><image><url>https://clementgodbarge.com/media/icon_hu_64a6c3bec25b3d7b.png</url><title>मशीन लर्निंग</title><link>https://clementgodbarge.com/hi/tag/%E0%A4%AE%E0%A4%B6%E0%A5%80%E0%A4%A8-%E0%A4%B2%E0%A4%B0%E0%A4%A8%E0%A4%BF%E0%A4%97/</link></image><item><title>डिजिटल विद्वत्तापूर्ण संस्करणों में मार्कअप का स्वचालन</title><link>https://clementgodbarge.com/hi/post/gpt3/</link><pubDate>Mon, 22 Nov 2021 18:15:00 +0000</pubDate><guid>https://clementgodbarge.com/hi/post/gpt3/</guid><description>&lt;h1 id="भमक"&gt;भूमिका&lt;/h1&gt;
&lt;p&gt;तिजोरी ख़ाली किए बिना डिजिटल विद्वत्तापूर्ण संस्करण कैसे बनाए जाएँ? किफ़ायती संपादन पर समर्पित शृंखला की इस पहली पोस्ट में मैं जायज़ा लेता हूँ कि सिमेंटिक मार्कअप जैसे संपादकीय कामों के स्वचालन में पूर्व-प्रशिक्षित भाषा मॉडल क्या भूमिका निभा सकते हैं।&lt;/p&gt;
&lt;details class="print:hidden xl:hidden" &gt;
&lt;summary&gt;सामग्री तालिका&lt;/summary&gt;
&lt;div class="text-sm"&gt;
&lt;nav id="TableOfContents"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#परम-क-शरम"&gt;प्रेम का श्रम&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#ऊच-दहलज"&gt;ऊँची दहलीज़&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#टरसफरमर-सवचलन-क-सबस-सरल-रसत"&gt;ट्रांसफ़ॉर्मर: स्वचालन का सबसे सरल रास्ता?&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#codex"&gt;Codex&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#openai-स-आग"&gt;OpenAI से आगे&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#परयग-1--पठ-क-वरगकरण"&gt;प्रयोग 1 – पाठ का वर्गीकरण&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#परमपट-इजनयरग"&gt;प्रॉम्प्ट इंजीनियरिंग&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#परकषण"&gt;परीक्षण&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#नतज"&gt;नतीजा&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;a href="#परयग-2--समटक-मरकअप"&gt;प्रयोग 2 – सिमेंटिक मार्कअप&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#परमपट-इजनयरग-1"&gt;प्रॉम्प्ट इंजीनियरिंग&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#परकषण-1"&gt;परीक्षण&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/nav&gt;
&lt;/div&gt;
&lt;/details&gt;
&lt;h1 id="समसय"&gt;समस्या&lt;/h1&gt;
&lt;h2 id="परम-क-शरम"&gt;प्रेम का श्रम&lt;/h2&gt;
&lt;p&gt;प्रेम में हिसाब कौन रखता है… कहावत तो यही कहती है। डिजिटल विद्वत्तापूर्ण संस्करणों पर यह ख़ास तौर पर लागू होती है: उन्हें तैयार करने में प्रतिलेखन, अनुवाद और टिप्पणी का जो काम लगता है, वह हज़ारों घंटों का है, और – जैसा कि
के मामले में हुआ – सैकड़ों उच्च-योग्य सहयोगी उसे अंजाम देते हैं।&lt;/p&gt;
&lt;p&gt;एक अर्थ में यह वरदान ही है कि डिजिटल मानविकी की चर्चित परियोजनाएँ अपने संचालन के लिए ज़रूरी भारी-भरकम धनराशि जुटा पाती हैं। लेकिन धनी फ़ाउंडेशनों, विश्वविद्यालयों और सरकारी एजेंसियों की उदारता पर इतनी निर्भरता, और लंबे अरसे तक बड़े मानव-संसाधन की ज़रूरत – यह भविष्य के लिए कोई टिकाऊ आर्थिक मॉडल नहीं है।&lt;/p&gt;
&lt;p&gt;दरअसल, अगर हम चाहते हैं कि दुनिया भर के शोधकर्ता ऐतिहासिक दस्तावेज़ों को व्यापक जनता तक पहुँचाएँ, तो
&lt;mark&gt;डिजिटल आलोचनात्मक संस्करणों की लागत कई गुना नहीं, कई दर्जे घटनी चाहिए&lt;/mark&gt;
।&lt;/p&gt;
&lt;h2 id="ऊच-दहलज"&gt;ऊँची दहलीज़&lt;/h2&gt;
&lt;p&gt;कुछ विरोधाभासी ढंग से,
&lt;mark&gt;समाधान
जैसी श्रमसाध्य परियोजनाओं से ही आ सकता है, क्योंकि वे एक बहुमूल्य प्रशिक्षण-सामग्री हैं&lt;/mark&gt;
– डिजिटल संपादन के सबसे खीज पैदा करने वाले और दोहराव भरे कामों, जैसे मार्कअप, को स्वचालित करने के लिए।&lt;/p&gt;
&lt;p&gt;ऐसा नहीं कि मार्कअप ग़ैर-ज़रूरी है। सच तो यह है कि
&lt;mark&gt;मार्कअप किसी भी गंभीर डिजिटल विद्वत्तापूर्ण परियोजना का अनिवार्य अंग बन चुका है।&lt;/mark&gt;
द्वारा मानकीकृत यह हमें दस्तावेज़ और उसके ज़रिये आने वाले पाठ के अधिक से अधिक पहलू दर्ज करने देता है: संरचना, हाशिये की टिप्पणियाँ, काट-छाँट, पाठांतर, काग़ज़ का प्रकार, धब्बे, लिखावट… जो चाहे गिन लीजिए।&lt;/p&gt;
&lt;p&gt;
से लिया गया यह उदाहरण दिखाता है कि मार्कअप पाठ को अतिरिक्त जानकारी (श्रेणी, संरचना, सिमेंटिक क्षेत्र, काट-छाँट आदि) से कैसे समृद्ध करता है, और अंततः डिजिटल संस्करणों को उनके काग़ज़ी पूर्वजों पर एक बड़ी बढ़त देता है।&lt;/p&gt;
&lt;table&gt;
&lt;tr&gt;
&lt;th&gt; Plain Text &lt;/th&gt;
&lt;th&gt; XML Markup&lt;/th&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Pour rompre grenades et donner
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;violence aux artifices de foeu
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Mects parmy la pouldre et la sixiesme
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;partye dicelle de vif argent
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/td&gt;
&lt;td&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;div&lt;/span&gt; &lt;span class="na"&gt;id=&lt;/span&gt;&lt;span class="s"&gt;&amp;#34;p008r_2&amp;#34;&lt;/span&gt; &lt;span class="na"&gt;categories=&lt;/span&gt;&lt;span class="s"&gt;&amp;#34;arms and armor&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;head&amp;gt;&lt;/span&gt;Pour rompre &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;grenades&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; et donner&lt;span class="nt"&gt;&amp;lt;lb/&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;violence aux &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;artifices de foeu&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&amp;lt;/head&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;ab&amp;gt;&lt;/span&gt;Mects parmy la &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;pouldre&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;del&amp;gt;&amp;lt;ms&amp;gt;&lt;/span&gt;six fois autant&lt;span class="nt"&gt;&amp;lt;/ms&amp;gt;&lt;/span&gt; de
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;vif argent&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&amp;lt;/del&amp;gt;&amp;lt;lb/&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;del&amp;gt;&lt;/span&gt;et&lt;span class="nt"&gt;&amp;lt;/del&amp;gt;&lt;/span&gt; &lt;span class="nt"&gt;&amp;lt;ms&amp;gt;&lt;/span&gt;la sixiesme partye&lt;span class="nt"&gt;&amp;lt;/ms&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; dicelle de &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;vif argent&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&amp;lt;/ab&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;/div&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/table&gt;
&lt;p&gt;यह जानकारी अभिलेखीय उद्देश्यों के लिए तो मूल्यवान है ही, संश्लेषण और विश्लेषण के लिए भी है – जैसा मैं पहले कई मौक़ों पर दिखा चुका हूँ। फिर भी, इस तरह की टिप्पणी में बेहद समय लग सकता है, क्योंकि एक ही पाठ अक्सर कई रूपों में उपलब्ध कराना पड़ता है: अनुवाद के रूप में, प्रतिलेखन के रूप में, आधुनिकीकृत रूप में, वग़ैरह।&lt;/p&gt;
&lt;h1 id="समधन"&gt;समाधान&lt;/h1&gt;
&lt;h2 id="टरसफरमर-सवचलन-क-सबस-सरल-रसत"&gt;ट्रांसफ़ॉर्मर: स्वचालन का सबसे सरल रास्ता?&lt;/h2&gt;
&lt;p&gt;2020 में
ने ख़ूब ढोल-नगाड़ों के साथ सामान्य-उद्देश्य वाले बड़े पैमाने के भाषा मॉडलों का अपना नया परिवार जारी किया – GPT-3, यानी “Generative Pre-trained Transformer 3”। ट्रांसफ़ॉर्मर कृत्रिम बुद्धि में हाल की एक बड़ी उपलब्धि हैं। वे नए काम प्रभावशाली रफ़्तार से सीखते हैं – बस एक प्रॉम्प्ट पढ़कर और बहुत थोड़े-से उदाहरण देखकर। उन्हें किसी ख़ास डेटासेट से अतिरिक्त प्रशिक्षण (फ़ाइन-ट्यूनिंग) भी दिया जा सकता है, जिससे प्रतिक्रिया-समय और सटीकता दोनों सुधरते हैं। इसीलिए GPT-3 और उस जैसे ट्रांसफ़ॉर्मरों को
कहा जाता है।&lt;/p&gt;
&lt;p&gt;OpenAI का दावा है कि GPT-3 में रिकॉर्ड 175 अरब पैरामीटर हैं और उसे 570 GB से ज़्यादा पाठ पर प्रशिक्षित किया गया है, जिसका ज़्यादातर हिस्सा संभवतः
से लिए गए अंग्रेज़ी दस्तावेज़ हैं। अपने विशाल आकार के बल पर GPT-3 ने इस क्षेत्र में नया मानदंड स्थापित कर दिया है: बिना किसी अतिरिक्त तैयारी के वह तरह-तरह के काम बेचैन कर देने वाली सजीवता से कर डालता है। वह विश्वसनीय
लिखता है, चैट रूम में
,
,
, दस्तावेज़ों का अनुवाद करता है, तकनीकी शब्दजाल समझाता है, वग़ैरह।&lt;/p&gt;
&lt;p&gt;मई 2021 से OpenAI के API तक शुरुआती पहुँच होने के कारण मैं मॉडल की क्षमता को कई कथित रूप से कठिन कामों पर आज़मा सका हूँ: फ़्रांसीसी कविता और नव-लातीनी पाठों का अंग्रेज़ी अनुवाद, उपमाओं की व्याख्या, यहाँ तक कि कांट के &lt;em&gt;Groundwork for a Metaphysics of Morals&lt;/em&gt; के तीसरे खंड को सात साल के बच्चे के लिए सरल बनाना (हालाँकि वह कुछ ख़ास जमा नहीं)।&lt;/p&gt;
&lt;h3 id="codex"&gt;Codex&lt;/h3&gt;
&lt;p&gt;GPT-3 के ताज़ा विकासों में से एक कंप्यूटर भाषाओं पर केंद्रित है। &lt;em&gt;Codex&lt;/em&gt; नाम का यह मॉडल प्राकृतिक भाषा को कंप्यूटर भाषा में और कंप्यूटर भाषा को प्राकृतिक भाषा में बदलता है। मिसाल के तौर पर, अगर मुझे ऐसा रेगुलर एक्सप्रेशन चाहिए जो “सिर्फ़ बड़े अक्षर से शुरू होने वाले शब्द ढूँढ़े”, तो GPT-3 झट से इसे एक काम करने वाले रेगुलर एक्सप्रेशन में बदल देता है: &lt;code&gt;[A-Z]+\w+&lt;/code&gt;।&lt;/p&gt;
&lt;p&gt;OpenAI का दावा है कि &lt;em&gt;Codex&lt;/em&gt; एक दर्जन कंप्यूटर भाषाओं के साथ काम कर सकता है, जिनमें Python, JavaScript, Go, Perl, PHP, Ruby और Swift शामिल हैं। छद्म-कोड को सहजता से कोड में बदलकर &lt;em&gt;Codex&lt;/em&gt; लोगों को इस लायक़ बनाता है कि वे किसी कंप्यूटर भाषा के थकाऊ सिंटैक्स पर नहीं, बल्कि उन तार्किक चरणों और रणनीतियों पर ध्यान दें, जिनसे ऐप्लिकेशन समस्याएँ सुलझाते हैं।&lt;/p&gt;
&lt;h3 id="openai-स-आग"&gt;OpenAI से आगे&lt;/h3&gt;
&lt;p&gt;ज़ाहिर है, OpenAI मैदान में अकेला खिलाड़ी नहीं है। जैसा पहले कहा, Beijing Academy for Artificial Intelligence ने 2021 में उससे भी बड़े और अधिक सक्षम मॉडल &lt;em&gt;Wu Dao 2&lt;/em&gt; की घोषणा की। Nvidia और Microsoft ने हाथ मिलाकर &lt;em&gt;Megatron-Turing NLG 530B&lt;/em&gt; नाम का – नाम के अनुरूप ही विशाल – मॉडल बनाया।
और
जैसे छोटे स्टार्ट-अप भी जनता को API उपलब्ध कराते हैं।
जैसी ओपन-सोर्स पहलों का ज़िक्र भी ज़रूरी है। एआई की दुनिया, ज़ाहिर है, बहुत तेज़ी से बदल रही है; इस क्षेत्र की नई पहलों पर नज़र रखने के लिए
देखिए।&lt;/p&gt;
&lt;h1 id="परयग"&gt;प्रयोग&lt;/h1&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;टिप्पणी&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;इन प्रयोगों का उद्देश्य संपादकीय कामों के भरोसेमंद स्वचालन का सबसे किफ़ायती रास्ता ढूँढ़ना है। कोई कह सकता है कि इनमें से कुछ काम पर्यवेक्षित लर्निंग एल्गोरिद्मों से भी स्वचालित किए जा सकते हैं। इस परिकल्पना को हम आगे किसी पोस्ट में परखेंगे।&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;क्या GPT-3 जैसा ट्रांसफ़ॉर्मर, मसलन, सोलहवीं सदी की किसी तकनीकी और वैज्ञानिक पांडुलिपि पर टिप्पणी करना सीख सकता है?&lt;/p&gt;
&lt;h2 id="परयग-1--पठ-क-वरगकरण"&gt;प्रयोग 1 – पाठ का वर्गीकरण&lt;/h2&gt;
&lt;p&gt;शुरुआत अपेक्षाकृत सरल चीज़ से करते हैं। “few-shot learner” होने के नाते GPT-3 को जल्दी समझ लेना चाहिए कि हमारी संपादकीय टीम ने Ms Fr 640 की प्रविष्टियों को कैसे वर्गीकृत किया है।&lt;/p&gt;
&lt;h3 id="परमपट-इजनयरग"&gt;प्रॉम्प्ट इंजीनियरिंग&lt;/h3&gt;
&lt;p&gt;उसे प्रशिक्षित करने के लिए मैंने एक बहुत ही न्यूनतम प्रॉम्प्ट इस्तेमाल किया और उदाहरण के तौर पर सादे पाठ की चार छोटी प्रविष्टियाँ चुनीं – जिनमें “medicine”, “arms and armor” और “painting” की एक-एक प्रविष्टि शामिल थी।&lt;/p&gt;
&lt;h3 id="परकषण"&gt;परीक्षण&lt;/h3&gt;
&lt;p&gt;फिर मैंने एक और अंश कॉपी किया, जो शुरुआती क्रम में नहीं था:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Working neatly
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Never put down, if you can, two colors one on top of the other.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;But next, having made your design carefully, keep the place of shadows for them alone,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;amp; also separately that of lights &amp;amp; highlights, without layering one color all over &amp;amp; then highlighting or else shading on it.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;And in this way, you further your work, economize your colors &amp;amp; work neatly.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Which is the reason that, the colors not being muddled nor mixed together, they do not die &amp;amp; you soften the colors better, since they are not so thick.
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;आउटपुट विषय-वस्तु से पूरी तरह मेल खाता है:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;categories&lt;/span&gt;&lt;span class="err"&gt;=&amp;#34;painting&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;अब अगर ऐसी प्रविष्टि आज़माएँ, जिसकी श्रेणी GPT-3 को प्रशिक्षित करने के लिए चुने गए शुरुआती पाठों में शामिल ही नहीं थी, तो नतीजा हैरान करता है।&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;categories&lt;/span&gt;&lt;span class="err"&gt;=&amp;#34;jewelry&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="नतज"&gt;नतीजा&lt;/h3&gt;
&lt;p&gt;Ms. Fr. 640 के हमारे संस्करण में “jewelry” श्रेणी है ही नहीं। संपादकीय टीम ने “Stones” की व्यापक श्रेणी को
। फिर भी GPT-3 की सूझ अच्छी है, और यह संकेत देती है कि थोड़े और प्रशिक्षण से वह Ms. Fr. 640 की किसी भी प्रविष्टि को – और शायद सोलहवीं सदी के मिलते-जुलते तकनीकी पाठों की प्रविष्टियों को भी – वर्गीकृत करना सीख सकता है।&lt;/p&gt;
&lt;h2 id="परयग-2--समटक-मरकअप"&gt;प्रयोग 2 – सिमेंटिक मार्कअप&lt;/h2&gt;
&lt;p&gt;अब दहलीज़ थोड़ी ऊँची करते हैं। अगर GPT-3 जैसे ट्रांसफ़ॉर्मर पाठों को ख़ास संपादकीय कसौटियों के अनुसार वर्गीकृत करना सीख सकते हैं, तो क्या वे पाठ के कुछ मार्कअप की पहचान भी कर सकते हैं?&lt;/p&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;टिप्पणी&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;&lt;em&gt;Secrets of Craft and Nature&lt;/em&gt; सिमेंटिक और संरचनात्मक लेबलों का
पेश करता है। दुर्भाग्य से GPT-3 छवियाँ प्रोसेस नहीं करता, जबकि
जैसी दूसरी परियोजनाएँ करती हैं। संभावना है कि GPT के आने वाले संस्करणों में यह क्षमता होगी, जो किसी दस्तावेज़ के ज़्यादातर संरचनात्मक और भौतिक पहलुओं को पहचानने के लिए ज़रूरी है। हम इन ख़ास टैगों को छोड़ देंगे और उस मार्कअप पर ध्यान देंगे, जिसके लिए छवि-पहचान की ज़रूरत नहीं।&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;h3 id="परमपट-इजनयरग-1"&gt;प्रॉम्प्ट इंजीनियरिंग&lt;/h3&gt;
&lt;p&gt;सिमेंटिक टैगों में जानवरों, पौधों, स्थान-नामों, इंद्रिय-अनुभवों आदि के संदर्भ शामिल हैं। प्रशिक्षण-प्रॉम्प्ट में मैंने संस्करण से कुछ उदाहरण चुने:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Input prompt--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;The following is a list of words and their corresponding semantic tags
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;cannons: &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;cannons&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;flasks: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;flasks&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;wooden: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;wooden&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;iron: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;iron&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;parchment: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;parchment&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;goats: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;goats&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;lambs: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;lambs&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;leather: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;leather&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;earth: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;earth&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;fine fatty earth: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;fine fatty earth&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Venice: &lt;span class="nt"&gt;&amp;lt;pl&amp;gt;&lt;/span&gt;Venice&lt;span class="nt"&gt;&amp;lt;/pl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Flemish: &lt;span class="nt"&gt;&amp;lt;pl&amp;gt;&lt;/span&gt;Flemish&lt;span class="nt"&gt;&amp;lt;/pl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;almond: &lt;span class="nt"&gt;&amp;lt;pa&amp;gt;&lt;/span&gt;almond&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;almond oil: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;almond&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; oil&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;walnuts skin: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;walnuts&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; skin&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;molten lead: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;molten lead&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;today: &lt;span class="nt"&gt;&amp;lt;tmp&amp;gt;&lt;/span&gt;today&lt;span class="nt"&gt;&amp;lt;/tmp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;In the past: &lt;span class="nt"&gt;&amp;lt;tmp&amp;gt;&lt;/span&gt;In the past&lt;span class="nt"&gt;&amp;lt;/tmp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Clockmakers: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;Clockmakers&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;red copper: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;red copper&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;crucible: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;crucible&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bellows: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;bellows&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;charcoal: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;charcoal&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;founders: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;founders&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="परकषण-1"&gt;परीक्षण&lt;/h3&gt;
&lt;p&gt;&lt;code&gt;Davinci-codex&lt;/code&gt; मॉडल के साथ कुछ आसान शब्द आज़माते हैं, जैसे &lt;em&gt;Apothecary&lt;/em&gt;, &lt;em&gt;smoke&lt;/em&gt;, &lt;em&gt;glassmakers&lt;/em&gt;, &lt;em&gt;latten&lt;/em&gt; और &lt;em&gt;snake&lt;/em&gt;। नतीजे तुरंत और बेदाग़ हैं:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Apothecary: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;Apothecary&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;smoke: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;smoke&lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;glassmakers: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;glassmakers&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;latten: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;latten&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;snake: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;snake&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;कठिन परीक्षा में &lt;em&gt;copper plates&lt;/em&gt;, &lt;em&gt;walnut oil&lt;/em&gt; और &lt;em&gt;wood block&lt;/em&gt; जैसे यौगिक शब्द आते हैं। इस परीक्षा का मक़सद यह देखना है कि GPT-3 नेस्टेड टैगों को ठीक से सँभालता है या नहीं।&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;copper plates: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;copper plates&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;walnut oil: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;walnut&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; oil&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;wood block: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;wood block&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;पर नतीजे मिले-जुले हैं: &lt;code&gt;Davinci-codex&lt;/code&gt; ने सिर्फ़ &lt;em&gt;walnut oil&lt;/em&gt; को सही लेबल किया और &lt;em&gt;copper plates&lt;/em&gt; तथा &lt;em&gt;wood block&lt;/em&gt; में &lt;code&gt;tl&lt;/code&gt; और &lt;code&gt;m&lt;/code&gt; के नेस्टेड टैग पकड़ने में चूक गया। हालाँकि, जैसा अगली परीक्षा नीचे दिखाती है, बेहतर प्रशिक्षण-प्रॉम्प्ट से इन ग़लतियों को कम किया जा सकता है। नेस्टेड टैगों के पाँच और उदाहरण जोड़ने के बाद &lt;code&gt;Davinci-codex&lt;/code&gt; ने लगभग बेदाग़ नतीजा दिया, बस एक ग़लती के साथ (&lt;em&gt;oil paintbrushes&lt;/em&gt;):&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;cannon powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;wp&amp;gt;&lt;/span&gt;cannon&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;arquebus powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;wp&amp;gt;&lt;/span&gt;arquebus&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;oil paintbrushes: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;al&amp;gt;&lt;/span&gt;oil&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt; paintbrushes&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;sheep footbones: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;al&amp;gt;&lt;/span&gt;sheep&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt; footbones&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bronze mortar: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&amp;lt;m&amp;gt;&lt;/span&gt;bronze&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt; mortar&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h1 id="नषकरष"&gt;निष्कर्ष&lt;/h1&gt;
&lt;p&gt;यह याद रखना ज़रूरी है कि ये परीक्षण छोटे-छोटे पाठ-खंडों पर किए गए। मेरा अनुमान है कि उदाहरणों और प्रॉम्प्ट में ज़्यादा संदर्भ देने पर GPT-3 मॉडल और भी बेहतर नतीजे देंगे। इसके अलावा, ख़ास प्रशिक्षण-डेटासेट से मॉडल की फ़ाइन-ट्यूनिंग लेबलिंग की सटीकता को निस्संदेह और बढ़ाएगी।&lt;br&gt;
पूर्व-प्रशिक्षित भाषा मॉडलों की विश्वसनीयता साबित करने के लिए ये प्रयोग अभी बड़े पैमाने पर दोहराए जाने बाक़ी हैं, फिर भी हम इतना निष्कर्ष निकाल सकते हैं कि
&lt;mark&gt;यह तरीक़ा संपादकों को टिप्पणी के कई काम चंद आसान क़दमों में स्वचालित करने देता है, और इस प्रक्रिया में समय और धन की भारी बचत की संभावना रखता है।&lt;/mark&gt;
&lt;/p&gt;</description></item></channel></rss>