<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>機械学習 |</title><link>https://clementgodbarge.com/ja/tag/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92/</link><atom:link href="https://clementgodbarge.com/ja/tag/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92/index.xml" rel="self" type="application/rss+xml"/><description>機械学習</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>ja-jp</language><lastBuildDate>Mon, 22 Nov 2021 18:15:00 +0000</lastBuildDate><image><url>https://clementgodbarge.com/media/icon_hu_64a6c3bec25b3d7b.png</url><title>機械学習</title><link>https://clementgodbarge.com/ja/tag/%E6%A9%9F%E6%A2%B0%E5%AD%A6%E7%BF%92/</link></image><item><title>デジタル校訂版のマークアップを自動化する</title><link>https://clementgodbarge.com/ja/post/gpt3/</link><pubDate>Mon, 22 Nov 2021 18:15:00 +0000</pubDate><guid>https://clementgodbarge.com/ja/post/gpt3/</guid><description>&lt;h1 id="はじめに"&gt;はじめに&lt;/h1&gt;
&lt;p&gt;予算を食いつぶさずにデジタル校訂版をつくるには、どうすればよいのでしょうか。効率的な校訂をめぐるシリーズの第1回となる本稿では、意味的マークアップをはじめとする校訂作業の自動化に、事前学習済み言語モデルがどこまで役立つかを検討します。&lt;/p&gt;
&lt;details class="print:hidden xl:hidden" &gt;
&lt;summary&gt;目次&lt;/summary&gt;
&lt;div class="text-sm"&gt;
&lt;nav id="TableOfContents"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#愛は金勘定をしない"&gt;愛は金勘定をしない&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#高い敷居"&gt;高い敷居&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#transformer自動化への最短経路か"&gt;Transformer――自動化への最短経路か？&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#codex"&gt;Codex&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#openaiの外へ"&gt;OpenAIの外へ&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#実験1テキストの分類"&gt;実験1――テキストの分類&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#プロンプト設計"&gt;プロンプト設計&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#テスト"&gt;テスト&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#結果"&gt;結果&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;a href="#実験2意味的マークアップ"&gt;実験2――意味的マークアップ&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#プロンプト設計-1"&gt;プロンプト設計&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#テスト-1"&gt;テスト&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/nav&gt;
&lt;/div&gt;
&lt;/details&gt;
&lt;h1 id="問題"&gt;問題&lt;/h1&gt;
&lt;h2 id="愛は金勘定をしない"&gt;愛は金勘定をしない&lt;/h2&gt;
&lt;p&gt;愛にかかわることでは費用を数えない――古い諺はそう言います。デジタル校訂版ほど、これがよく当てはまるものもありません。転写、翻訳、注釈にかかる作業は何千時間にも及び、
の場合には、高度な専門性をもつ何百人もの協力者がそれを担ってきました。&lt;/p&gt;
&lt;p&gt;デジタル・ヒューマニティーズの花形プロジェクトが運営に必要な巨額の資金を集められるのは、ある意味ではありがたいことです。とはいえ、裕福な財団や大学、政府機関の気前のよさに寄りかかり、大量の人手を長期にわたって必要とし続けるやり方は、将来に通用する経済モデルとは言えません。&lt;/p&gt;
&lt;p&gt;実際、世界中の研究者に歴史的文書をより広い公衆へ開いてもらいたいのなら、
&lt;mark&gt;デジタル校訂版のコストは桁違いに下がらなければならない&lt;/mark&gt;
のです。&lt;/p&gt;
&lt;h2 id="高い敷居"&gt;高い敷居&lt;/h2&gt;
&lt;p&gt;いささか逆説的ですが、
&lt;mark&gt;解決の糸口は、
のような労働集約的なプロジェクトの側にあるのかもしれません。というのも、それらは貴重な訓練データになる&lt;/mark&gt;
からです。マークアップをはじめ、デジタル校訂につきものの最も味気なく反復的な作業を自動化するための、またとない教材というわけです。&lt;/p&gt;
&lt;p&gt;マークアップが取るに足らない作業だ、と言いたいのではありません。それどころか、
&lt;mark&gt;マークアップは今や、本格的なデジタル学術プロジェクトに欠かせない構成要素です。&lt;/mark&gt;
によって標準化されたマークアップのおかげで、文書とそれが伝えるテキストについて、構造、欄外の書き込み、抹消、異文、紙の種類、染み、書体……と、思いつく限りの側面を記録できるようになりました。&lt;/p&gt;
&lt;p&gt;次に挙げるのは
からの一例で、マークアップがテキストに情報（カテゴリー、構造、意味領域、抹消など）を上乗せし、ひいてはデジタル版に紙の先祖にはない強みを与えている様子がわかります。&lt;/p&gt;
&lt;table&gt;
&lt;tr&gt;
&lt;th&gt; プレーンテキスト &lt;/th&gt;
&lt;th&gt; XMLマークアップ&lt;/th&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Pour rompre grenades et donner
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;violence aux artifices de foeu
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Mects parmy la pouldre et la sixiesme
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;partye dicelle de vif argent
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/td&gt;
&lt;td&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;div&lt;/span&gt; &lt;span class="na"&gt;id=&lt;/span&gt;&lt;span class="s"&gt;&amp;#34;p008r_2&amp;#34;&lt;/span&gt; &lt;span class="na"&gt;categories=&lt;/span&gt;&lt;span class="s"&gt;&amp;#34;arms and armor&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;head&amp;gt;&lt;/span&gt;Pour rompre &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;grenades&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; et donner&lt;span class="nt"&gt;&amp;lt;lb/&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;violence aux &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;artifices de foeu&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&amp;lt;/head&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;ab&amp;gt;&lt;/span&gt;Mects parmy la &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;pouldre&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;del&amp;gt;&amp;lt;ms&amp;gt;&lt;/span&gt;six fois autant&lt;span class="nt"&gt;&amp;lt;/ms&amp;gt;&lt;/span&gt; de
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;vif argent&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&amp;lt;/del&amp;gt;&amp;lt;lb/&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;del&amp;gt;&lt;/span&gt;et&lt;span class="nt"&gt;&amp;lt;/del&amp;gt;&lt;/span&gt; &lt;span class="nt"&gt;&amp;lt;ms&amp;gt;&lt;/span&gt;la sixiesme partye&lt;span class="nt"&gt;&amp;lt;/ms&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; dicelle de &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;vif argent&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&amp;lt;/ab&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;/div&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/table&gt;
&lt;p&gt;この情報はアーカイブとしての価値にとどまらず、以前に別の場所で示したとおり、総合や分析にも役立ちます。ただし、この種の注釈は途方もなく時間を食います。同じテキストを翻訳、転写、現代語化といった複数の姿で用意しなければならないことが多いからです。&lt;/p&gt;
&lt;h1 id="解決策"&gt;解決策&lt;/h1&gt;
&lt;h2 id="transformer自動化への最短経路か"&gt;Transformer――自動化への最短経路か？&lt;/h2&gt;
&lt;p&gt;2020年、
は汎用の大規模言語モデルの最新ファミリー、GPT-3を鳴り物入りで発表しました。「Generative Pre-trained Transformer 3」の略です。Transformerは人工知能の分野ではまだ新しい突破口で、プロンプトを読み、ごく少数の例を眺めるだけで、目を見張る速さで新しいタスクを覚えます。目的に合わせたデータセットで追加訓練（ファインチューニング）を施し、応答速度と精度を上げることもできます。GPT-3とその同類が
と呼ばれるゆえんです。&lt;/p&gt;
&lt;p&gt;OpenAIによれば、GPT-3は空前の1750億パラメータを備え、570GBを超えるテキストで訓練されています。その大半は英語の文書で、おそらく
から集められたものでしょう。この途方もない規模ゆえに、GPT-3はこの分野の新たな基準となり、追加の訓練なしに、そら恐ろしいほどの真実味でさまざまな仕事をこなします。もっともらしい
を書き、チャットルームで
、
、
、文書を翻訳し、専門用語を解説する、といった具合です。&lt;/p&gt;
&lt;p&gt;2021年5月からOpenAIのAPIを早期に使えたおかげで、私は難問とされる仕事の数々でこのモデルを試すことができました。フランス語の詩や新ラテン語のテキストの英訳、類推の説明、さらにはカントの『人倫の形而上学の基礎づけ』第4巻を7歳児向けに噛み砕くこと（説得力はいまひとつでしたが）まで。&lt;/p&gt;
&lt;h3 id="codex"&gt;Codex&lt;/h3&gt;
&lt;p&gt;GPT-3の最近の展開のひとつは、コンピュータ言語に的を絞ったものです。&lt;em&gt;Codex&lt;/em&gt;と名付けられたこのモデルは、自然言語をコンピュータ言語に、またその逆へと翻訳します。たとえば「大文字で始まる単語だけを探す」正規表現が欲しいと言えば、GPT-3はすぐさま動く正規表現に訳してくれます：&lt;code&gt;[A-Z]+\w+&lt;/code&gt;。&lt;/p&gt;
&lt;p&gt;OpenAIによれば、&lt;em&gt;Codex&lt;/em&gt;はPython、JavaScript、Go、Perl、PHP、Ruby、Swiftなど十数のコンピュータ言語を扱えます。擬似コードをそのままコードに変換してくれるので、使う側は言語の煩わしい構文ではなく、問題を解くための論理の手順と戦略に集中できるのです。&lt;/p&gt;
&lt;h3 id="openaiの外へ"&gt;OpenAIの外へ&lt;/h3&gt;
&lt;p&gt;言うまでもなく、この分野の役者はOpenAIだけではありません。先に触れたとおり、北京智源人工知能研究院は2021年、さらに大きく高性能な&lt;em&gt;Wu Dao 2&lt;/em&gt;を発表しました。NvidiaとMicrosoftは手を組み、その名も&lt;em&gt;Megatron-Turing NLG 530B&lt;/em&gt;というモデルを世に出しました。
や
といった小さめのスタートアップも一般向けにAPIを提供していますし、
のようなオープンソースの取り組みも見逃せません。もっともAIの世界の動きは速く、新しい動向を追うには
を覗くのが一番です。&lt;/p&gt;
&lt;h1 id="実験"&gt;実験&lt;/h1&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;注&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;この実験のねらいは、校訂作業を信頼できるかたちで自動化するための、いちばん安上がりな道を見つけることです。ここで扱う作業の一部は教師あり学習でも自動化できる、という反論もあるでしょう。その仮説は別の記事で検討します。&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;GPT-3のようなTransformerは、たとえば16世紀の技術・科学写本に注釈を付けることを学べるのでしょうか。&lt;/p&gt;
&lt;h2 id="実験1テキストの分類"&gt;実験1――テキストの分類&lt;/h2&gt;
&lt;p&gt;まずは比較的やさしいところから。「few-shot learner」たるGPT-3なら、Ms Fr 640の各項目を私たちの編集チームがどう分類してきたかを、すぐに飲み込めるはずです。&lt;/p&gt;
&lt;h3 id="プロンプト設計"&gt;プロンプト設計&lt;/h3&gt;
&lt;p&gt;訓練には最小限のプロンプトを使い、例としてプレーンテキストの短い項目を4つ選びました。「医学」「武器と甲冑」「絵画」に関するものが含まれています。&lt;/p&gt;
&lt;h3 id="テスト"&gt;テスト&lt;/h3&gt;
&lt;p&gt;次に、最初の例には入っていなかった別の一節を貼り付けました。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Working neatly
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Never put down, if you can, two colors one on top of the other.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;But next, having made your design carefully, keep the place of shadows for them alone,
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&amp;amp; also separately that of lights &amp;amp; highlights, without layering one color all over &amp;amp; then highlighting or else shading on it.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;And in this way, you further your work, economize your colors &amp;amp; work neatly.
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Which is the reason that, the colors not being muddled nor mixed together, they do not die &amp;amp; you soften the colors better, since they are not so thick.
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;出力は内容とぴたりと一致しています。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;categories&lt;/span&gt;&lt;span class="err"&gt;=&amp;#34;painting&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;GPT-3の訓練に選んだ最初のテキスト群にすら含まれていなかったカテゴリーの項目で試してみると、驚くべき結果が返ってきます。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nt"&gt;&amp;lt;categories&lt;/span&gt;&lt;span class="err"&gt;=&amp;#34;jewelry&amp;#34;&lt;/span&gt;&lt;span class="nt"&gt;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="結果"&gt;結果&lt;/h3&gt;
&lt;p&gt;「jewelry（宝飾）」というカテゴリーは、私たちのMs. Fr. 640校訂版には存在しません。編集チームはもっと広い「Stones（石）」というカテゴリーを
。それでもGPT-3の勘は悪くなく、もう少し訓練すればMs. Fr. 640のどの項目でも、ひいては同種の16世紀技術文書の項目でも分類できるようになりそうだ、ということを示しています。&lt;/p&gt;
&lt;h2 id="実験2意味的マークアップ"&gt;実験2――意味的マークアップ&lt;/h2&gt;
&lt;p&gt;ハードルをもう少し上げましょう。GPT-3のようなTransformerが編集上の基準に従ってテキストを分類できるのなら、テキストのマークアップの一部を見分けることもできるのでしょうか。&lt;/p&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;注&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;p&gt;&lt;em&gt;Secrets of Craft and Nature&lt;/em&gt;は、意味的ラベルと構造的ラベルを
います。あいにくGPT-3は、
などのプロジェクトと違って画像を処理できません。文書の構造的・物質的な側面の大半を認識するにはこの能力が要りますから、将来のGPTには備わることになるでしょう。ここではそうしたタグは脇に置き、画像認識を必要としないマークアップに絞ります。&lt;/p&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;h3 id="プロンプト設計-1"&gt;プロンプト設計&lt;/h3&gt;
&lt;p&gt;意味的タグは、動物、植物、地名、感覚的な入力などへの言及を扱います。訓練用プロンプトには、校訂版からいくつか例を選びました。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Input prompt--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;The following is a list of words and their corresponding semantic tags
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;cannons: &lt;span class="nt"&gt;&amp;lt;wp&amp;gt;&lt;/span&gt;cannons&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;flasks: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;flasks&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;wooden: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;wooden&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;iron: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;iron&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;parchment: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;parchment&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;goats: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;goats&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;lambs: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;lambs&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;leather: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;leather&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;earth: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;earth&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;fine fatty earth: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;fine fatty earth&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Venice: &lt;span class="nt"&gt;&amp;lt;pl&amp;gt;&lt;/span&gt;Venice&lt;span class="nt"&gt;&amp;lt;/pl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Flemish: &lt;span class="nt"&gt;&amp;lt;pl&amp;gt;&lt;/span&gt;Flemish&lt;span class="nt"&gt;&amp;lt;/pl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;almond: &lt;span class="nt"&gt;&amp;lt;pa&amp;gt;&lt;/span&gt;almond&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;almond oil: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;almond&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; oil&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;walnuts skin: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;walnuts&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; skin&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;molten lead: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;molten lead&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;today: &lt;span class="nt"&gt;&amp;lt;tmp&amp;gt;&lt;/span&gt;today&lt;span class="nt"&gt;&amp;lt;/tmp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;In the past: &lt;span class="nt"&gt;&amp;lt;tmp&amp;gt;&lt;/span&gt;In the past&lt;span class="nt"&gt;&amp;lt;/tmp&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Clockmakers: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;Clockmakers&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;red copper: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;red copper&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;crucible: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;crucible&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bellows: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&lt;/span&gt;bellows&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;charcoal: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;charcoal&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;founders: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;founders&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h3 id="テスト-1"&gt;テスト&lt;/h3&gt;
&lt;p&gt;&lt;code&gt;Davinci-codex&lt;/code&gt;モデルで、&lt;em&gt;Apothecary&lt;/em&gt;、&lt;em&gt;smoke&lt;/em&gt;、&lt;em&gt;glassmakers&lt;/em&gt;、&lt;em&gt;latten&lt;/em&gt;、&lt;em&gt;snake&lt;/em&gt;といった易しい単語を試してみましょう。結果は即座に返ってきて、非の打ちどころがありません。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;Apothecary: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;Apothecary&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;smoke: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;smoke&lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;glassmakers: &lt;span class="nt"&gt;&amp;lt;pro&amp;gt;&lt;/span&gt;glassmakers&lt;span class="nt"&gt;&amp;lt;/pro&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;latten: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;latten&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;snake: &lt;span class="nt"&gt;&amp;lt;al&amp;gt;&lt;/span&gt;snake&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;もう一段難しいのは、&lt;em&gt;copper plates&lt;/em&gt;、&lt;em&gt;walnut oil&lt;/em&gt;、&lt;em&gt;wood block&lt;/em&gt;のような複合語です。ここでは、GPT-3が入れ子のタグをきちんと扱えるかどうかを見ます。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;copper plates: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;copper plates&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;walnut oil: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;pa&amp;gt;&lt;/span&gt;walnut&lt;span class="nt"&gt;&amp;lt;/pa&amp;gt;&lt;/span&gt; oil&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;wood block: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&lt;/span&gt;wood block&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;結果は玉石混淆でした。&lt;code&gt;Davinci-codex&lt;/code&gt;が正しくラベル付けできたのは&lt;em&gt;walnut oil&lt;/em&gt;だけで、&lt;em&gt;copper plates&lt;/em&gt;と&lt;em&gt;wood block&lt;/em&gt;に含まれる&lt;code&gt;tl&lt;/code&gt;と&lt;code&gt;m&lt;/code&gt;の入れ子タグは見逃しています。もっとも、次のテストが示すように、この種の誤りは訓練プロンプトを改善すれば減らせます。入れ子タグの例を5つ足したところ、&lt;code&gt;Davinci-codex&lt;/code&gt;は（&lt;em&gt;oil paintbrushes&lt;/em&gt;の）1件を除いて、ほぼ完璧な結果を返しました。&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-xml" data-lang="xml"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="c"&gt;&amp;lt;!--Output--&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;cannon powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;wp&amp;gt;&lt;/span&gt;cannon&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;arquebus powder: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;wp&amp;gt;&lt;/span&gt;arquebus&lt;span class="nt"&gt;&amp;lt;/wp&amp;gt;&lt;/span&gt; powder&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;oil paintbrushes: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;al&amp;gt;&lt;/span&gt;oil&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt; paintbrushes&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;sheep footbones: &lt;span class="nt"&gt;&amp;lt;m&amp;gt;&amp;lt;al&amp;gt;&lt;/span&gt;sheep&lt;span class="nt"&gt;&amp;lt;/al&amp;gt;&lt;/span&gt; footbones&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;bronze mortar: &lt;span class="nt"&gt;&amp;lt;tl&amp;gt;&amp;lt;m&amp;gt;&lt;/span&gt;bronze&lt;span class="nt"&gt;&amp;lt;/m&amp;gt;&lt;/span&gt; mortar&lt;span class="nt"&gt;&amp;lt;/tl&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h1 id="結論"&gt;結論&lt;/h1&gt;
&lt;p&gt;忘れてならないのは、これらのテストがごく短いテキスト断片で行われたことです。例とプロンプトにもっと文脈を与えれば、GPT-3系のモデルはさらによい結果を出すだろうと私は見ています。加えて、目的に合わせたデータセットでファインチューニングすれば、ラベル付けの精度はまず間違いなく上がるでしょう。
事前学習済み言語モデルの信頼性を実証するには、もっと大規模な実験が必要でしょう。それでも、
&lt;mark&gt;このアプローチを使えば、編集者は注釈作業のいくつかをわずか数ステップで自動化でき、膨大な時間と費用を節約できる可能性がある&lt;/mark&gt;
――そう結論づけることはできます。&lt;/p&gt;</description></item></channel></rss>