デジタル・ヒューマニティーズ

tei-mcp v0.3:原文を書き換えずにTEIを付ける featured image

tei-mcp v0.3:原文を書き換えずにTEIを付ける

tei-mcpの新リリースは、スパン固定合成(span-locked composition)を導入します。AI支援のTEIエンコーディングでもっとも害の大きいハルシネーション、すなわち原文の無断書き換えを防ぐための仕組みです。モデルは本文を一文字も打ちません。原文上のオフセットとしてタグを登録するだけで、コンポーザーは、平文の内容が原文と1バイトでも違う …

avatar
Clément Godbarge

もう一つのデジタル版のかたち

一次史料の大半は、公刊されないまま眠っています。それを何とかするために私たちが頼ってきた、助成金頼みのデジタル版というモデルは、高くつき、中央集権的で、壊れやすく、とても大規模には通用しません。Cavrianaの書簡の校訂版を私が別のやり方で構築している理由をお話しします。

avatar
Clément Godbarge
tei-mcp:AIエージェントのためのTEI P5 featured image

tei-mcp:AIエージェントのためのTEI P5

tei-mcpは、AIコーディングアシスタントがTEI P5仕様を直接引けるようにするオープンソースのMCPサーバーです。要素の検索、属性の解決、入れ子の検証、文書の検証、ODDカスタマイズに対応しています。

avatar
Clément Godbarge
tei-mcp featured image

tei-mcp

AIエージェントが妥当なTEI XMLを読み書きできるようにするMCPサーバー。要素の検索、属性の解決、内容モデルの展開、入れ子の検証、文書の検証、ODDカスタマイズを担う16のツールを備えています。

persNamer

VIAF識別子をTEI XMLの人物エントリと注釈タグに変換し、デジタル校訂版の典拠管理を効率化するPythonツール。

Multi-Saxon

大規模なXML TEIコーパスに対してXSLT 2.0/3.0の変換を並列実行する高性能ツール。LXMLの手に余る変換を引き受けます。

事前学習済み言語モデルで大量の書誌を解析する

GPT-3を使えば、大量の参考文献を短時間でデータベースに変換できます

avatar
Clément Godbarge
効率的な校訂 featured image

効率的な校訂

校訂版のコストを下げるさまざまなアプローチを検証する、一連のブログ記事

Avviso | 私たちを近代にしたニュースを公刊する(1537—1743年) featured image

Avviso | 私たちを近代にしたニュースを公刊する(1537—1743年)

NEHの助成によるMedici Archive Projectのプロジェクト

デジタル校訂版のマークアップを自動化する

事前学習済み言語モデルを使えば、校訂作業のうちでも最も単調で骨の折れる仕事の一部を機械に任せられます。本稿では、*Secrets of Craft and Nature in Renaissance France*の丹念に整備された注釈をもとに、GPT-3のようなモデルを16世紀の技術写本の注釈付けにどこまで手早く仕込めるかを検証します。

avatar
Clément Godbarge