数字人文

tei-mcp v0.3:编码TEI,不动源文本一字 featured image

tei-mcp v0.3:编码TEI,不动源文本一字

tei-mcp新版本引入了区间锁定合成,专门防范AI辅助TEI编码中破坏性最大的 一类幻觉:对源文本的悄然改写。模型从不键入正文,只把标签登记为源文本上的 偏移量;合成器则拒绝返回任何扁平文本与原文相差哪怕一个字节的TEI。

avatar
Clément Godbarge

另一种数字版本

大多数原始史料从未出版。我们指望用来补救的模式——靠经费资助的数字版本—— 太贵、太集中、太脆弱,无法推广。我为什么要换一种方式来做Cavriana书信的 校勘本,理由在此。

avatar
Clément Godbarge
tei-mcp:给AI智能体用的TEI P5 featured image

tei-mcp:给AI智能体用的TEI P5

tei-mcp是一个开源MCP服务器,让AI编程助手直接访问TEI P5规范—— 元素查询、属性解析、嵌套验证、文档验证、ODD定制。

avatar
Clément Godbarge
tei-mcp featured image

tei-mcp

一个MCP服务器,帮AI智能体读写有效的TEI XML;16个工具涵盖元素查询、属性解析、内容模型展开、嵌套验证、文档验证和ODD定制。

persNamer

一个Python工具,把VIAF标识符转成TEI XML人物条目和标注标签,简化数字学术版本中的规范控制。

Multi-Saxon

一个高性能工具,对大型XML TEI语料库并行执行XSLT 2.0/3.0转换,处理LXML无能为力的转换。

用预训练语言模型大规模解析书目

GPT-3帮忙在短时间内把大量参考书目转成数据库

avatar
Clément Godbarge
高效校勘 featured image

高效校勘

一组博文,评估压低学术版本成本的各种办法

Avviso | 出版让我们走向现代的新闻(1537—1743) featured image

Avviso | 出版让我们走向现代的新闻(1537—1743)

美第奇档案计划(Medici Archive Project)一个由NEH资助的项目

数字学术版本的标记自动化

预训练语言模型能替学者接手版本编纂中最枯燥、最耗人力的一部分活儿。我以*Secrets of Craft and Nature in Renaissance France*(《文艺复兴时期法国的工艺与自然之秘》)精心整理的注释为基础,评估GPT-3之类的模型经过快速训练后,能在多大程度上标注十六世纪的技术手稿。

avatar
Clément Godbarge