<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>ИИ |</title><link>https://clementgodbarge.com/ru/tag/%D0%B8%D0%B8/</link><atom:link href="https://clementgodbarge.com/ru/tag/%D0%B8%D0%B8/index.xml" rel="self" type="application/rss+xml"/><description>ИИ</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>ru-ru</language><lastBuildDate>Sun, 06 Sep 2026 00:00:00 +0000</lastBuildDate><image><url>https://clementgodbarge.com/media/icon_hu_64a6c3bec25b3d7b.png</url><title>ИИ</title><link>https://clementgodbarge.com/ru/tag/%D0%B8%D0%B8/</link></image><item><title>Не костёр, а ограда</title><link>https://clementgodbarge.com/ru/post/fence-not-fire/</link><pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/ru/post/fence-not-fire/</guid><description>&lt;p&gt;На складе в Норт-Лас-Вегасе у Amazon работает машина, которая срезает корешки с подержанных книг. Отделённые страницы проходят через сканер, а бумага отправляется в макулатуру. Уничтожать книги, чтобы кормить ИИ: у этой истории было всё, чтобы стать культурным скандалом.
сравнила происходящее с современным сожжением книг, не пожалев ни одного штампа: намёки на Савонаролу, стоковые фотографии якобы редких изданий и, конечно, берлинский костёр. Солидные газеты, как и следовало ожидать, были сдержаннее, но то же сравнение повисло в воздухе и у них. При всём своём негодовании эти статьи, однако, позволили индустрии ИИ отделаться лёгким испугом. Судьба бумаги занимает всю сцену; вопрос о том, кому принадлежат получившиеся цифровые библиотеки, едва попадает в кадр. Кто будет распоряжаться знанием, которое сейчас сканируют? Этот вопрос подождёт, пока мы разделаемся с чепухой о сожжении книг.&lt;/p&gt;
&lt;h2 id="сканер--не-костёр"&gt;Сканер — не костёр&lt;/h2&gt;
&lt;p&gt;Аналогия с кострами Савонаролы или нацистским сожжением книг нелепа: уничтожить экземпляр — не то же самое, что запретить текст. Костры были публичными актами отречения. Бедный монах Савонарола, чьё имя поминают всякий раз, когда речь заходит о сожжении книг, призывал людей пожертвовать частью своего имущества в знак публичного покаяния. Нацистские костры разыгрывали отречение иного рода: публичное сожжение книг объявляло, что их авторам нет места в немецкой культурной жизни. В обоих случаях, как бы это ни было неприятно, уничтожение было представлением. Деструктивное сканирование — широко распространённый метод оцифровки — служит другой цели: экземпляр гильотинируют, чтобы сохранить его содержание. Книга уничтожена; текст дематериализован. Тем, кто тянется за «451° по Фаренгейту», стоило бы вспомнить его главный урок: текст — не та бумага, на которой он напечатан.&lt;/p&gt;
&lt;p&gt;Задиристее, чем Daily Mail, но не менее неуклюже,
подлило масла в огонь, вынеся в заголовок «редкие книги». Между тем букинист, которого цитирует само же издание, сказал, что из этих оптовых заказов
, — а это указывает главным образом на издания, вышедшие после введения ISBN около 1970 года. Это товар барахолок и благотворительных лавок, которому до помойки нередко одна генеральная уборка. Прежде чем объявлять культурную катастрофу, стоило бы заглянуть в библиотечный каталог. Именно такие издания и призваны хранить библиотеки, получающие обязательный экземпляр. Правда, ISBN не гарантирует, что обязательный экземпляр сохранился, — но и редкость на букинистическом рынке не доказывает исчезновения текста.&lt;/p&gt;
&lt;p&gt;Разумеется, у книг есть и материальная история. Экземпляры, которым пометы, дарственные надписи или провенанс придают историческую значимость, заслуживают того, чтобы их выявляли и сохраняли. Здесь есть роль и для букинистов: распознать такой экземпляр — повод не отправлять его в партию, обречённую на макулатуру. Можно тревожиться и о том, что физических экземпляров распроданных изданий становится всё меньше. Но тогда стоит спросить и о том, почему правообладатели их не переиздают и не открывают доступ к уже существующим цифровым факсимиле. Учёным знакома эта досада: Google Books находит нужный отрывок, а затем показывает лишь обрывок книги, которую нельзя ни купить новой, ни прочесть онлайн. Так что потери здесь есть, и о них стоит спорить, но они не превращают сканер в нацистский костёр.&lt;/p&gt;
&lt;p&gt;Книжная торговля, между тем, давно и рутинно отправляет непроданные книги в макулатуру. В одной только Франции в 2023 году, по оценкам,
— примерно 60 % тоннажа, возвращённого дистрибьюторам как непроданный. Это называется управлением запасами. Лишние экземпляры и редкие букинистические издания ставят разные вопросы о доступе, но уничтожение бумаги само по себе не равнозначно цензуре или тирании.&lt;/p&gt;
&lt;h2 id="больше-книг--лучше-ии"&gt;Больше книг — лучше ИИ?&lt;/h2&gt;
&lt;p&gt;То, что компании, занимающиеся ИИ, покупают и сканируют книги, — на самом деле хорошая новость. Технология, которую постоянно ругают за поверхностное знакомство с человеческой культурой, усваивает её больше, и можно было бы ожидать, что учёные это усилие поприветствуют.&lt;/p&gt;
&lt;p&gt;Веб — плохая замена накопленному наследию языка. Значительная часть записанной жизни языка — от романов и мемуаров до популярных песен и расшифрованных разговоров — так и не перекочевала из печати в сеть. Многие из этих книг пережили своих издателей. Включать их в обучающие данные важнее всего там, где больше почти ничего нет. Ещё несколько книг по-английски дадут, может быть, кое-какие незначительные улучшения. Зато в слабо представленном языке те же книги могут стать разницей между пригодной системой и бесполезной. Место ли этим инструментам в наших публичных службах и повседневной жизни — вопрос для общественного обсуждения. Но где бы мы ни решили ими пользоваться, мы должны иметь возможность делать это на собственном языке.&lt;/p&gt;
&lt;p&gt;Заказы, о которых сообщали из Испании и Нидерландов, делают языковые ставки осязаемыми. В мае
рассказал о букинисте из Бадалоны, получавшем повторяющиеся заказы — главным образом на каталонскую нехудожественную литературу: книги по истории, технические руководства, старые сборники материалов конференций. К августу голландская пресса описала запрос к De Slegte на
. Язык книг заслуживает по меньшей мере не меньшего внимания, чем судьба их переплётов. Возможно, от Daily Mail требовать этого — слишком много. Но даже более трезвые газеты почти ничего не сказали о том, на каких языках эти книги.&lt;/p&gt;
&lt;p&gt;Лицензионные соглашения с крупными издательствами тоже могут дать ценный материал, но их цифровые каталоги покрывают лишь малую долю того, что когда-либо выходило в печати. Книги, никогда не оцифрованные или те, права на которые издательство больше не держит, в предложение не попадают. Даже щедрая лицензионная сделка не заменит истории книгоиздания, а тем более истории культуры. Скупка подержанных экземпляров — способ дотянуться до того, что лежит за этими коммерческими границами.&lt;/p&gt;
&lt;h2 id="воровство--не-аргумент"&gt;«Воровство» — не аргумент&lt;/h2&gt;
&lt;p&gt;Слово «воровство» тоже не помогает. В июне 2025 года два окружных суда США постановили, что в рассматриваемых ими делах использование книг для обучения языковых моделей было добросовестным использованием (fair use). В деле
суд подчеркнул преобразующий характер обучения: книги использовались, чтобы построить систему, способную порождать новые формы выражения. Модели могут запоминать отрывки, но использование книги для обучения не делает весь её текст доступным по первому требованию. Впрочем, отсутствие дословного воспроизведения не снимает всех возражений. В деле
судья предупредил, что произведения, созданные ИИ, могут наводнить рынок и что доказательства такого ущерба способны опрокинуть защиту на основании fair use. Однако эти истцы не представили сколько-нибудь весомых доказательств такого ущерба их собственным произведениям. Ни одно из решений не даёт компаниям, занимающимся ИИ, неограниченного разрешения и не закрывает этический спор. Они требуют от нас различать, как книги приобретаются, как хранятся копии и что именно с ними делает обучение. Назвав всё это «воровством», мы оставим эти вопросы без ответа.&lt;/p&gt;
&lt;p&gt;К слову, решение по делу Anthropic даёт гильотине обоснование. Суд поддержал оцифровку купленных экземпляров и отверг накопление пиратских книг в постоянной библиотеке, за которое компания впоследствии
. Оцифровка прошла отчасти потому, что каждый печатный экземпляр при преобразовании уничтожался: цифровая копия его замещала и за пределы компании не выходила. Уничтожение, которое так возмущает некоторых, помогло Anthropic доказать, что её программа оцифровки — добросовестное использование. Купить, отсканировать и выбросить оказалось в этом случае законным путём. Гильотина здесь — инструмент соблюдения закона.&lt;/p&gt;
&lt;p&gt;Есть веские причины желать, чтобы ИИ опирался на большее число языков, на большее число научных работ и на большую часть мира, существовавшего до интернета. Эти причины не исчезают оттого, что компания, которую мы недолюбливаем, нашла в этом коммерческую возможность.&lt;/p&gt;
&lt;h2 id="негодование-напрокат"&gt;Негодование напрокат&lt;/h2&gt;
&lt;p&gt;Вернёмся же к Daily Mail. Её статья — часть кампании
, которую ведут владельцы газет и издатели, добиваясь
для ИИ. Всю работу делают две удобные подмены: Big Tech выдаётся за ИИ, а правообладатели — за «британское творчество». Читателей приглашают защищать культуру, пока издатели торгуются об условиях её продажи. Учёным, разносящим эту историю, стоило бы спросить себя, чьему делу служит их негодование.&lt;/p&gt;
&lt;p&gt;Big Tech и
ссорятся из-за ренты, но ограда не смущает ни одну из сторон. История об одиноком авторе, ограбленном технологическим гигантом, заслоняет то, что дорогие лицензионные сделки сулят обоим корпоративным лагерям: издатели получают деньги, а Big Tech — рынок, на котором его мелкие соперники не могут позволить себе конкурировать. Питер Тиль выразил предпочтения Кремниевой долины откровеннее:
.&lt;/p&gt;
&lt;p&gt;Лицензирование не обязано приводить к такому итогу. Доступный по цене, неисключительный доступ мог бы помочь мелким разработчикам. Но система, заставляющая каждого новичка заключать дорогостоящие сделки с крупными правообладателями, превращает покупательную способность в условие входа. Платёж, поданный как уступка индустрии культуры, в итоге покупает защиту от будущих соперников.&lt;/p&gt;
&lt;h2 id="ии-не-принадлежит-big-tech"&gt;ИИ не принадлежит Big Tech&lt;/h2&gt;
&lt;p&gt;Есть проблема и поглубже. Слишком много критики ИИ принимает крупнейших коммерческих поставщиков за всю область целиком. Продукты не сходят с заголовков; исследования и разработки за пределами этих компаний исчезают из виду. О более полезном недоразумении Big Tech не мог бы и мечтать. Его притязание владеть всей областью становится исходной посылкой критики, направленной против него же. Монополия ещё не обеспечена. Считать её свершившейся — значит оказывать этим компаниям огромную услугу. А заодно отводить внимание от открытого исходного кода: от его нужд, от его шансов на существование, от его интересов, от его легитимности как альтернативы.&lt;/p&gt;
&lt;p&gt;Открытый ИИ позволяет людям строить и приспосабливать системы, отражающие большее разнообразие языков, культур и форм выражения. Для стран Европы, Африки, Латинской Америки и Азии это практическая основа технологического и культурного суверенитета: возможности решать, как работают системы, каким языкам они служат и где применяются. Использовать ли ИИ и для каких целей — должно оставаться публичным выбором, а не решением, продиктованным зависимостью от иностранной олигополии.&lt;/p&gt;
&lt;p&gt;Но свобода менять систему мало что значит без средств для этого. Независимой работе нужны экспертиза, вычислительная инфраструктура и доступ к обучающему материалу. Это возвращает нас к книгам. Если каждой исследовательской группе или публичному учреждению придётся заключать собственные сделки с издательствами или собирать собственную частную библиотеку, независимость станет не по карману даже некоторым богатым странам.&lt;/p&gt;
&lt;h2 id="книги-уже-здесь"&gt;Книги уже здесь&lt;/h2&gt;
&lt;p&gt;Библиотеки и архивы поколениями собирали материал, который нужен этим системам. Их собрания существуют потому, что доступ к знанию должен переживать коммерческий интерес к его продаже. Многое уже отсканировано:
хранит около девятнадцати миллионов оцифрованных томов из научных библиотек, многие из которых всё ещё защищены авторским правом. Библиотека сканирует книгу и оставляет её себе. Гильотина там никому не нужна. HathiTrust
, но объявил и о проекте
, который откроет доступ к корпусу для некоммерческих исследований и разработок в области ИИ. Доступ на таких условиях всё равно оставит часть независимых разработчиков за бортом.&lt;/p&gt;
&lt;p&gt;Однако владение книгами не даёт библиотеке права распространять их охраняемое авторским правом содержание как обучающий корпус.
разрешает научным учреждениям и библиотекам проводить интеллектуальный анализ законно доступных произведений в научных целях и допускает более широкий анализ там, где правообладатели не оговорили свои права.
: её исключение для такого анализа охватывает некоммерческие исследования и ограничивает передачу копий. Ни та ни другая система не даёт библиотекам общего права делиться своими охраняемыми фондами, чтобы другие могли на них строить.&lt;/p&gt;
&lt;p&gt;Стоило бы также пересмотреть, как долго правообладатели должны контролировать вычислительное использование книг. Фармацевтические патенты воплощают сделку: временная исключительность вознаграждает новаторство, а затем изобретение становится доступным для всех. Их обычный двадцатилетний срок куда короче, чем охрана авторского права на протяжении жизни автора и семидесяти лет после. Почему бы не применить сходный принцип к вычислительному использованию книг? Скажем, через двадцать лет после первой публикации книга могла бы становиться доступной для интеллектуального анализа текстов и данных без лицензионных отчислений, тогда как права на переиздание и продажу оставались бы под защитой. Авторы продолжали бы зарабатывать на своих книгах, а поколениям исследователей не пришлось бы договариваться о разрешении на их анализ.&lt;/p&gt;
&lt;p&gt;Два года назад я доказывал в
, что данные о культурном наследии следует считать общественным благом. Государства должны финансировать библиотеки и архивы, чтобы те оцифровывали, транскрибировали и документировали свои собрания, и наделить их юридическими полномочиями открывать полученные корпуса для других. Big Tech мог бы помочь оплатить счёт через целевой сбор.&lt;/p&gt;
&lt;p&gt;Государственное финансирование должно сопровождаться опубликованными правилами комплектования и доступа, охватывающими как академическую, так и коммерческую работу — без исключительных сделок и привилегированного доступа для доноров. Доступ для обучения не обязан означать неограниченного распространения книг, охраняемых авторским правом. Авторы должны участвовать в разработке публичной схемы, включая то, как она решает вопросы согласия, вознаграждения и конкуренции с их произведениями. Бесплатный доступ для пользователей не исключает вознаграждения авторов из государственных средств. Один из прецедентов — британская схема
(право на вознаграждение за библиотечную выдачу), по которой авторы получают деньги из общественных фондов, когда их книги берут в библиотеках. Костёр никогда не был сутью дела. Суть — ограда.&lt;/p&gt;</description></item><item><title>Уважаемые редакторы: хотите мой голос — верните мне мой язык</title><link>https://clementgodbarge.com/ru/post/dear-editors/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/ru/post/dear-editors/</guid><description>&lt;p&gt;Что ни день, то очередной журнал трубит о своих правилах насчёт ИИ. На сей раз это &lt;em&gt;Progress in Human Geography&lt;/em&gt;, редакторы которого опубликовали
, предупреждающее: использовать ИИ вместо собственного чтения, мышления и письма — «нарушение академической этики, сродни плагиату». Статьи, уличённые в нарушении, «могут быть отозваны»; в лучшем случае их исправят, напечатав в журнале уведомление. Авторам же, добавляют редакторы, следует «хорошенько подумать, хотят ли они, чтобы их имена связывались с отзывами и уведомлениями об исправлениях».&lt;/p&gt;
&lt;p&gt;На этой фразе стоит задержаться. Отзыв статьи — высшая мера в научных публикациях, кара, которую обычно приберегают для фальсификации и мошенничества. Здесь же её грозят применить за проступок, которого тот же самый редакционный текст не в состоянии определить. Есть, признают редакторы, «настоящие серые зоны» и «нет чётких линий, отделяющих зону „безответственности“». Решать будут на основании «субъективных суждений, которые могут огорчить некоторых авторов, утверждающих, что не злоупотребляли ИИ», — иначе говоря, вашу собственную декларацию могут и не принять во внимание. Далее следует совет оставаться «в безопасности, в зоне „ответственности“», — а к осторожности призывают лишь там, где есть опасность. Карать людей за переход черты, которую вы сами признаётесь не в силах провести, имеет смысл только в одном случае — если цель состоит в том, чтобы править страхом. Запомним это: пригодится.&lt;/p&gt;
&lt;h2 id="предлог-голос"&gt;Предлог: голос&lt;/h2&gt;
&lt;p&gt;Что же такое ответственное использование? Авторам говорят: «нужно приложить огромные усилия &amp;hellip; чтобы сохранить собственный голос». Злоупотребление — прибегать к ИИ, «чтобы писать на языке, которым авторы сами обычно никогда бы не пользовались». Для носителя языка это осмысленно: не притворяйся тем, кем ты не являешься. Но для иностранцев, вынужденных писать на чужом языке, это предписание противоречит само себе. Голос, который эти правила берегут, — как раз то единственное, в чём собственные правила журнала нам отказывают.&lt;/p&gt;
&lt;p&gt;Возьмите меня в качестве подопытного. Английский — мой четвёртый язык, ровно такой, каким я «обычно» никогда бы не пользовался. Англоязычные университеты выучили меня писать на нём коротко, с указателями, почти механически: тезис — в первой фразе абзаца, оговорки — в положенных местах, связки — из утверждённого списка. Выучка сработала: в моём английском никогда не было голоса, который стоило бы беречь; он-то и был первым, от чего пришлось избавиться. По определению самих редакторов, всё, что я написал по-английски, — ненадлежащее использование, с машиной или без.&lt;/p&gt;
&lt;h2 id="куда-ни-кинь-всюду-клин"&gt;Куда ни кинь, всюду клин&lt;/h2&gt;
&lt;p&gt;Редакторы говорят, что подумали о нас: правила признают, что не-носителям полезно проверять свой английский с помощью ИИ и даже пользоваться его «услугами перевода, письма и редактуры». И всё же участие ИИ в письме «должно сводиться, самое большее, к помощи в редактуре и корректуре» и не доходить до «больших кусков текста, написанных ИИ». Машинно переведённая статья написана ИИ от первого слова до последнего; она и есть сплошь такие куски. Значит, уступка действует лишь при условии, что перевод — это не письмо. Где проходит эта граница? Нам уже ответили: «чётких линий нет».&lt;/p&gt;
&lt;p&gt;Есть и кое-что похуже, потому что подозрение не просто нельзя опровергнуть. Оно ещё и играет краплёными картами. В 2023 году стэнфордская группа проверила семь широко используемых детекторов ИИ на эссе, написанных людьми: детекторы в среднем пометили как машинные 61 % эссе TOEFL, написанных не-носителями, тогда как эссе носителей распознавали почти безошибочно; один детектор пометил 97,8 % набора TOEFL (
). Причина поучительна. Детекторы измеряют предсказуемость, а английский как второй язык, натасканный на среднюю норму, предсказуем по самому своему устройству: самое вероятное слово в самом вероятном порядке. То же исследование нашло этот сигнал и в настоящей науке — меньшую языковую вариативность в докладах на конференциях, где первый автор не носитель языка. Стилистические приметы, которые читаются как «ИИ», — это приметы грамотного английского как второго языка, и человек, выносящий «субъективное суждение», читает те же приметы, что и машина. Клин со всех сторон: пишу на собственном английском — выгляжу машиной; беру машину — нарушаю их правило.&lt;/p&gt;
&lt;h2 id="налог-на-язык"&gt;Налог на язык&lt;/h2&gt;
&lt;p&gt;Парадокс был бы безобиден, если бы не сопровождался угрозами. Но угрозы вскрывают более глубокую и старую проблему, которую правила ни разу не называют: одноязычие.
требуют «как можно более широкого международного охвата», а на той же странице — «язык журнала — английский».&lt;/p&gt;
&lt;p&gt;Цена такого устройства отнюдь не гипотетическая. Опросив 908 специалистов по наукам об окружающей среде, Амано с коллегами выяснили, что не-носители английского тратят на написание статьи до 51 % больше времени, получают отказ в 2,5 раза чаще и в 12,5 раза чаще получают требование переработать текст — исключительно по языковым основаниям (
). Этот налог взимается ещё до всяких правил насчёт ИИ; декларация с её угрозами — лишь ревизия, надстроенная сверху.&lt;/p&gt;
&lt;h2 id="fin-dempire"&gt;Fin d’empire&lt;/h2&gt;
&lt;p&gt;Одноязычие — аксиома, которую никто не обсуждает. Это имперское наследство, со временем обзаведшееся практическим оправданием: перевод был медленным и дорогим, и ни одна редколлегия не могла оценить того, чего не могла прочесть. Но с успехами машинного перевода ничто из этого уже не держится. Современный машинный перевод можно использовать как надёжную прослойку между авторами и редакторами.&lt;/p&gt;
&lt;p&gt;Идеальный выход — человеческий: учёные должны читать больше чем на одном языке. Вместо этого англоязычные университеты предпочитают закрывать факультеты современных языков. Заметьте: закрытия — явление англо-американское; учёные в других странах никогда не могли позволить себе роскошь одноязычия. И заметьте, когда это происходит. Закрыть языковой факультет — значит сделать ставку на то, что английский победил навсегда и ничего стоящего никогда больше не будет написано ни на каком другом языке. Ставка делается в самый неподходящий момент, причём вдвойне. Во-первых, потому что машинный перевод впервые позволяет обойтись вовсе без лингва франка; во-вторых, потому что порядок, сделавший английский языком по умолчанию, отступает: англосфера замыкается в себе, глобализация идёт на убыль, свободную торговлю оспаривают в самых её колыбелях, и складывается многополярный мир, в котором языков, на которых стоит читать, будет всё больше. Университеты выпускают учёных, читающих только по-английски, для мира, где английского будет мало. Первыми эту потерю унаследуют редколлегии.&lt;/p&gt;
&lt;h2 id="проверка-для-редакторов"&gt;Проверка для редакторов&lt;/h2&gt;
&lt;p&gt;Когда редколлегия сетует, что не слышит собственного голоса своих авторов, — быть может, часть проблемы в самой редколлегии.&lt;/p&gt;
&lt;p&gt;Обвинение серьёзное, и к нему прилагается серьёзная проверка. Согласится ли &lt;em&gt;Progress in Human Geography&lt;/em&gt; рецензировать рукопись, написанную по-французски, по-итальянски или по-японски и сопровождённую машинным переводом на английский? Собственные инструкции журнала признают «услуги перевода», которые делают это возможным. «Да» закрывает проблему. «Нет» скажет нам, что на самом деле защищают эти правила.&lt;/p&gt;
&lt;p&gt;Так или иначе, выбор за редакторами. Если голос важен, как они утверждают, журналу следует принимать статьи на тех языках, на которых авторы думают. Если нет — декларацию нужно отменить, а вместе с ней и угрозы.&lt;/p&gt;</description></item><item><title>tei-mcp v0.3: кодировать в TEI, не переписывая источник</title><link>https://clementgodbarge.com/ru/post/tei-mcp-span-locked/</link><pubDate>Tue, 05 May 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/ru/post/tei-mcp-span-locked/</guid><description>&lt;p&gt;Когда я
, цель была одна: отучить
ИИ-ассистентов галлюцинировать разметку TEI. Заземление на схему решило часть
проблемы: имея прямой, инструментальный доступ к спецификации P5, модели больше
не нужно гадать, что означает элемент и какие атрибуты он принимает. Результат
проходит валидацию.&lt;/p&gt;
&lt;p&gt;Но у галлюцинации в кодировании TEI два лица, и схема ловит лишь одно. Валидация
по спецификации говорит, что &lt;em&gt;разметка&lt;/em&gt; корректна. О &lt;em&gt;тексте&lt;/em&gt;, который эта разметка
обёртывает, она не говорит ничего. А именно там — в самом тексте — живут самые
разрушительные галлюцинации. Сборка по закреплённым отрезкам (span-locked
composition), главная новинка v0.3, придумана специально, чтобы их не допускать.&lt;/p&gt;
&lt;details class="print:hidden xl:hidden" &gt;
&lt;summary&gt;Содержание&lt;/summary&gt;
&lt;div class="text-sm"&gt;
&lt;nav id="TableOfContents"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#галлюцинация-которую-схема-поймать-не-может"&gt;Галлюцинация, которую схема поймать не может&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#сборка-по-закреплённым-отрезкам"&gt;Сборка по закреплённым отрезкам&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#что-это-такое--и-чем-это-не-является"&gt;Что это такое — и чем это не является&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#почему-это-важно-и-за-пределами-tei"&gt;Почему это важно и за пределами TEI&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#как-обновиться"&gt;Как обновиться&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/nav&gt;
&lt;/div&gt;
&lt;/details&gt;
&lt;h2 id="галлюцинация-которую-схема-поймать-не-может"&gt;Галлюцинация, которую схема поймать не может&lt;/h2&gt;
&lt;p&gt;Попросите модель закодировать французское письмо XVI века — и нередко
получите документ TEI безупречного вида. Заголовок заполнен, теги &lt;code&gt;&amp;lt;persName&amp;gt;&lt;/code&gt;
расставлены правильно, &lt;code&gt;&amp;lt;dateline&amp;gt;&lt;/code&gt; оформлен как положено. Прогоните его через
&lt;code&gt;validate_document&lt;/code&gt; — он пройдёт.&lt;/p&gt;
&lt;p&gt;А потом сравните основной текст с источником.&lt;/p&gt;
&lt;p&gt;&lt;code&gt;mesme&lt;/code&gt; превратилось в &lt;code&gt;même&lt;/code&gt;. Запятая переехала. &lt;code&gt;luy&lt;/code&gt; тихо осовременили до
&lt;code&gt;lui&lt;/code&gt;. Фразу, которую трудно было разобрать в рукописи, «исправили» во что-то
более гладкое. Ни одного из этих изменений никто не просил. Ни одно не помечено.
Документ валиден по схеме и тихо неверен.&lt;/p&gt;
&lt;p&gt;Для архивного процесса — где закодированный текст становится постоянной записью,
на которую опираются последующие читатели, поисковые индексы и цитаты, — это
самый важный вид сбоя. Кривой тег раздражает. Осовремененное написание, которого
никто не замечает пять лет, — это порча.&lt;/p&gt;
&lt;h2 id="сборка-по-закреплённым-отрезкам"&gt;Сборка по закреплённым отрезкам&lt;/h2&gt;
&lt;p&gt;Новый выпуск (v0.3) содержит механизм предотвращения галлюцинаций, нацеленный
ровно на этот сбой. Цель конструкции — сделать галлюцинации в основном тексте
невозможными по самому устройству, а не просто маловероятными.&lt;/p&gt;
&lt;p&gt;Идея проста: &lt;strong&gt;модель никогда не набирает основной текст&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;Вместо этого процесс выглядит так:&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Модель вызывает &lt;code&gt;get_source(&amp;quot;letter_001&amp;quot;)&lt;/code&gt; и получает исходный простой текст
в виде неизменяемой строки.&lt;/li&gt;
&lt;li&gt;Для каждого тега, который она хочет поставить, она вызывает
&lt;code&gt;tag_span(&amp;quot;letter_001&amp;quot;, start, end, element_path, attrs)&lt;/code&gt;, регистрируя
элемент TEI на диапазоне символов источника.&lt;/li&gt;
&lt;li&gt;Закончив, она вызывает &lt;code&gt;compose(&amp;quot;letter_001&amp;quot;)&lt;/code&gt;. Сервер переплетает записанные
теги с исходным простым текстом, отрисовывает итоговый TEI и затем проверяет
&lt;em&gt;байт за байтом&lt;/em&gt;, что плоское текстовое содержимое полученного документа
равно источнику.&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;Если байты совпадают, документ возвращается. Если нет — если теги модели
каким-то образом подразумевают основной текст, отличающийся от источника хотя бы
на один символ, — &lt;code&gt;compose()&lt;/code&gt; выбрасывает исключение вместо того, чтобы вернуть
испорченный документ.&lt;/p&gt;
&lt;p&gt;В этом процессе нет пути, на котором модель выдала бы документ TEI с основным
текстом, отличным от источника. Инвариант механический, а не поведенческий.
Вам не нужно верить, что модель не станет галлюцинировать; нужно верить лишь
проверке &lt;code&gt;==&lt;/code&gt; между двумя байтовыми строками.&lt;/p&gt;
&lt;h2 id="что-это-такое--и-чем-это-не-является"&gt;Что это такое — и чем это не является&lt;/h2&gt;
&lt;p&gt;Сборка по закреплённым отрезкам &lt;strong&gt;дополняет&lt;/strong&gt; заземление на схему, а не заменяет
его. Инструменты заземления (&lt;code&gt;validate_document&lt;/code&gt;, &lt;code&gt;lookup_element&lt;/code&gt;,
&lt;code&gt;valid_children&lt;/code&gt; и остальные из первоначальных шестнадцати) помогают модели
выдавать &lt;em&gt;валидный&lt;/em&gt; TEI. Сборка по закреплённым отрезкам гарантирует, что
основной текст внутри этого TEI &lt;em&gt;верен&lt;/em&gt; источнику. Пригодный к внедрению процесс
кодирования должен удовлетворять обеим осям, и теперь обе покрывает один сервер.&lt;/p&gt;
&lt;p&gt;Но и волшебной таблеткой от всего это не назовёшь. &lt;code&gt;compose()&lt;/code&gt; пока не проверяет,
допустимы ли зарегистрированные теги по загруженной ODD-настройке — это следующий
шаг. Записанные теги живут в памяти процесса и не переживают перезапуск. А
исходные файлы должны быть доступны для чтения оттуда, где запущен сервер. Всё
это решаемо; ничто из этого не подрывает основной инвариант.&lt;/p&gt;
&lt;h2 id="почему-это-важно-и-за-пределами-tei"&gt;Почему это важно и за пределами TEI&lt;/h2&gt;
&lt;p&gt;Этот приём обобщается. Всякий раз, когда модель просят аннотировать, преобразовать
или обернуть фрагмент текста — и всякий раз, когда целостность исходного текста
важнее, чем способность модели его «улучшить», — годится решение той же формы.
Не просите модель перепечатывать текст. Просите её выдать инструкции над
текстом, а применять их пусть будет детерминированный сборщик под инвариантом
равенства.&lt;/p&gt;
&lt;p&gt;Для цифровых изданий в частности это меняет то, что можно ответственно поручить
модели. Кодирование вдруг становится задачей, которую можно делегировать, не
сверяя вручную каждый результат с источником. Машина идёт скучным путём;
редактор проверяет разметку, а не орфографию.&lt;/p&gt;
&lt;h2 id="как-обновиться"&gt;Как обновиться&lt;/h2&gt;
&lt;p&gt;Если tei-mcp у вас уже установлен:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;uvx tei-mcp@latest
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Или с нуля:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install tei-mcp
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Чтобы пользоваться сборкой по закреплённым отрезкам, укажите серверу каталог
с исходными текстовыми файлами:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="nb"&gt;export&lt;/span&gt; &lt;span class="nv"&gt;TEI_MCP_SPAN_SOURCE_ROOT&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;/path/to/sources
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;uvx tei-mcp
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Имя каждого файла без расширения становится идентификатором документа
(&lt;code&gt;letter_001.txt&lt;/code&gt; → &lt;code&gt;letter_001&lt;/code&gt;).&lt;/p&gt;
&lt;p&gt;Исходный код, полная документация и заметки о конструкции инварианта:
&lt;/p&gt;</description></item><item><title>tei-mcp</title><link>https://clementgodbarge.com/ru/code/tei-mcp/</link><pubDate>Sun, 15 Mar 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/ru/code/tei-mcp/</guid><description>&lt;h2 id="tei-mcp-tei-p5-для-ии-агентов"&gt;tei-mcp: TEI P5 для ИИ-агентов&lt;/h2&gt;
&lt;p&gt;tei-mcp —
-сервер с открытым исходным кодом, дающий ИИ-ассистентам для программирования прямой доступ к спецификации
. Вместо того чтобы полагаться на заученные обучающие данные — что часто даёт правдоподобную, но неверную разметку, — ИИ может обращаться к спецификации в реальном времени.&lt;/p&gt;
&lt;h2 id="возможности"&gt;Возможности&lt;/h2&gt;
&lt;p&gt;Сервер разбирает TEI P5 ODD и предоставляет 16 инструментов:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Поиск&lt;/strong&gt; любого элемента, класса, макроса или модуля по имени без учёта регистра и с подсказками при опечатках&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Разрешение атрибутов&lt;/strong&gt; по всей иерархии классов TEI (локальные + унаследованные)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Развёртывание моделей содержимого&lt;/strong&gt; в структурированные деревья с разрешением классов и макросов&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Проверка вложенности&lt;/strong&gt; — прямая связь «родитель — потомок» или рекурсивная достижимость с отслеживанием пути&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Валидация документов&lt;/strong&gt; по TEI P5: модели содержимого, атрибуты, закрытые списки значений, целостность ссылок и предупреждения об устаревших элементах&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Валидация отдельных элементов&lt;/strong&gt; для пошагового редактирования&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Загрузка ODD-настроек&lt;/strong&gt;, ограничивающих схему подмножеством, принятым в проекте&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Поиск по регулярным выражениям&lt;/strong&gt; среди всех типов сущностей&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="установка"&gt;Установка&lt;/h2&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install tei-mcp
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Или запустите напрямую:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;uvx tei-mcp
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;h2 id="использование"&gt;Использование&lt;/h2&gt;
&lt;p&gt;Добавьте в любой MCP-совместимый клиент (Claude, Cursor, Windsurf и т. д.):&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-json" data-lang="json"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;mcpServers&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;tei&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;command&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;uvx&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;args&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;tei-mcp&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Исходный код и документация — в
.&lt;/p&gt;</description></item><item><title>tei-mcp: TEI P5 для ИИ-агентов</title><link>https://clementgodbarge.com/ru/post/tei-mcp/</link><pubDate>Sun, 15 Mar 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/ru/post/tei-mcp/</guid><description>&lt;p&gt;Если вы когда-нибудь писали TEI XML с помощью ИИ-ассистента для программирования,
вы наверняка замечали, что он ошибается. Элементы появляются там, где им не место.
Атрибуты выдумываются. Правила вложенности игнорируются. Модель примерно представляет,
как выглядит TEI, но надёжного знания спецификации у неё нет.&lt;/p&gt;
&lt;p&gt;tei-mcp решает эту проблему, давая ИИ-агентам прямой доступ к Руководству TEI P5
через инструменты.&lt;/p&gt;
&lt;details class="print:hidden xl:hidden" &gt;
&lt;summary&gt;Содержание&lt;/summary&gt;
&lt;div class="text-sm"&gt;
&lt;nav id="TableOfContents"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#что-такое-mcp"&gt;Что такое MCP?&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#что-делает-tei-mcp"&gt;Что делает tei-mcp&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#почему-это-важно"&gt;Почему это важно&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#с-чего-начать"&gt;С чего начать&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/nav&gt;
&lt;/div&gt;
&lt;/details&gt;
&lt;h2 id="что-такое-mcp"&gt;Что такое MCP?&lt;/h2&gt;
&lt;p&gt;
(MCP) — открытый стандарт,
позволяющий ИИ-приложениям подключаться к внешним источникам данных и инструментам.
Считайте его USB-портом для ИИ: единый протокол, через который любой совместимый
клиент — Claude, Cursor, Windsurf и другие — подключается к специализированным службам.&lt;/p&gt;
&lt;p&gt;MCP-сервер предоставляет &lt;em&gt;инструменты&lt;/em&gt;, которые ИИ может вызывать по ходу разговора.
Вместо того чтобы полагаться на заученные обучающие данные, модель обращается к живому
авторитетному источнику.&lt;/p&gt;
&lt;h2 id="что-делает-tei-mcp"&gt;Что делает tei-mcp&lt;/h2&gt;
&lt;p&gt;tei-mcp разбирает спецификацию TEI P5 в формате ODD и предоставляет 16 инструментов,
покрывающих самые частые вопросы редактора или кодировщика:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Что это за элемент?&lt;/strong&gt; Поиск любого элемента, класса, макроса или модуля по имени,
без учёта регистра и с подсказками при опечатках.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Какие у него атрибуты?&lt;/strong&gt; Разрешение атрибутов по всей иерархии классов: сначала
локальные, затем унаследованные по порядку.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Что может быть внутри?&lt;/strong&gt; Развёртывание моделей содержимого в структурированные
деревья или плоский список допустимых потомков.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Можно ли поставить элемент сюда?&lt;/strong&gt; Проверка вложенности «родитель — потомок»
или трассировка достижимости по всей иерархии элементов.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Валиден ли мой документ?&lt;/strong&gt; Проверка файла TEI XML по спецификации: модели
содержимого, значения атрибутов, закрытые списки значений, целостность ссылок
и предупреждения об устаревших элементах.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;А как же схема моего проекта?&lt;/strong&gt; Загрузка файла ODD-настройки, чтобы ограничить
всё перечисленное подмножеством TEI, принятым в вашем проекте.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="почему-это-важно"&gt;Почему это важно&lt;/h2&gt;
&lt;p&gt;Кодирование в TEI требует постоянно сверяться с Руководством. Опытные кодировщики
усваивают самые ходовые схемы, но даже им приходится заглядывать в спецификацию ради
менее знакомых элементов или сложных моделей содержимого. У ИИ-ассистентов такого
усвоенного знания нет, и им приходится хуже: они галлюцинируют правдоподобную на вид,
но неверную разметку.&lt;/p&gt;
&lt;p&gt;С tei-mcp ИИ не приходится гадать. Он может найти ответ в спецификации, прежде чем
напишет хоть одну угловую скобку. В результате разметка соответствует TEI P5 — или
ODD-настройке вашего проекта.&lt;/p&gt;
&lt;h2 id="с-чего-начать"&gt;С чего начать&lt;/h2&gt;
&lt;p&gt;Установите из PyPI:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install tei-mcp
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;Затем добавьте сервер в конфигурацию вашего MCP-клиента:&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-json" data-lang="json"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;mcpServers&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;tei&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;command&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="s2"&gt;&amp;#34;uvx&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="nt"&gt;&amp;#34;args&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="s2"&gt;&amp;#34;tei-mcp&amp;#34;&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt; &lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;При первом запуске сервер скачивает спецификацию TEI и работает с любым
MCP-совместимым клиентом.&lt;/p&gt;
&lt;p&gt;Исходный код и полная документация:
&lt;/p&gt;</description></item></channel></rss>