Почему в базу не попал закон о лесных дорогах
Как мониторинг отличает регулирование цифровой экономики от всего остального: закрытый список тем, фильтр по виду документа, вес совпадений — и редактор, который может отменить решение машины
В августе в базе мониторинга нашёлся акт Министерства сельского хозяйства США — об отмене запрета на строительство дорог в бездорожных участках национальных лесов. К цифровой экономике он не имел отношения никакого. Попал он в базу по слову electronic, а удержался в ней на двух других: telecommunications relay service — справочная строка, которую американские ведомства по традиции печатают в каждом акте, и critical infrastructure — в противопожарном смысле, про просеки и разрывы.
Случай разобрали и написали методику. Ниже — как она устроена: что мы считаем цифровой экономикой, какие документы вообще берём, как машина решает, что документ по теме, и что делает редакция, когда машина ошиблась.
Тема — это закрытый список
Предмет мониторинга — не «всё, где встречается слово цифровой». Это регулирование десяти областей, и список закрытый: он расширяется только решением заказчика. Разница принципиальная. У открытого списка нет края: сначала в базу заходит «цифровизация документооборота в лесном хозяйстве», через месяц — любая норма, где что-нибудь подаётся через сайт, а ещё через месяц читать ленту становится незачем.
| Тема | Что относим | Чего не относим |
|---|---|---|
| Искусственный интеллект | требования к моделям и системам ИИ, автоматизированные решения, дипфейки, ответственность разработчика | слово «алгоритм» в расчётной формуле закона |
| Персональные данные | обработка, передача, защита, права субъекта, надзор | бытовой спор, где сторона «ввела свои данные при регистрации» |
| Кибербезопасность | защита сетей и информационных систем, инциденты, критическая информационная инфраструктура | физическая критическая инфраструктура: мосты, ЛЭП, противопожарные разрывы |
| Цифровые платформы и сервисы | обязанности платформ и маркетплейсов, модерация контента, привратники | упоминание социальной сети как места происшествия |
| Электронная коммерция и платежи | дистанционная торговля, платёжные услуги, финтех, цифровая валюта центробанка | обычный договор займа, заключённый через сайт |
| Цифровая идентификация и госуслуги | электронная подпись, цифровая личность, электронное правительство | процессуальная формула «подано с электронной подписью» |
| Телеком и инфраструктура | связь, спектр, широкополосный доступ, центры обработки данных, хранение трафика | слово telecommunications в справочной строке о службе для слабослышащих |
| Криптоактивы и блокчейн | обращение криптоактивов, распределённые реестры, стейблкоины | слово token в значении «жетон», «признак» |
| Цифровое здравоохранение | телемедицина, медицинские данные, электронная карта пациента | медицинский реестр на бумаге |
| Авторское право и цифровой контент | права на цифровой контент, интеллектуальная собственность в цифровой среде, добыча текста и данных | перечисление «интеллектуальная собственность» в списке отраслей права |
Правая колонка дороже левой. Левую можно написать за час из общих соображений, правая собрана из разобранных ложных срабатываний — каждая строка в ней когда-то была документом, который система привела, а редакция вычеркнула.
Список тем закрытый. У открытого списка нет края — и через полгода в базе оказывается всё, что как-нибудь связано с техникой.
Первый вопрос — не «о чём», а «что это вообще за документ»
Тематический отбор отвечает на вопрос «о чём документ». Но раньше него мы задаём вопрос проще и важнее: что это за документ по виду. В базе только акты уровня закона, законопроекты и судебная практика. Подзаконные акты не берём — и этот фильтр стоит первым, поэтому ведомственный приказ не попадёт в базу, даже если он целиком про искусственный интеллект.
Причина не в том, что подзаконные акты неинтересны. Тренд регулирования виден на уровне закона: там идёт спор, там принимается решение, там его можно сравнивать между странами. Ведомственная норма — это уже исполнение принятого решения, и её на порядок больше. Пока фильтра по виду не было, лента мониторинга состояла в основном из неё.
На 3513 записей в базе приходилось 647 подзаконных актов и 628 документов парламентской переписки: испанские Resolución о делегировании полномочий, австрийские постановления о тарифах надомного труда, 280 уведомлений Federal Register, 452 сообщения и рабочих документа Еврокомиссии.
После введения фильтра из базы удалено 1290 записей, а источник Federal Register снят с учёта целиком: ведомственных актов США там сотни в неделю, а актов уровня закона нет вовсе.
| Берём | Не берём |
|---|---|
| законы, конституционные и органические законы | постановления и приказы правительства и министерств |
| акты уровня закона: регламенты и директивы ЕС, декреты-законы, бразильские MPV, австрийские Bundesgesetze | исполнительные и делегированные акты ЕС, решения Комиссии |
| законопроекты и предложения законодательных актов, в том числе предложения Еврокомиссии | ведомственные правила США, испанские Resolución и Orden, австрийские Verordnung |
| поправки к законопроектам и правительственные законопроекты | резолюции палат, не становящиеся законом: HRES, SRES, HCONRES, SCONRES |
| судебные акты — отдельный поток мониторинга | парламентская переписка: запросы, письма, мотивированные предложения, отчёты и обзоры |
Вид документа мы не угадываем по названию. Почти каждый источник сам сообщает его отдельным полем, и мы читаем именно поле: у Конгресса США это billType (HR и S берём, HRES и SRES — нет), у Бундестага vorgangstyp со значением Gesetzgebung, у бразильских палат — аббревиатура вида (PL, PLP, PEC, MPV — да; RQS, REQ, PDL — нет), у испанского BOE — rango, у Второй палаты Нидерландов условие Soort eq «Wetgeving» уходит прямо в запрос, у шведского Риксдага — doktyp.1 Там, где поля нет, работает разбор названия и номера в официальном вестнике.
Проверка идёт дважды: при обнаружении — чтобы не тратить сутки загрузок на то, что всё равно не сохраним, — и после загрузки текста, потому что в метаданных самого документа признаков обычно больше, чем в карточке поиска. Незнакомый источник по умолчанию считается законодательным: лишний документ дешевле потерянной страны.
Путь документа
От чужого сайта до витрины документ проходит семь шагов, и на каждом его можно потерять — это нормально, потому что теряется в основном не то, что нужно.
- Источник. Адаптер к сайту парламента, суда или официального вестника. Где сайт умеет искать — идём словарём запросов на языке страны; где не умеет — забираем поток новых документов целиком.
- Вид документа. Подзаконные акты и парламентская переписка отсеиваются до всего остального.
- Обнаружение. Поиску чужого сайта мы не доверяем: решение о теме принимает наш классификатор по названию и карточке. Не увидел темы — документ не выбрасывается, а получает статус «кандидат» и ждёт полного текста.
- Загрузка текста. HTML, PDF или XML приводятся к нормализованному тексту — с восстановлением переносов, вычисткой колонтитулов и разметкой заголовков.
- Оценка. По названию, аннотации и первым 120 тысячам знаков считается вес совпадений.
- Витрина. Документ появляется в поиске и ленте; слабое совпадение помечается прямо в карточке.
- Оценка редакции. Человек подтверждает или опровергает решение системы.
Одно случайное слово темой не является
Это главная мысль всего отбора. Документ на триста страниц почти наверняка содержит слово «электронный» — и это ничего не говорит о том, про что он. Поэтому совпадения не считаются, а взвешиваются.
Зона. Название и аннотация весят больше тела документа: сильный термин в названии даёт три балла и сразу проводит документ, совпадение в теле — один балл. Порог попадания — три балла.2
Плотность. Тема, найденная только в теле, требует не менее двух упоминаний, и требование растёт с длиной: на каждые сто тысяч знаков — плюс одно. Рабочий документ Еврокомиссии на 250 тысяч знаков с единственным artificial intelligence темой не считается.
Сильные и слабые термины. Многозначные слова — algorithm, token, spectrum, privacy, social media, critical infrastructure, intellectual property, telecommunication — помечены как слабые: сами по себе они документ не проводят, нужен хотя бы один однозначный термин темы. Именно из-за этого правила лесной акт США больше не прошёл бы.
Стоп-обороты. Шаблонные формулы вычитаются до подсчёта: telecommunications relay service из справочной строки американских актов, invites written electronic comments, чешское zadal osobní údaje из описания регистрации на сайте, процессуальное opatřeno elektronickým podpisem.
Дедупликация. Совпадения склеиваются по месту в тексте. Раньше чешское osobní údaje ловилось и основным словарём, и расширением на другие языки: одна фраза давала два балла и документ проходил порог, сам себя подтвердив.
Снятые термины. Из словаря удалены слова, которые ловят не то: русское «связи» — из-за оборота «в связи с», eid — потому что по-немецки Eid это присяга, а Eidgenossenschaft — Швейцарская Конфедерация, mica — потому что буквы регламента MiCA совпадают с обычными словами нескольких языков.
Директива о защите данных попадёт в базу по названию — трёх баллов достаточно, текст можно даже не читать.
Бюджетный закон, где на 400 страницах трижды сказано «электронная подпись» в процессуальном смысле, не попадёт: зона — тело, термин слабый, плотности не хватает, а часть упоминаний вычтет стоп-оборот.
Спросить у источника правильно
Половина мусора приходит не из-за плохой оценки, а из-за плохого запроса. Federal Register США разбирал фразу electronic signature на отдельные слова и выдавал 165 актов за полтора месяца, из которых по теме были единицы. Та же фраза в кавычках даёт семь. Отсюда правило: многословный запрос уходит в кавычках везде, где источник это поддерживает, а где не поддерживает — результат считается потоком, а не находкой, и проходит полную оценку.
Решение видно целиком
Отбор, который нельзя объяснить, нельзя и починить. Поэтому решение сохраняется вместе с документом: какие термины сработали, в какой зоне, с каким контекстом вокруг, сколько баллов дал каждый и что было отброшено стоп-оборотами. Это лежит не в логах, а на странице документа во вкладке «Справка» — проверить отбор может любой читатель, а не только разработчик.
| Статус | Что значит | Где виден |
|---|---|---|
| по теме | тема подтверждена, документ по профилю мониторинга | в витрине и поиске |
| кандидат | найден по запросу, тема не видна по карточке, текст ещё не загружен | в витрине, помечен |
| слабое совпадение | текст загружен, совпадений не хватило | в витрине, помечен |
| вычеркнут | исключён редакцией | нигде: текст удалён, адрес в чёрном списке |
Последнее слово за человеком
Машинный отбор — первичный фильтр, а не окончательное решение. У сотрудника редакции на странице каждого документа три действия.
По теме. Подтверждение, что документ отобран верно. Такие документы образуют защитный список: правило, которое задело бы хоть один подтверждённый документ, система не предложит применить.
Не по теме. Документ остаётся в базе, но помечен как ошибка отбора. Именно на этих отметках система и учится.
Вычеркнуть. Тотальный отказ, доступный редактору: документ немедленно удаляется — тексты и редакции стираются, из поиска он исчезает, PDF удаляется с диска, а адрес и внешний номер попадают в чёрный список, чтобы ночной обход не завёл его заново. Действие обратимо: документ можно вернуть, и робот перезальёт его текст.
Оценка сохраняется вместе со снимком документа: название, источник, темы и полное объяснение отбора на момент оценки. Поэтому учиться на вычеркнутом документе можно и после того, как его текст удалён.
Как система учится
Накопленную обратную связь разбирает отдельный проход. Он ищет закономерности в отклонённых документах и предлагает правила четырёх видов.
| Правило | Когда предлагается |
|---|---|
| Стоп-оборот | один и тот же оборот — термин плюс три слова вокруг, цифры обезличены — повторяется в двух и более отклонённых документах |
| Пометить термин многозначным | термин держал два и более отклонённых документа и ни одного подтверждённого |
| Снять термин со словаря | уже помеченный слабым термин набрал четыре и более отклонений |
| Поправить запрос | два и более отклонённых документа пришли по одному многословному запросу |
Каждое правило показывается с числом отказов, на которых оно держится, и с числом подтверждённых документов, которых оно коснётся, — это риск. Правила с ненулевым риском не предлагаются вовсе. И ни одно правило не вступает в силу само: нужна кнопка «Применить».
Система не переписывает свои критерии сама. Иначе через месяц никто не сможет объяснить, почему документ не попал в базу.
Точность важнее полноты
Качество отбора мы меряем тремя величинами. Точность — доля подтверждённых редакцией среди отобранных; считается по накопленным оценкам, отдельно по источникам. Полнота — доля документов по теме, которые система нашла; оценивается выборочной проверкой источника за период. Управляемость — возможность объяснить любое решение: какой термин, в каком месте, в каком контексте.
Когда они конфликтуют, выбираем точность. Пропущенный документ найдётся на следующем прогоне или по запросу редакции — а база, засорённая случайными актами, обесценивает весь мониторинг: читатель перестаёт верить ленте и начинает проверять каждый документ руками, то есть делает ровно ту работу, ради которой мониторинг и заводили.
А что дальше
Методика — не приложение к системе, а её часть: у неё есть дата, история правок и повод для каждой из них. Ближайшее, что предстоит: русские аннотации ко всем документам (сейчас тексты хранятся на языке оригинала, и поиск по русскому слову находит мало) и структурный разбор текста при загрузке вместо словарной эвристики в оглавлении.
- Для актов ЕС вид определяется по буквам номера CELEX и форме акта в названии: сектор 5 с буквами PC и AP — это предложения Еврокомиссии, то есть законопроекты. ↑
- 120 тысяч знаков — предел, до которого читается тело документа при оценке. На хранение и поиск это не влияет: текст сохраняется целиком. ↑
- Счётчики в статье приведены на день публикации; в базе они меняются каждую ночь. ↑