Методические заметки · 25 августа 2026 · 8 мин чтения

Почему в базу не попал закон о лесных дорогах

Как мониторинг отличает регулирование цифровой экономики от всего остального: закрытый список тем, фильтр по виду документа, вес совпадений — и редактор, который может отменить решение машины

В августе в базе мониторинга нашёлся акт Министерства сельского хозяйства США — об отмене запрета на строительство дорог в бездорожных участках национальных лесов. К цифровой экономике он не имел отношения никакого. Попал он в базу по слову electronic, а удержался в ней на двух других: telecommunications relay service — справочная строка, которую американские ведомства по традиции печатают в каждом акте, и critical infrastructure — в противопожарном смысле, про просеки и разрывы.

Случай разобрали и написали методику. Ниже — как она устроена: что мы считаем цифровой экономикой, какие документы вообще берём, как машина решает, что документ по теме, и что делает редакция, когда машина ошиблась.

604
документа в базе на сегодня
21
юрисдикция
146
источников: парламенты, суды, вестники

Тема — это закрытый список

Предмет мониторинга — не «всё, где встречается слово цифровой». Это регулирование десяти областей, и список закрытый: он расширяется только решением заказчика. Разница принципиальная. У открытого списка нет края: сначала в базу заходит «цифровизация документооборота в лесном хозяйстве», через месяц — любая норма, где что-нибудь подаётся через сайт, а ещё через месяц читать ленту становится незачем.

ТемаЧто относимЧего не относим
Искусственный интеллекттребования к моделям и системам ИИ, автоматизированные решения, дипфейки, ответственность разработчикаслово «алгоритм» в расчётной формуле закона
Персональные данныеобработка, передача, защита, права субъекта, надзорбытовой спор, где сторона «ввела свои данные при регистрации»
Кибербезопасностьзащита сетей и информационных систем, инциденты, критическая информационная инфраструктурафизическая критическая инфраструктура: мосты, ЛЭП, противопожарные разрывы
Цифровые платформы и сервисыобязанности платформ и маркетплейсов, модерация контента, привратникиупоминание социальной сети как места происшествия
Электронная коммерция и платежидистанционная торговля, платёжные услуги, финтех, цифровая валюта центробанкаобычный договор займа, заключённый через сайт
Цифровая идентификация и госуслугиэлектронная подпись, цифровая личность, электронное правительствопроцессуальная формула «подано с электронной подписью»
Телеком и инфраструктурасвязь, спектр, широкополосный доступ, центры обработки данных, хранение трафикаслово telecommunications в справочной строке о службе для слабослышащих
Криптоактивы и блокчейнобращение криптоактивов, распределённые реестры, стейблкоиныслово token в значении «жетон», «признак»
Цифровое здравоохранениетелемедицина, медицинские данные, электронная карта пациентамедицинский реестр на бумаге
Авторское право и цифровой контентправа на цифровой контент, интеллектуальная собственность в цифровой среде, добыча текста и данныхперечисление «интеллектуальная собственность» в списке отраслей права

Правая колонка дороже левой. Левую можно написать за час из общих соображений, правая собрана из разобранных ложных срабатываний — каждая строка в ней когда-то была документом, который система привела, а редакция вычеркнула.

Список тем закрытый. У открытого списка нет края — и через полгода в базе оказывается всё, что как-нибудь связано с техникой.

Первый вопрос — не «о чём», а «что это вообще за документ»

Тематический отбор отвечает на вопрос «о чём документ». Но раньше него мы задаём вопрос проще и важнее: что это за документ по виду. В базе только акты уровня закона, законопроекты и судебная практика. Подзаконные акты не берём — и этот фильтр стоит первым, поэтому ведомственный приказ не попадёт в базу, даже если он целиком про искусственный интеллект.

Причина не в том, что подзаконные акты неинтересны. Тренд регулирования виден на уровне закона: там идёт спор, там принимается решение, там его можно сравнивать между странами. Ведомственная норма — это уже исполнение принятого решения, и её на порядок больше. Пока фильтра по виду не было, лента мониторинга состояла в основном из неё.

Как это выглядело в цифрах

На 3513 записей в базе приходилось 647 подзаконных актов и 628 документов парламентской переписки: испанские Resolución о делегировании полномочий, австрийские постановления о тарифах надомного труда, 280 уведомлений Federal Register, 452 сообщения и рабочих документа Еврокомиссии.

После введения фильтра из базы удалено 1290 записей, а источник Federal Register снят с учёта целиком: ведомственных актов США там сотни в неделю, а актов уровня закона нет вовсе.

БерёмНе берём
законы, конституционные и органические законыпостановления и приказы правительства и министерств
акты уровня закона: регламенты и директивы ЕС, декреты-законы, бразильские MPV, австрийские Bundesgesetzeисполнительные и делегированные акты ЕС, решения Комиссии
законопроекты и предложения законодательных актов, в том числе предложения Еврокомиссииведомственные правила США, испанские Resolución и Orden, австрийские Verordnung
поправки к законопроектам и правительственные законопроектырезолюции палат, не становящиеся законом: HRES, SRES, HCONRES, SCONRES
судебные акты — отдельный поток мониторингапарламентская переписка: запросы, письма, мотивированные предложения, отчёты и обзоры

Вид документа мы не угадываем по названию. Почти каждый источник сам сообщает его отдельным полем, и мы читаем именно поле: у Конгресса США это billType (HR и S берём, HRES и SRES — нет), у Бундестага vorgangstyp со значением Gesetzgebung, у бразильских палат — аббревиатура вида (PL, PLP, PEC, MPV — да; RQS, REQ, PDL — нет), у испанского BOE — rango, у Второй палаты Нидерландов условие Soort eq «Wetgeving» уходит прямо в запрос, у шведского Риксдага — doktyp.1 Там, где поля нет, работает разбор названия и номера в официальном вестнике.

Проверка идёт дважды: при обнаружении — чтобы не тратить сутки загрузок на то, что всё равно не сохраним, — и после загрузки текста, потому что в метаданных самого документа признаков обычно больше, чем в карточке поиска. Незнакомый источник по умолчанию считается законодательным: лишний документ дешевле потерянной страны.

316
судебных решений
279
законопроектов
9
законов

Путь документа

От чужого сайта до витрины документ проходит семь шагов, и на каждом его можно потерять — это нормально, потому что теряется в основном не то, что нужно.

  1. Источник. Адаптер к сайту парламента, суда или официального вестника. Где сайт умеет искать — идём словарём запросов на языке страны; где не умеет — забираем поток новых документов целиком.
  2. Вид документа. Подзаконные акты и парламентская переписка отсеиваются до всего остального.
  3. Обнаружение. Поиску чужого сайта мы не доверяем: решение о теме принимает наш классификатор по названию и карточке. Не увидел темы — документ не выбрасывается, а получает статус «кандидат» и ждёт полного текста.
  4. Загрузка текста. HTML, PDF или XML приводятся к нормализованному тексту — с восстановлением переносов, вычисткой колонтитулов и разметкой заголовков.
  5. Оценка. По названию, аннотации и первым 120 тысячам знаков считается вес совпадений.
  6. Витрина. Документ появляется в поиске и ленте; слабое совпадение помечается прямо в карточке.
  7. Оценка редакции. Человек подтверждает или опровергает решение системы.

Одно случайное слово темой не является

Это главная мысль всего отбора. Документ на триста страниц почти наверняка содержит слово «электронный» — и это ничего не говорит о том, про что он. Поэтому совпадения не считаются, а взвешиваются.

Зона. Название и аннотация весят больше тела документа: сильный термин в названии даёт три балла и сразу проводит документ, совпадение в теле — один балл. Порог попадания — три балла.2

Плотность. Тема, найденная только в теле, требует не менее двух упоминаний, и требование растёт с длиной: на каждые сто тысяч знаков — плюс одно. Рабочий документ Еврокомиссии на 250 тысяч знаков с единственным artificial intelligence темой не считается.

Сильные и слабые термины. Многозначные слова — algorithm, token, spectrum, privacy, social media, critical infrastructure, intellectual property, telecommunication — помечены как слабые: сами по себе они документ не проводят, нужен хотя бы один однозначный термин темы. Именно из-за этого правила лесной акт США больше не прошёл бы.

Стоп-обороты. Шаблонные формулы вычитаются до подсчёта: telecommunications relay service из справочной строки американских актов, invites written electronic comments, чешское zadal osobní údaje из описания регистрации на сайте, процессуальное opatřeno elektronickým podpisem.

Дедупликация. Совпадения склеиваются по месту в тексте. Раньше чешское osobní údaje ловилось и основным словарём, и расширением на другие языки: одна фраза давала два балла и документ проходил порог, сам себя подтвердив.

Снятые термины. Из словаря удалены слова, которые ловят не то: русское «связи» — из-за оборота «в связи с», eid — потому что по-немецки Eid это присяга, а Eidgenossenschaft — Швейцарская Конфедерация, mica — потому что буквы регламента MiCA совпадают с обычными словами нескольких языков.

Что это значит на практике

Директива о защите данных попадёт в базу по названию — трёх баллов достаточно, текст можно даже не читать.

Бюджетный закон, где на 400 страницах трижды сказано «электронная подпись» в процессуальном смысле, не попадёт: зона — тело, термин слабый, плотности не хватает, а часть упоминаний вычтет стоп-оборот.

Спросить у источника правильно

Половина мусора приходит не из-за плохой оценки, а из-за плохого запроса. Federal Register США разбирал фразу electronic signature на отдельные слова и выдавал 165 актов за полтора месяца, из которых по теме были единицы. Та же фраза в кавычках даёт семь. Отсюда правило: многословный запрос уходит в кавычках везде, где источник это поддерживает, а где не поддерживает — результат считается потоком, а не находкой, и проходит полную оценку.

Решение видно целиком

Отбор, который нельзя объяснить, нельзя и починить. Поэтому решение сохраняется вместе с документом: какие термины сработали, в какой зоне, с каким контекстом вокруг, сколько баллов дал каждый и что было отброшено стоп-оборотами. Это лежит не в логах, а на странице документа во вкладке «Справка» — проверить отбор может любой читатель, а не только разработчик.

СтатусЧто значитГде виден
по теметема подтверждена, документ по профилю мониторингав витрине и поиске
кандидатнайден по запросу, тема не видна по карточке, текст ещё не загруженв витрине, помечен
слабое совпадениетекст загружен, совпадений не хватилов витрине, помечен
вычеркнутисключён редакциейнигде: текст удалён, адрес в чёрном списке

Последнее слово за человеком

Машинный отбор — первичный фильтр, а не окончательное решение. У сотрудника редакции на странице каждого документа три действия.

По теме. Подтверждение, что документ отобран верно. Такие документы образуют защитный список: правило, которое задело бы хоть один подтверждённый документ, система не предложит применить.

Не по теме. Документ остаётся в базе, но помечен как ошибка отбора. Именно на этих отметках система и учится.

Вычеркнуть. Тотальный отказ, доступный редактору: документ немедленно удаляется — тексты и редакции стираются, из поиска он исчезает, PDF удаляется с диска, а адрес и внешний номер попадают в чёрный список, чтобы ночной обход не завёл его заново. Действие обратимо: документ можно вернуть, и робот перезальёт его текст.

Оценка сохраняется вместе со снимком документа: название, источник, темы и полное объяснение отбора на момент оценки. Поэтому учиться на вычеркнутом документе можно и после того, как его текст удалён.

Как система учится

Накопленную обратную связь разбирает отдельный проход. Он ищет закономерности в отклонённых документах и предлагает правила четырёх видов.

ПравилоКогда предлагается
Стоп-оборотодин и тот же оборот — термин плюс три слова вокруг, цифры обезличены — повторяется в двух и более отклонённых документах
Пометить термин многозначнымтермин держал два и более отклонённых документа и ни одного подтверждённого
Снять термин со словаряуже помеченный слабым термин набрал четыре и более отклонений
Поправить запросдва и более отклонённых документа пришли по одному многословному запросу

Каждое правило показывается с числом отказов, на которых оно держится, и с числом подтверждённых документов, которых оно коснётся, — это риск. Правила с ненулевым риском не предлагаются вовсе. И ни одно правило не вступает в силу само: нужна кнопка «Применить».

Система не переписывает свои критерии сама. Иначе через месяц никто не сможет объяснить, почему документ не попал в базу.

Точность важнее полноты

Качество отбора мы меряем тремя величинами. Точность — доля подтверждённых редакцией среди отобранных; считается по накопленным оценкам, отдельно по источникам. Полнота — доля документов по теме, которые система нашла; оценивается выборочной проверкой источника за период. Управляемость — возможность объяснить любое решение: какой термин, в каком месте, в каком контексте.

Когда они конфликтуют, выбираем точность. Пропущенный документ найдётся на следующем прогоне или по запросу редакции — а база, засорённая случайными актами, обесценивает весь мониторинг: читатель перестаёт верить ленте и начинает проверять каждый документ руками, то есть делает ровно ту работу, ради которой мониторинг и заводили.

График живой: читает базу напрямую и обновляется вместе с ней.3

А что дальше

Методика — не приложение к системе, а её часть: у неё есть дата, история правок и повод для каждой из них. Ближайшее, что предстоит: русские аннотации ко всем документам (сейчас тексты хранятся на языке оригинала, и поиск по русскому слову находит мало) и структурный разбор текста при загрузке вместо словарной эвристики в оглавлении.

Было
22 августа 2026
Первая редакция методики
Поводом стал акт Минсельхоза США о лесных дорогах. Появились зоны, плотность, слабые термины и стоп-обороты.
Сейчас
23 августа 2026
Фильтр по виду документа
В базе только акты уровня закона, законопроекты и судебная практика. Удалено 1290 записей, Federal Register снят с учёта.
Дальше
осень 2026
Аннотации и разбор структуры
Русские аннотации ко всем документам и структурный разбор текста при загрузке.
  1. Для актов ЕС вид определяется по буквам номера CELEX и форме акта в названии: сектор 5 с буквами PC и AP — это предложения Еврокомиссии, то есть законопроекты.
  2. 120 тысяч знаков — предел, до которого читается тело документа при оценке. На хранение и поиск это не влияет: текст сохраняется целиком.
  3. Счётчики в статье приведены на день публикации; в базе они меняются каждую ночь.

Читайте также