Откуда HelpScaner берёт нормы: методология без чёрного ящика
Справедливый вопрос любого врача к сервису интерпретации анализов — на чём основаны его выводы. Не «мнение нейросети», а что именно лежит в основе каждой нормы и каждого объяснения. Показываем устройство базы знаний: какие источники используются, как между ними расставлены приоритеты и по какому протоколу всё обновляется.
- HelpScaner не отвечает «из головы» модели. Перед каждой расшифровкой система находит релевантные документы в собственной верифицированной базе и строит ответ на них — это подход retrieval-augmented generation (RAG).
- База построена на трёх уровнях источников: клинические рекомендации Минздрава РФ, международные лабораторные стандарты (CLSI, IFCC) и рецензируемые научные публикации. Всего — около 10 250 проверенных источников.
- Нормы применяются не «средние для взрослого», а популяционные — с учётом пола, возраста, беременности по триместрам, детских подгрупп, спортсменов и пожилых.
- При расхождении источников действует правило приоритета, а сама база регулярно обновляется по протоколу. При этом сервис остаётся справочным: он не ставит диагноз и не назначает лечение.
Доверие к любому инструменту интерпретации начинается с одного вопроса: на чём основан его ответ. Для врача это не праздное любопытство, а условие профессиональной ответственности — рекомендовать пациенту сервис можно, только понимая его источник истины. Поэтому мы описываем методологию открыто: не рекламные формулировки, а конкретное устройство базы знаний. Технические детали реализации мы, как и любой разработчик, не раскрываем, но принципы, источники и правила — показываем полностью.
Ответ на источнике, а не на «памяти» модели
Ключевое архитектурное решение: языковая модель в HelpScaner не является источником медицинских фактов. Она — механизм, который формулирует ответ, но опирается при этом на внешнюю проверяемую базу знаний. Перед формированием расшифровки система находит в базе релевантные документы по конкретным показателям и строит объяснение на них.
Этот подход называется retrieval-augmented generation (RAG), и его ценность подтверждена независимо. В контролируемом исследовании Lab-AI языковая модель без подключённой базы называла корректный нормальный диапазон анализа лишь в 38% случаев, а та же модель с базой — в 99%. Разница не в «мощности ИИ», а в наличии проверяемого источника под ответом.
Когда HelpScaner называет норму или объясняет отклонение, за этим стоит конкретный документ в базе, а не усреднённое «представление» модели о медицине из текстов интернета. Это принципиальное отличие от обычного ИИ-чата, куда просто загрузили бланк.
Три уровня доказательной базы
База знаний построена не из одного источника, а из трёх уровней, каждый из которых отвечает за свою часть интерпретации.
1. Клинические рекомендации Минздрава РФ
Отвечают за российский клинический контекст: диагностические пороги, тактику наблюдения, отечественную специфику. Это действующие документы официального рубрикатора, а не пересказ. Именно они обеспечивают соответствие расшифровки российской клинической практике.
2. Международные лабораторные стандарты (CLSI, IFCC)
Отвечают за референсные интервалы и методологию их построения. CLSI и IFCC — международно признанные организации по стандартизации лабораторной медицины. На их принципах строятся корректные границы нормы для показателей.
3. Рецензируемые научные публикации
Отвечают за глубину и актуальность: свежие данные по отдельным маркерам, взаимосвязям показателей, популяционным особенностям. Источник — рецензируемые публикации (PubMed) по профильным направлениям.
Один источник не покрывает всё. Клинреки дают национальный контекст, лабораторные стандарты — корректные референсы, публикации — актуальную глубину. Вместе они дают интерпретацию, которая и соответствует российской практике, и опирается на международную методологию, и учитывает свежие данные.
База в цифрах
Объём базы — не самоцель, но он показывает, что за расшифровкой стоит систематизированный массив, а не несколько справочников.
Каждый источник проходит отбор — в базу попадают действующие рекомендации и рецензируемые работы, а не произвольные тексты из сети. Это и отделяет верифицированную базу от «всего интернета», на котором обучалась исходная модель.
Норма под конкретного пациента
Самая частая ошибка автоматической интерпретации — универсальная норма «для взрослого». Между тем один и тот же показатель читается по-разному в зависимости от того, кто перед нами.
- Пол. Референсы эритроцитов, ферритина, креатинина, ряда гормонов различаются у мужчин и женщин.
- Возраст. Детские нормы разбиты на подгруппы; у пожилых свои особенности по ряду показателей.
- Беременность. Многие показатели имеют отдельные референсы по триместрам — их нельзя читать по общей шкале.
- Особые группы. Спортсмены, хронические состояния — контекст, который меняет трактовку «нормы».
HelpScaner применяет популяционные нормы: расшифровка учитывает категорию пациента, а не подставляет один усреднённый интервал. Это ровно тот индивидуальный контекст, отсутствие которого исследования называют главным изъяном пациентских порталов и обычных ИИ-чатов.
Что происходит при расхождении источников
Источники иногда расходятся: международный стандарт может давать один референс, а российская клиническая рекомендация — другой, с поправкой на отечественную практику. Оставлять это на усмотрение модели нельзя — нужен принцип.
Поэтому в основе интерпретации лежит правило приоритета источников. Референсные интервалы берутся из лабораторных стандартов, диагностические пороги и тактика — из действующих клинических рекомендаций, российский контекст имеет приоритет там, где это важно для отечественной практики. То есть при конфликте система опирается на более авторитетный для данной задачи источник, а не усредняет всё подряд.
Это правило — не «чёрный ящик». Партнёрской клинике мы готовы показать, на каких источниках построен конкретный ответ и почему выбрана именно эта норма. Прозрачность источника — часть продукта.
Как база остаётся действующей
Медицинские знания меняются, и «замороженная» на дате обучения модель — известная проблема любого ИИ. База знаний решает её тем, что обновляется отдельно от модели, по протоколу.
Срочно. При выходе значимого нового клинического документа соответствующая часть базы обновляется в короткий срок — не дожидаясь планового цикла.
Планово. Регулярная сверка и пополнение базы по графику, чтобы поддерживать актуальность источников.
Полная ревизия — раз в год. Комплексная проверка всей базы на актуальность: устаревшие данные заменяются действующими.
Отдельное преимущество подхода: обновить конкретный показатель можно, не переобучая языковую модель — достаточно обновить источник в базе. Это делает систему гибкой и позволяет держать нормы действующими, а не двухлетней давности.
Что методология не делает
Прозрачность требует честности и в обратную сторону — о границах. Даже самая выверенная база не превращает справочный сервис в систему клинических решений.
HelpScaner объясняет показатели, применяет корректные популяционные нормы и опирается на проверенные источники. Но он не ставит диагноз, не назначает лечение и не заменяет очную консультацию. База знаний обеспечивает качество справочной информации — а клиническое решение, синтез всей картины и ответственность остаются за врачом. Именно поэтому сервис безопасно рекомендовать пациенту: он готовит человека к приёму, а не подменяет его.
Коротко о главном
Методология HelpScaner строится на простом принципе: ответ должен опираться на проверяемый источник, а не на «эрудицию» модели. База из трёх уровней — клинические рекомендации Минздрава, международные лабораторные стандарты и рецензируемые публикации, около 10 250 источников — обеспечивает и российский контекст, и корректные референсы, и актуальную глубину. Нормы применяются под конкретного пациента, при конфликте источников работает правило приоритета, а сама база регулярно обновляется по протоколу. При этом сервис остаётся справочным и не претендует на клиническую функцию врача. Именно такая архитектура, а не мощность отдельной модели, отличает инструмент, которому можно доверять и который можно рекомендовать пациенту.
Хотите увидеть, как это работает на конкретных ответах?
Покажем на реальных примерах, на каких источниках строится расшифровка, и обсудим форматы сотрудничества для клиник и лабораторий.
Источники и стандарты
- Рубрикатор клинических рекомендаций Минздрава РФ: cr.minzdrav.gov.ru. Источник российского клинического контекста в базе знаний.
- Clinical and Laboratory Standards Institute (CLSI): стандарты построения референсных интервалов (в т. ч. EP28). Международная методология лабораторной нормы.
- International Federation of Clinical Chemistry (IFCC): международная стандартизация в лабораторной медицине.
- PubMed / PubMed Central: база рецензируемых научных публикаций, источник актуальных данных по маркерам и их взаимосвязям.
- Zhang Y. et al. Lab-AI: Retrieval Augmentation for Personalized Lab Test Interpretation. arXiv, 2025. Точность интерпретации без RAG — 38%, с RAG — 99%. Разбор — в материале «Почему нельзя просто загрузить анализы в ChatGPT».