BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

Отраслевые решения

  • Дистрибуция
  • Розничная торговля
  • Производство
  • Операторы связи
  • Банки
  • Страхование
  • Фармацевтика
  • Нефтегазовый сектор
  • Лизинг
  • Логистика
  • Медицина
  • Сеть ресторанов
  • Сельское хозяйство и агрохолдинги
  • Энергетика
  • E-Commerce
  • FMCG
  • Пищевая промышленность
  • Селлеры на маркетплейсах
  • Строительные компании и девелоперы

Функциональные решения

  • Управление по KPI
  • Финансы
  • Продажи
  • Склад
  • Категорийный менеджмент
  • HR
  • Маркетинг
  • Внутренний аудит
  • Геоаналитика, аналитика на географической карте
  • Цепочка поставок (SCM)
  • S&OP и FP&A
  • Разработка стратегии цифровой трансформации
  • Process Mining
  • Интегрированное планирование (IBP)
  • Закупки
  • ИТ (CIO)
  • Построение хранилища данных
  • Создание Data Lake и Data Engineering
Главная » Решения Эксперт-BI на российских BI-платформах » Эксперт-BI Фармацевтика: cистема бизнес-анализа для фармкомпаний » AI/ML для фармацевтической компании » Клинические исследования - Прогнозирование вероятности успешного прохождения клинических фаз исследования

Клинические исследования - Прогнозирование вероятности успешного прохождения клинических фаз исследования

Современная фармацевтика все активнее переходит к цифровым моделям принятия решений на этапе клинических исследований. Прогнозирование вероятности успешности прохождения каждой фазы исследования позволяет оптимизировать дизайн, ускорить цикл разработки, снизить риск несоответствия регуляторным требованиям и затраты. В данной главе рассматриваются концепции, архитектура конвейера данных и моделей, методы оценки и подходы к внедрению таких систем в реальных условиях регуляторной среды.

 

Краткое введение

Прогнозирование успешности клинического исследования - задача многоаспектная: она требует объединения клинического знания, качественных и количественных данных, строгой методологии валидации и устойчивости к различным видам смещений. Цель подхода - не заменить экспертную оценку, а дополнять её предикторными сигналами, помогающими соорганизовать ресурсами, определить потенциальные риски на ранних этапах и обосновать решения по дизайну протоколов, выбору площадок и стратегии перехода между фазами.

Далее следует краткое содержание главы.

  • Определение целей, целевых переменных и границ применения ML в контексте фаз исследований.
  • Архитектура конвейера данных и моделей: источники данных, обработка, валидация, интеграция в операционные процессы.
  • Методы, алгоритмы и критерии оценки, включая калибровку, устойчивость к смещениям и объяснимость.
  • Вопросы качества данных, регулирования, этики и управленческих практик.
  • Практические сценарии внедрения: проектирование, мониторинг и управление изменениями.
  • Риски, ограничении и путь к постоянному совершенствованию.

     

Концептуальная основа и целеполагание

Вероятность успеха клинического исследования можно рассматривать как сочетание вероятностей прохождения заданной фазы и вероятности корректного перехода к следующей фазе. В рамках ML задача состоит в оценке P(S_phase | контекст), где S_phase - событие успешного прохождения конкретной фазы, а контекст включает дизайн протокола, характеристики пациентов, данные площадки, регуляторные требования и исторические результаты. Важно различать предикторы на уровне пациента,site и протокола, а также учитывать временной аспект - задержки, изменения протокола и адаптивные элементы дизайна.

Поставленные цели ML-модели должны соответствовать реальным бизнес-решениям клинико-операционного процесса:

  • поддерживать ранний риск-менеджмент: ранние сигналы риска несоответствия требованиям, задержек, снижения мощности.
  • оптимизировать дизайн исследования: выбор дозировок, стратификаций, географии площадок, размер выборки.
  • улучшать стратегию перехода между фазами: приоритеты для продолжения, модификации протокола или досрочного прекращения.
  • обеспечивать регуляторную прозрачность: валидация, объяснимость и документируемость решений.

     

Архитектура конвейера ML для прогнозирования POS

  • Источники данных
    • Исторические данные по клиническим исследованиям: дизайн протоколов, результаты фаз, подгруппы пациентов, параметры площадок, темп набора.
    • Опиционные и операционные данные: CTMS, EDC, LIMS, электронные медицинские записи, базы регуляторных событий.
    • Данные по дизайну и регуляторике: требования на уровне протоколов, изменения протоколов, решения договоров с площадками.
    • Контекстные данные: географические и этические требования, локальные регуляторные условия, пандемические и прочие внешние факторы.
  • Интеграция и подготовка данных
    • Единственный источник истины через data lake/многоуровневый data warehouse.
    • Этапы очистки, деидентификации, нормализации и минимизации утечек информации между фазами.
    • Выявление и устранение смещений выборок между фазами, контроль качества и хранение метаданных об подготовке данных.
  • Инфраструктура обработки
    • Векторизация и инженерия признаков: создание признаков по дизайну протокола, характеристикам пациентов, характеристикам площадок и времени.
    • Хранилища признаков (feature store) для повторного использования и воспроизводимости.
    • Моделирование: модульная архитектура с возможностью горизонтального масштабирования в зависимости от объема данных.
  • Модели и валидация
    • Многоуровневые модели: фазозависимые и кросс-фазовые модели, модели для пациентов и площадок.
    • Методы борьбы с дисбалансом классов (малый процент успешных прохождений в отдельных фазах).
    • Метрики калибровки и дискриминации, а также проверки на устойчивость к смещениям.
  • Внедрение и эксплуатация
    • Интеграция с рабочими процессами клинико-операционной деятельности.
    • Мониторинг моделей, управление конфигурациями, аудит и трассируемость решений.
    • Регуляторная совместимость и объяснимость: поддержка SHAP-анализа, локальных объяснений и документов об обосновании решений.

       

Методы и алгоритмы: выбор подхода и принципы применения

  • Выбор целевой переменной
    • Для каждой фазы можно строить отдельную задачу бинарной классификации: успешность прохождения данной фазы (да/нет) или пройти/не пройти в контексте дизайна и протокола.
    • В рамках сложной системы возможно применение многоцелевых/мультизадачных моделей, которые учитывают зависимость между фазами и особенности протоколов.
  • Архитектурные решения
    • Линейные и обобщенные линейные модели: логистическая регрессия для базовых сценариев, хорошо объяснима и устойчиво работает на умеренно качественных данных.
    • Деревья решений и ансамбли: градиентный бустинг, случайный ліс, CatBoost - особенно эффективны на категориальных признаках без обширной предобработки.
    • Нейронные сети и графовые подходы: для сложных зависимостей между переменными и взаимосвязей между сайтами, протоколами и этапами исследования.
    • Модели времени: параметрические и непараметрические модели выживаемости, которые учитывают задержки, адаптивный дизайн и темп набора.
  • Обеспечение качества и устойчивости
    • Регуляризация, кросс-валидация по фазам и по регионам, стойкость к отсутствующим значениям и выбросам.
    • Калибровка вероятностей: важна для принятия решений на практических уровнях, особенно в регуляторной среде.
    • Объяснимость: локальные и глобальные методы интерпретации решений помогают клиницистам и регуляторам понять причины прогноза.
  • Регуляторная совместимость
    • Принципы прозрачности, журналирования и воспроизводимости, требования к аудитам и хранению версий моделей и данных.
    • Процедуры валидации и утверждения моделей перед внедрением в операционные процессы.

       

Управление данными, валидация и качество

  • Этические и правовые аспекты
    • Конфиденциальность пациентов и деидентификация; минимизация использования персональных данных; соответствие общим принципам GxP и регуляторным требованиям.
    • Прозрачность и объяснимость решений - требования регуляторов к обоснованию продвижений между фазами.
  • Управление качеством данных
    • Нормализация данных, качественные метаданные, фиксация причин отсутствия данных.
    • Мониторинг качества данных в реальном времени и периодическая ревизия источников.
  • Риск-менеджмент и контроль смещений
    • Временные и региональные различия в данных, влияние изменений протоколов, адаптивного дизайна.
    • Оценка потенциала смещений и их влияние на качество прогнозов, процедуры коррекции.
  • Валидация моделей
    • Валидационные подходы: внутренние и внешние валидации на отдельных наборах фаз, временные обрезки для предотвращения утечки.
    • Эмпирические пороги принятия решений: какие пороги вероятности считать достаточными для перехода к следующей фазе.

       

Внедрение и операционная практика

  • Интеграция в существующие процессы
    • Связь с CTMS, EDC и регуляторными системами; обмен сигналами между моделями и операционными командами.
    • Реализация циклов обратной связи: обновление моделей на основе новых данных, адаптация протоколов и площадок.
  • Мониторинг и управление изменениями
    • Контроль дрейфа моделей: регулярные проверки производительности, переобучение при необходимости, управление версиями.
    • Оценка влияния на бизнес-решения: как прогнозы влияют на дизайн протоколов, бюджет и сроки.
  • Сценарии внедрения
    • Поэтапное внедрение: пилотные проекты на отдельных фазах, масштабирование по фазам и проектам.
    • Взаимодействие с регуляторами: документирование методологии, обоснование решений, подготовка материалов для аудита.
  • Образовательная и организационная часть
    • Подготовка медицинских и операционных команд к работе с предиктивными сигналами: обучение, процессы интерпретации, роли и ответственности.
    • Управление изменениями, включающее улучшение культуры данных, роли data steward и регуляторную грамотность.

       

Этические и регуляторные соображения

  • Прозрачность и объяснимость
    • Объяснимость моделей - не только требование к регуляторам, но и средство поддержки доверия врачей, подрядчиков и спонсоров.
  • Справедливость и устойчивость
    • Анализ возможной предвзятости по географии, возрасту, половой принадлежности или другим характеристикам, влияние на дизайн и набор пациентов.
  • Регуляторная ответственность
    • Документация методологий, обоснование решений и методологий проверки; соответствие стандартам ICH E6 R2, 21 CFR Part 11 и др.
  • Безопасность информации
    • Управление доступами, аудит действий, обеспечение целостности данных и моделей.

       

Примеры применения и кейс-сценарии

  • Прогнозирование перехода между фазами для первичных коктейлей
    • Регистрация сигнатур риска на этапе протокольной разработки, выбор площадок и ускорение набора участников без снижения качества данных.
  • Оптимизация дизайна протокола и стратификации
    • Построение моделей, учитывающих географическое распределение пациентов и специфические требования протокола, что позволяет точнее оценивать мощность и прогнозировать проблемы на ранних стадиях.
  • Контроль регуляторной готовности
    • Использование объяснимых моделей для подготовки документов регуляторным комитетам, иллюстрирующих обоснование решений по дизайну и переходам между фазами.

CatBoost и CatBoost-подходы к обработке категориальных признаков

  • В рамках проектов можно применять CatBoost - современный открытый инструмент, хорошо работающий с категориальными данными и устойчивый к пропускам. Он обеспечивает высокую точность и относительную простоту интерпретации, что полезно в регуляторной среде. Применение таких инструментов помогает ускорить прототипирование и обеспечить прозрачность цепочек решений.

     

Open-source и российские примеры

  • CatBoost как инструмент с поддержкой литературных и реальных применений в медицине и биоинформатике.
  • В контексте индустрии можно рассмотреть использование общих машинно-обучающих фреймворков (например, CatBoost, PyTorch) в сочетании с локальной инфраструктурой для соблюдения регуляторных требований и контроля версий данных и моделей.

     

Вопросы внедрения: какие вопросы стоит задать проектной группе

  • Какова конкретная формулировка целевых переменных для каждой фазы, и какие допустимые альтернативы мы рассматриваем?
  • Какие источники данных будут включены, и как обеспечивается качество и прозрачность данных на разных этапах?
  • Какие меры безопасности, конфиденциальности и регуляторной прозрачности необходимы для внедрения?
  • Как мы будем проводить валидацию модели и как будем оценивать переносимость между фазами и протоколами?
  • Какие сигналы применимости и объяснимости мы предоставим клиницистам и регуляторам?
  • Как будет организована интеграция с операционными системами и какие процессы будут поддержаны для мониторинга и обновления моделей?
  • Какие риски дрейфа данных и изменений протоколов нужно учитывать, и какие процедуры предусмотрены для управления ними?
  • Как будет происходить обучение команд пользователям и какие роли задействованы в управлении моделями?
  • Какие внешние параметры (регуляторные изменения, пандемии, локальные политические факторы) следует включать в модель как контекст?

     

Key takeaways

  • Прогнозирование вероятности успешного прохождения фаз требует интеграции клинических знаний, качественных данных и строгой методологии верификации.
  • Архитектура конвейера данных должна включать шаги от очистки и нормализации до инженерии признаков, моделирования и регуляторной валидации.
  • Выбор моделей зависит от задачи, данных и требований к объяснимости; современные подходы включают CatBoost для категориальных данных и временные/мультитасковые решения для фаз.
  • Важны вопросы качества данных, риска смещений, калибровки вероятностей и прозрачности решений для регуляторной поддержки.
  • Внедрение требует тесной интеграции с CTMS/EDC и четкого управления изменениями, включая мониторинг производительности и регуляторную документацию.
  • Этические принципы, защита данных и соблюдение регуляторных требований должны быть встроены в каждую фазу проекта.
  • Регулярная коммуникация между клиницистами, биостатистиками, ИТ-специалистами и регуляторами обеспечивает устойчивость и доверие к системе.

     

FAQ

  1. Как определить целевые переменные для разных фаз?
  • Для каждой фазы формулируется бинарная цель: успешно пройденная фаза или нет. В рамках дизайна можно рассмотреть мультизадачность, где одна модель оценивает вероятность для нескольких фаз одновременно. Важна четкая трактовка события, например, “прошёл фазу II” означает, что конечные показатели достигнуты в условиях заданного протокола и набора пациентов. В реальном проекте целевые переменные следует согласовывать с клиническими и регуляторными специалистами.

 

  1. Какие данные критичны для предиктивной модели?
  • Ключевые данные включают характеристики протокола и дизайна фазы, демографику и клинические признаки пациентов, данные площадок (региональные, исторические результаты), темпы набора, а также регуляторно значимые параметры дизайна, изменения протокола и факторы времени. Важно иметь качественные метаданные и возможность отслеживать источники данных.

 

  1. Как обеспечить качество данных и защиту конфиденциальности?
  • Необходимо реализовать процедуры деидентификации, минимизации данных и строгие политики доступа. Контроль качества данных включает валидацию форматов, согласование значений и мониторинг пропусков. В рамках регуляторной среды требуется трассируемость, аудит изменений и документирование процессов подготовки данных.

 

  1. Какие методы пригодны для оценки калибровки прогнозов?
  • Важна не только точность, но и калибровка вероятностей. Методы включают калибровку по калибровочным кривым (например, Platt scaling, isotonic regression) и оценку Brier score. Регуляторные требования часто требуют того, чтобы прогнозы соответствовали реальной доле событий в рамках утвержденных протоколов.

 

  1. Какие сценарии внедрения наиболее эффективны?
  • Этапное внедрение: пилот на одной фазе или нескольких площадках, последующее масштабирование на другие фазы. В начале следует обеспечить интеграцию с существующими системами и выработать процедуры для обратной связи и обновления моделей. Встроенный мониторинг и регуляторная документация - критические элементы.

 

  1. Как обеспечить объяснимость моделей?
  • Использование локальных и глобальных объяснений, например, SHAP-методов, позволяет понять вклад признаков в прогноз. Клиническим специалистам и регуляторам должно быть возможно увидеть причины прогноза и проверить логику принятого решения.

 

  1. Как учитывать дрейф данных и изменений дизайна?
  • В рамках политики модели следует включить регулярную переобучаемость, обновление признаков и мониторинг производительности на новых данных. Необходимо заранее определить, какие пороги производительности являются допустимыми для продолжения проекта и когда необходимы коррективы в дизайне протокола.

 

  1. Какие регуляторные требования применимы к такого рода решениям?
  • Требования диапазона регуляторной прозрачности, аудита и валидации схожи с общими стандартами ICH E6 R2, 21 CFR Part 11 и аналогичными регуляторными нормами. Необходимо подготовить детализированные документы, обосновать выбор моделей и процесс принятия решений, а также обеспечить трассируемость и повторяемость анализов.

 

  1. Какие примеры инструментов и технологий стоит рассмотреть?
  • Среди инструментов можно рассмотреть CatBoost для работы с категориальными данными и структурированными данными, а также современные фреймворки для времени и мультитаски - в зависимости от сложности проекта. Важно обеспечить совместимость с существующей инфраструктурой и требованиями к безопасности.

 

  1. Какой подход к обучению команд наиболее эффективен?
  • Необходимо сочетать обучение по методологии Data governance, объяснимости и регуляторной грамотности с клиническим контекстом. Важно определить роли data steward, биостатистика, регуляторного аналитика и операционных специалистов. Эффективность обучения повышает прозрачность процессов и ускоряет принятие решений.

 

Эта глава предоставляет целостную схему для разработки и внедрения ML-моделей, прогнозирующих вероятность успешности клинических фаз, с учетом архитектурных решений, методологии, регуляторных требований и организационных практик.

← Предыдущая статья
Клинические исследования - Анализ результатов клинических исследований для выявления факторов эффективности препаратов
Следующая статья →
Клинические исследования - Модели выявления побочных эффектов препаратов на основе медицинских данных

 

Узнать стоимость решенияЗапросить видео презентацию

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • AbbVie – компания, которая стремится решить самые серьезные проблемы здравоохранения. Это биофармацевтическая компания, сфокусированная на исследованиях и разработках.

  • АО «Евросиб СПб–транспортные системы» – оператор контейнерных сервисов с широкой сетью маршрутов на внутрироссийских и международных направлениях. Имеет успешный опыт управления парком фитинговых платформ, а также организации ускоренных контейнерных поездов, в основе которых точное расписание, оптимальные сроки доставки груза и экономическая целесообразность.

  • В 2003 году Мерсико и пятью микрокредитными агентствами Мерсико было принято историческое решение о консолидации активов по всей территории Кыргызстана в целях образования национального финансового института по развитию сообществ - Компаньона. В октябре 2004 года Компаньон был зарегистрирован Национальным банком Кыргызской Республики.

  • «Балтийский лизинг» — первая компания в России, получившая лицензию № 0001 от Министерства экономики РФ на лизинговую деятельность, лицензия зарегистрирована 2 сентября 1996 года. «Балтийский лизинг» работает на российском рынке 33 года: компания представлена 79 филиалами по всей стране, сегодня в штате более 1300 сотрудников. За последние десять лет компания профинансировала имущество для 80 000 клиентов.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.