Лекция
Привет, Вы узнаете о том , что такое анализ выживаемости, Разберем основные их виды и особенности использования. Еще будет много подробных примеров и описаний. Для того чтобы лучше понимать что такое анализ выживаемости, цензурирование , настоятельно рекомендую прочитать все из категории Теория вероятностей. Математическая статистика и Стохастический анализ .
анализ выживаемости (англ. survival analysis) — класс статистических моделей, позволяющих оценить вероятность наступления события.
Анализ выживаемости — это раздел статистики , посвященный анализу ожидаемой продолжительности времени до наступления одного события, такого как смерть в биологических организмах и отказ в механических системах. Эта тема называется теорией надежности , анализом надежности или техникой надежности в инженерии , анализом продолжительности или моделированием продолжительности в экономике и анализом истории событий в социологии . Анализ выживаемости пытается ответить на определенные вопросы, например, какова доля популяции, которая выживет после определенного времени? Из тех, кто выживет, с какой скоростью они умрут или выйдут из строя? Можно ли учитывать несколько причин смерти или отказа? Как определенные обстоятельства или характеристики увеличивают или уменьшают вероятность выживания ?
Чтобы ответить на эти вопросы, необходимо определить понятие «срок службы». В случае биологического выживания смерть не вызывает сомнений, но в случае механической надежности отказ может быть определен нечетко, поскольку вполне могут существовать механические системы, в которых отказ носит частичный, степенной характер или не локализован каким-либо иным образом во времени . Даже в биологических задачах некоторые события (например, сердечный приступ или отказ другого органа) могут обладать такой же неоднозначностью. Теория, изложенная ниже, предполагает наличие четко определенных событий в определенные моменты времени; другие случаи могут быть лучше описаны моделями, которые явно учитывают неоднозначные события.
В более общем смысле анализ выживаемости включает моделирование данных о времени до события; в этом контексте смерть или отказ считаются «событием» в литературе по анализу выживаемости – традиционно для каждого субъекта происходит только одно событие, после которого организм или механизм погибает или выходит из строя. Модели повторяющихся событий или многократных событий ослабляют это предположение. Изучение повторяющихся событий актуально для системной надежности , а также для многих областей социальных наук и медицинских исследований.
Анализ выживаемости занимается моделированием процессов наступления терминальных (критических) событий для элементов той или иной совокупности (изначально — «смерти» для элементов совокупности живых существ). Так, в рамках медицинских исследований анализ выживаемости может отвечать на такие вопросы, как «какова будет доля выживших среди пациентов спустя некоторое время после примененных техник лечения?», «какие темпы смертности будут наблюдаться среди выживших?», «какие факторы воздействуют на увеличение или уменьшение шансов на выживание?» и пр.
Для ответа на соответствующие вопросы необходимо иметь возможность четко определить «время жизни» элемента (период пребывания элемента в совокупности до наступления терминального события). В случае с биологическим выживанием «смерть» однозначна, но в иных случаях наступление терминального события не всегда возможно локализовать в отдельном моменте времени.
В целом анализ выживаемости представляет собой построение моделей, описывающих данные о времени наступления события. Так как живой организм может умереть лишь один раз, то традиционно в рамках данного подхода рассматриваются лишь единичные и единовременные терминальные события.
Цензурирование — это форма проблемы пропущенных данных, при которой время до события не отслеживается по таким причинам, как завершение исследования до того, как все набранные участники продемонстрировали интересующее событие, или когда участник покинул исследование до того, как событие произошло. Цензурирование часто встречается в анализе выживаемости.
Если известна только нижняя граница l для истинного времени события T , при этом T > l , это называется правым цензурированием . Правое цензурирование будет иметь место, например, для тех испытуемых, чья дата рождения известна, но которые еще живы на момент потери данных для последующего наблюдения или окончания исследования. Мы обычно сталкиваемся с данными, цензурированными по правому цензурированию.
Если событие, представляющее интерес, уже произошло до того, как субъект был включен в исследование, но неизвестно, когда оно произошло, то говорят, что данные подвергнуты левой цензуре . [ 24 ] Когда можно только сказать, что событие произошло между двумя наблюдениями или исследованиями, это интервальная цензура .
Левое цензурирование происходит, например, когда постоянный зуб уже прорезался до начала стоматологического исследования, целью которого является оценка распределения его прорезывания. В том же исследовании время прорезывания подвергается интервальному цензурированию, когда постоянный зуб присутствует во рту при текущем осмотре, но еще не присутствует при предыдущем осмотре. Интервальное цензурирование часто встречается в исследованиях ВИЧ/СПИДа. Действительно, время до сероконверсии ВИЧ можно определить только с помощью лабораторного исследования, которое обычно проводится после визита к врачу. В таком случае можно сделать вывод о том, что сероконверсия ВИЧ произошла только между двумя осмотрами. То же самое верно и для диагностики СПИДа, которая основывается на клинических симптомах и должна быть подтверждена медицинским обследованием.
Также может случиться, что субъекты с продолжительностью жизни меньше некоторого порога могут вообще не наблюдаться: это называется усечением . Обратите внимание, что усечение отличается от левого цензурирования, поскольку для левого цензурированного данных мы знаем, что субъект существует, но для усеченного данных мы можем совершенно не знать о субъекте. Усечение также распространено. В так называемом исследовании с отложенным входом субъекты вообще не наблюдаются, пока не достигнут определенного возраста. Например, люди могут не наблюдаться, пока не достигнут возраста поступления в школу. Любые умершие субъекты в дошкольной возрастной группе будут неизвестны. Данные, усеченные слева, распространены в актуарной работе для страхования жизни и пенсий .
Данные с левой цензурой могут возникать, когда время выживания человека становится неполным в левой части периода наблюдения за ним. Например, в эпидемиологическом примере мы можем наблюдать за пациентом на предмет инфекционного заболевания, начиная с момента получения положительного результата теста на инфекцию. Хотя нам может быть известна правая часть интересующей нас продолжительности, мы никогда не узнаем точное время воздействия инфекционного агента.
Анализ данных методами анализа выживаемости может быть осуществлен только для цензурированных данных. Наблюдения называются цензурированными, если интересующая зависимая переменная представляет момент наступления терминального события, а длительность исследования ограничена по времени.
При фиксированном цензурировании выборка из n объектов наблюдается в течение фиксированного времени. Число объектов, для которых наступает терминальное событие, или число смертей, случайно, но общая продолжительность исследования фиксированна. Каждый объект имеет максимально возможный период наблюдения i
, i=1,…,n
, который может варьироваться от одного объекта к другому, однако фиксирован заранее. Вероятность того, что объект i
будет жив в конце своего периода наблюдения, равна S(i)
, а общее число смертей является случайным.
При случайном цензурировании выборка из n объектов наблюдается так долго, сколько необходимо, чтобы d
объектов испытали событие. В этой схеме число смертей d
, которое определяет точность исследования, фиксировано заранее, и его можно использовать в качестве параметра. Недостатком данного подхода является то, что в этом случае общая продолжительность исследования случайна и не может быть точно известна заранее.
При цензурировании можно указать направление, в котором производится цензурирование.
Цензурирование справа имеет место, если исследователь знает, в какой момент эксперимент был начат и что он закончится в момент времени, расположенный справа от точки начала эксперимента.
Если исследователь не имеет информации о том, когда эксперимент был начат (так, например, в биомедицинских исследованиях может быть известно, когда пациент поступил в госпиталь и что он выжил в течение определенного времени, однако при этом может отсутствовать информация, когда симптомы его заболевания впервые проявились), то имеет место левое цензурирование.
Однократное цензурирование происходит в один момент времени (эксперимент заканчивается спустя некоторое фиксированное время). С другой стороны, в биомедицинских исследованиях естественным образом возникает многократное цензурирование, например, когда пациенты выписываются из госпиталя, пройдя курс лечения в различных объемах (или разной продолжительности), и исследователь знает, только что пациент дожил до соответствующего момента цензурирования.
Данные таблицы можно рассматривать как «расширенные» таблицы частот. Область возможных времен наступления критических событий (смертей, отказов и др.) разбивается на некоторое число временных отрезков (моментов времени). Для момента времени вычисляется число и доля объектов, которые в начале рассматриваемого интервала находились в составе элементов изучаемой совокупности (были «живы»), число и долю элементов, которые совокупность покинули («умерли»), а также число и долю элементов, которые были изъяты или цензурированы в каждом интервале.
Анализируемый объект в функции выживания традиционно условно обозначается как S ; он описывается следующей функцией:
где t — это некоторое время, в ходе которого проводилось наблюдение за совокупностью, T является случайной величиной, обозначающей момент «смерти» (покидания объектом совокупности), и
означает вероятность «смерти» в заданном временном интервале. То есть функция выживаемости описывает вероятность «смерти» некоторое время спустя после момента t .
Обычно предполагается, что S(0)=1 , хотя это значение может быть и меньше, чем 1, если есть возможность немедленной смерти или неудачи.
Если u≥t , то функция выживания должна иметь вид S(u)≤S(t) . Это свойство вытекает из того, что условие T>u подразумевает, что T>t . По сути, здесь подразумевается, что выживание для более позднего периода возможно только после выживания в ходе более раннего периода.
Обычно предполагается, что функция выживания стремится к нулю при бесконечном возрастании переменной времени: S(t)→0 при t→∞.
Также при анализе выживаемости используют кумулятивную функцию распределения F(t) и ее производную — функцию плотности распределения f(t) .
Кумулятивная функция распределения имеет вид
F(t)=P(T≤t)=1−S(t)
и описывает вероятность того, что терминальное событие наступило к моменту времени t .
Функция плотности распределения (ФПР) имеет вид
данная функция показывает частоту наступления терминального события в момент времени t .
Это оценка вероятности выбывания из совокупности («смерти») в соответствующем интервале, определяемая таким образом:
где Fi — оценка вероятности отказа в i-м интервале,
— кумулятивная доля выживших объектов (функция выживания) к началу i -го интервала, i
— ширина i
-го интервала.
Функция риска определяется как вероятность того, что элемент, оставшийся в совокупности к началу соответствующего интервала, покинет совокупность («умрет») в течение этого интервала. Оценка функции интенсивности вычисляется следующим образом:
Числитель данного выражения — условная вероятность того, что событие произойдет в интервале , если оно не произошло ранее, а знаменатель — ширина интервала.
Это точка на временной оси, в которой кумулятивная функция выживания равна 0,5. Другие процентили (например, 25- и 75-процентиль или квартили) кумулятивной функции выживания вычисляются по такому же принципу.
Модели выживаемости могут быть содержательно представлены в виде моделей линейной регрессии, поскольку все из перечисленных выше семейств распределений могут быть сведены к линейным с помощью подходящих преобразований. В данном случае время жизни будет являться зависимой переменной.
Зная параметрическое семейство распределений, можно вычислить функцию правдоподобия по имеющимся данным и найти ее максимум. Такие оценки называются оценками максимального правдоподобия. При весьма общих предположениях эти оценки совпадают с оценками наименьших квадратов. Аналогичным образом находится максимум функции правдоподобия при нулевой гипотезе, то есть для модели, допускающей различные интенсивности на разных интервалах. Сформулированная гипотеза может быть проверена, например, с помощью критерия отношения правдоподобия, статистика которого имеет асимптотическое распределение хи-квадрат.
В общем случае таблица времен жизни дает хорошее представление о распределении отказов или смертей объектов во времени. Однако для прогноза часто необходимо знать форму рассматриваемой функции выживания.
В рамках анализа выживаемости для построения моделей наиболее часто используются следующие семейства распределений:
Для цензурированных, но несгруппированных наблюдений времен жизни функцию выживания можно оценить непосредственно (без таблицы времени жизни). Допустим, существует база данных, в которой каждое наблюдение содержит точно один временной интервал. Перемножая вероятности выживания в каждом интервале, получим следующую формулу для функции выживания:
В этом выражении S(t) — оценка функции выживания, n — общее число событий (времен окончания), j — порядковый (хронологически) номер отдельного события, σ(j)
равно 1, если j
-е событие означает отказ (смерть), и 0, если j -е событие означает потерю наблюдения (цензурирование), означает произведение по всем наблюдениям j , завершившимся к моменту t .
Данная оценка функции выживания, называемая множительной оценкой, впервые была предложена Капланом и Мейером (1958).
Анализ выживаемости используется несколькими способами:
В анализе выживаемости обычно используются следующие термины:
Регрессионная модель Кокса-ПХ является линейной. Она аналогична линейной и логистической регрессии. В частности, эти методы предполагают, что для разделения групп (живые, мертвые) или оценки количественного ответа (времени выживания) достаточно одной линии, кривой, плоскости или поверхности.
В некоторых случаях альтернативные разбиения дают более точную классификацию или количественные оценки. Одним из альтернативных методов являются древовидные модели выживаемости, [ 12 ] [ 13 ] [ 14 ] , включая случайные леса выживаемости. [ 15 ] Древовидные модели выживаемости могут давать более точные прогнозы, чем модели Кокса. Разумной стратегией является рассмотрение обоих типов моделей для заданного набора данных.
В этом примере анализа дерева выживаемости используется пакет R "rpart". [ 16 ] Пример основан на данных 146 пациентов с раком предстательной железы стадии C в наборе данных stagec в rpart. Rpart и пример stagec описаны в работе Аткинсона и Терно (1997), [ 17 ] , которая также распространяется в виде краткого руководства по пакету rpart. [ 16 ]
Переменные на этапах:
Полученное в результате анализа дерево выживания показано на рисунке.

Дерево выживаемости для набора данных о раке предстательной железы
Каждая ветвь дерева указывает на разделение по значению переменной. Например, корень дерева разделяет субъектов с оценкой < 2,5 и субъектов с оценкой 2,5 или выше. Конечные узлы указывают количество субъектов в узле, количество субъектов, у которых произошли события, и относительную частоту событий по сравнению с корнем. В крайнем левом узле значения 1/33 указывают, что у одного из 33 субъектов в узле произошло событие, и относительная частота событий составляет 0,122. В крайнем правом нижнем узле значения 11/15 указывают, что у 11 из 15 субъектов в узле произошло событие, и относительная частота событий составляет 2,7.
Альтернативой построению одного дерева выживаемости является построение множества деревьев выживаемости, каждое из которых строится на основе выборки данных, а затем эти деревья усредняются для прогнозирования выживаемости. [ 15 ] Этот метод лежит в основе моделей случайного леса выживаемости. Анализ случайного леса выживаемости доступен в пакете R "randomForestSRC". [ 18 ]
Пакет randomForestSRC включает в себя пример анализа выживаемости методом случайного леса с использованием набора данных pbc. Эти данные взяты из исследования первичного билиарного цирроза печени (ПБЦ), проведенного в клинике Майо в период с 1974 по 1984 год. В этом примере модель выживаемости методом случайного леса дает более точные прогнозы выживаемости, чем модель Кокса для PH. Ошибки прогнозирования оцениваются методом повторной выборки методом бутстрепа .
Недавние достижения в области глубокого обучения репрезентациям были распространены на оценку выживаемости. Модель DeepSurv [ 19 ] предлагает заменить логарифмически линейную параметризацию модели CoxPH многослойным персептроном. Дальнейшие расширения, такие как Deep Survival Machines [ 20 ] и Deep Cox Mixtures [ 21 ], предполагают использование моделей смесей латентных переменных для моделирования распределения времени до события как смеси параметрических или полупараметрических распределений при совместном обучении представлений входных ковариатов. Методы глубокого обучения показали превосходную производительность, особенно на сложных модальностях входных данных, таких как изображения и клинические временные ряды.
Объектом основного интереса является функция выживания , условно обозначаемая S , которая определяется какС(т)=Пр(Т>т)где t — некоторый момент времени, T — случайная величина, обозначающая время смерти или, в более общем смысле, любое событие, а «Pr» означает вероятность . То есть функция выживания — это вероятность наблюдения события, которое произошло в момент времени, превышающий заданное время t . [ 7 ] Функция выживания также называется функцией выживания или функцией выживаемости в задачах биологического выживания и функцией надежности в задачах механического выживания. [ 22 ] В последнем случае функция надежности обозначается как R ( t ).
Обычно предполагается, что S (0) = 1, хотя оно может быть меньше 1, если существует вероятность немедленной смерти или отказа.
Функция выживания должна быть невозрастающей: S ( u ) ≤ S ( t ), если u ≥ t . Это свойство следует непосредственно из условия, поскольку T > u подразумевает T > t . Это отражает представление о том, что доживание до более позднего возраста возможно только при достижении всех более молодых возрастов. Учитывая это свойство, функция распределения продолжительности жизни и плотность событий ( F и f ниже) четко определены. [ 2 ]
Обычно предполагается, что функция выживания стремится к нулю с неограниченным увеличением возраста (т.е. S ( t ) → 0 при t → ∞), хотя предел может быть больше нуля, если вечная жизнь возможна. Например, мы могли бы применить анализ выживания к смеси стабильных и нестабильных изотопов углерода ; нестабильные изотопы рано или поздно распадутся, но стабильные будут существовать бесконечно.
Соответствующие величины определяются через функцию выживания.
Функция распределения продолжительности жизни , условно обозначаемая F , определяется как дополнение функции выживания,
Если F дифференцируема, то производная, которая является функцией плотности распределения времени жизни, обычно обозначается f .
Функцию f иногда называют плотностью событий ; это скорость возникновения событий смерти или отказа за единицу времени.
Функцию выживания можно выразить через функции распределения вероятностей и плотности вероятности.
Аналогично, функция плотности событий выживания может быть определена как
В других областях, таких как статистическая физика, функция плотности событий выживания известна как плотность времени первого прохождения .
Функция опасности определяется как частота событий в момент временит,
при условии выживания в момент временит.
Синонимы функции опасности в разных областях включают в себя уровень опасности, функцию интенсивности, силу смертности ( демография и актуарная наука , обозначаемаяμ), сила отказа или интенсивность отказа ( инженерная , обозначается
). Например, в актуарной науке,
обозначает уровень смертности среди людей в возрастех
, тогда как в области надежности техники
обозначает скорость отказа компонентов после эксплуатации в течение временит
.
Функция опасности представляет собой вероятность того, что субъект испытает событие в следующем небольшом интервале времени, деленную на длину этого интервала, при условии, что он выжил к этому моменту времени. . Об этом говорит сайт https://intellect.icu . Формально это можно записать следующим образом:
где теорема Байеса и идентификация В качестве функции выживания использовалась в первом равенстве, а определение функции плотности распределения времени жизни — во втором.
Любая функциячасявляется функцией опасности тогда и только тогда, когда она удовлетворяет следующим свойствам:
Фактически, показатель риска обычно более информативен относительно основного механизма отказа, чем другие представления распределения срока службы.
Функция опасности должна быть неотрицательной, , и его интеграл по[0,∞]
Должна быть бесконечной, но не иметь иных ограничений; она может быть возрастающей или убывающей, немонотонной или прерывистой. Примером служит функция опасности типа «ванна» , которая велика при малых значенияхт
, уменьшаясь до некоторого минимума, а затем снова увеличиваясь; это может моделировать свойство некоторых механических систем либо выходить из строя вскоре после эксплуатации, либо гораздо позже, по мере старения системы.
Функцию опасности можно альтернативно представить в виде кумулятивной функции опасности , условно обозначаемойΛилиЧАС
:
поэтому перестановка знаков и возведение в степень
или дифференцирование (с цепным правилом)
Название «кумулятивная функция опасности» происходит от того факта, что
что представляет собой «накопление» опасности с течением времени.
Из определения , мы видим, что он неограниченно возрастает, когда t стремится к бесконечности (предполагая, что
(стремится к нулю). Это означает, чтоλ
Не следует уменьшать слишком быстро, поскольку, по определению, кумулятивный риск должен расходиться. Например,
не является функцией риска какого-либо распределения выживаемости, поскольку ее интеграл сходится к 1.
Функция выживания ), кумулятивная функция опасности
, плотность
, функция опасности
, и функция распределения времени жизни
связаны через
Будущая жизнь в данный момент временит0время, оставшееся до смерти, учитывая дожитие до старостит0
. Таким образом, этоТ−т0
В настоящей нотации. Ожидаемая будущая продолжительность жизни — это ожидаемое значение будущей продолжительности жизни. Вероятность смерти в возрасте или до достижения возрастат0+т
, учитывая дожитие до возрастат0
, это просто
Следовательно, плотность вероятности будущей жизни равна
и ожидаемая будущая продолжительность жизни составляет
где второе выражение получено с помощью интегрирования по частям .
Дл , то есть при рождении это уменьшается до ожидаемой продолжительности жизни.
В задачах надежности ожидаемый срок службы называется средним временем до отказа , а ожидаемый будущий срок службы называется средним остаточным сроком службы .
Поскольку вероятность дожития особи до возраста t или дольше по определению равна S ( t ), ожидаемое число выживших в возрасте t из исходной популяции из n новорожденных равно n × S ( t ), предполагая одинаковую функцию выживания для всех особей. Таким образом, ожидаемая доля выживших равна S ( t ). Если выживаемость разных особей независима, число выживших в возрасте t имеет биномиальное распределение с параметрами n и S ( t ), а дисперсия доли выживших равна S ( t ) × (1 - S ( t ))/ n .
Возраст, в котором останется определенная доля выживших, можно определить, решив уравнение S ( t ) = q относительно t , где q — рассматриваемый квантиль . Обычно интерес представляет медианная продолжительность жизни , для которой q = 1/2, или другие квантили, например, q = 0,90 или q = 0,99.
Исследование, описанное в статье про анализ выживаемости, подчеркивает ее значимость в современном мире. Надеюсь, что теперь ты понял что такое анализ выживаемости, цензурирование и для чего все это нужно, а если не понял, или есть замечания, то не стесняйся, пиши или спрашивай в комментариях, с удовольствием отвечу. Для того чтобы глубже понять настоятельно рекомендую изучить всю информацию из категории Теория вероятностей. Математическая статистика и Стохастический анализ
Ответы на вопросы для самопроверки пишите в комментариях, мы проверим, или же задавайте свой вопрос по данной теме.
Комментарии