SSA post-analysis of COVID-19 incidence magnitude in Novosibirsk Region

Cover Page


Cite item

Full Text

Abstract

The article is aimed at conducting post-analysis of COVID-19 epidemiological data in Novosibirsk for the period from 2020 to 2023. The study emphasizes the importance of data post-analysis for understanding the dynamics of SARS-CoV-2 spread and the characteristics of its impact on public health. The study results make possible to assess of how population susceptibility to different virus strains has changed, what is the difference between an outbreak of diseases associated with the emergence of a new virus strain and its seasonal infection spread. There was applied the SSA method for analyzing time series to separate them into components as well as studying key indicators such as the number of new infections, deaths, critical cases, hospitalizations, and ventilator-dependent patients in the Novosibirsk region. Three main components have been identified for the described data sets: a general trend that reflects changes in the rate of virus spread related to spread of new strains, as well as periodic phenomena associated with virus strains and seasonality. The results show that a significant part of the changes in disease dynamics is accounted for by the emergence of new strains, but also due to «chronicity» epidemic with seasonal fluctuations. The observed relationships and time lags between the number of critically-ill patients and the number of recorded deaths due to COVID-19, as well as between the number of hospitalized patients and ventilator-dependent patients are shown. Thus, it is concluded that the identified trend depicting a change between the number of infected people and development of virus strains can be useful for refining the parameters of mathematical models for COVID-19 spread. The SEIR-HCD differential model, which was previously used to simulate the disease spread in the Novosibirsk region, was chosen as an illustrative example. It is shown that the parameter of the virus spread rate, restored through the selected trend, when introduced into the model, provides a smaller modeling error than the if it was generated using the solution of the inverse issue.

Full Text

Введение

Пандемия COVID-19 стала одной из самых значительных глобальных угроз здравоохранению в XXI веке, оказала глубокое влияние на все аспекты жизни общества, экономику и системы здравоохранения. Поиск эффективных мер по контролю и предотвращению распространения новых вирусов требует адекватной оценки прошедшей пандемии и постанализа эпидемиологических данных по распространению вируса, его клинических характеристик и последствий для здоровья населения.

Вместе с тем работ по анализу реальных данных по пандемии COVID-19 значительно меньше, чем по разработке моделей, прогнозирующих развитие эпидемии. В статье [28] авторы провели всесторонний обзор открытых наборов данных по COVID-19. Обзор обобщал типы данных и область их применения. Авторы показали, что основным видом открытых данных были медицинские изображения, текстовые и речевые данные (записи кашля). В работе [24] проведен анализ наборов данных по распространению COVID-19 в Индии с помощью методов машинного обучения для понимания того, какая возрастная группа больше всего пострадала из-за вируса. В работе [18] авторы исследовали клинические данные и продемонстрировали использование моделей машинного обучения для прогнозирования наличия COVID-19 у пациента. В частности, через анализ клинических данных авторы успешно дифференцировали пациентов с COVID-19 от пациентов с гриппом типа A. Авторы статьи [9] на основе официальных данных по заболеваемости делают обзор и сравнительный анализ развития эпидемиологической ситуации и политики ответных мер во Франции, Бельгии и Канаде на ранних стадиях пандемии. В статье [12] авторами приводится анализ временной динамики вспышки коронавирусной инфекции за первые 3 месяца 2020 г. в Китае, Италии и Франции. Анализ показывает, что кинетический параметр, описывающий скорость выздоровления, по-видимому, одинаков независимо от страны, в то время как показатели инфицирования и смертности более зависимы от региона. Отметим без детального описания еще несколько работ [7, 8, 31], в которых ключевая роль также отведена анализу эпидемиологических данных. Как показывает литературный обзор, превалирующая часть работ, посвященная анализу данных, описывающих эпидемиологическую ситуацию, написана и посвящена описанию первого начального этапа развития эпидемии (2020 г.). Работы по постанализу данных фактически отсутствуют. В большинстве это работы, связанные с анализом текстовых сообщений в социальной сети Twitter для оценки социальных настроений общества во время процесса вакцинации [25]; экономических последствий пандемии [30]; наличия коллективного иммунитета в Австрии [27]. Постанализа данных о многолетней динамики вируса SARS-CoV-2 автором найдено не было. Вместе с тем результат такого анализа может дать ответы на некоторые актуальные вопросы, например:

  • как менялась восприимчивость населения к разным штаммам вируса?
  • как отличить новый штамм вируса от сезонного распространения инфекции?
  • каковы ключевые тренды, паттерны и корреляции, которые могут быть использованы для прогнозирования будущих вспышек и оценки эффективности внедренных мер общественного здравоохранения?

Данная работа посвящена ответу на предложенные выше вопросы на примере SSA-анализа наблюдений за распространением коронавирусной инфекции в Новосибирской области (Россия) в период с 2020 по 2022 г.

Материалы и методы

Описание используемого для анализа набора данных. Для анализа были выбраны наблюдения за динамикой COVID-19 в Новосибирской области (Россия). Данные доступны онлайн и могут быть найдены по ссылке https://ai-biolab.ru/data/En. Помимо данных по Новосибирской области, по ссылке также доступны данные по заболеваемости в Москве, Санкт-Петербургу, Омске и Республике Алтай (Россия). Данные по Новосибирской области были выбраны для анализа, поскольку они являются наиболее полными. Описание датасета представлено в таблице.

 

Таблица. Описание полей анализируемых данных, доступных по ссылке https://ai-biolab.ru/data/En

Table. Description of the analyzed data, available at the link https://ai-biolab.ru/data/En

Имя поля

Feature

Описание

Description

date

- текущая дата в формате YYYY-MM-DD

- current date in YYYY-MM-DD format

new_diagnoses

- количество новых выявленных случаев заражения коронавирусом

- the number of newly identified cases of coronavirus infection

cum_diagnoses_article

- официальное общее число выявленных случаев заражения коронавирусом за все время пандемии

- the official total number of identified cases of coronavirus infection throughout the pandemic

cum_diagnoses

- общее число выявленных случаев заражения коронавирусом в регионе за все время пандемии

- the total number of detected cases of coronavirus infection in the region during the entire pandemic

new_recoveries

- количество новых случаев выздоровления человек с начала пандемии

- the number of new cases of recovery people since the beginning of the pandemic

cum_recoveries

- всего выздоровевших человек с начала пандемии

- total number of recovered people

new_deaths

- количество новых смертей от коронавируса

- number of new deaths from coronavirus

cum_deaths

- всего умерших от коронавируса с начала пандемии

- total deaths number

cum_tests

- всего проведенных тестов на коронавирус в регионе

- total number of coronavirus tests carried out in the region

new_tests

- количество новых проведенных тестов на коронавирус в регионе

- number of new coronavirus tests conducted in the region

adults

- текущее количество взрослых пациентов с диагнозом COVID-19 и с подозрением на него в инфекционных стационарах

- the current number of adult patients diagnosed with COVID-19 and suspected of having it in infectious disease hospitals

cum_children

- всего зафиксировано случаев заражения коронавирусом у детей с начала пандемии

- total number of cases of coronavirus infection in children recorded since the start of the pandemic

new_children

- новое количество инфицированных детей

- new number of infected children

cur_children

- текущее число госпитализированых детей с подозрением на коронавирус и подтвержденным диагнозом

- the current number of children hospitalized with suspected and confirmed coronavirus

n_critical

- текущее количество человек, находящихся в отделениях реанимации

- the current number of people in intensive care units

ventilation

- текущее количество человек, находящихся под аппаратом ИВЛ

- current number of people on ventilators

hospitalised

- текущее количество госпитализированных человек

- current number of hospitalized people

1vac

- текущее количество человек, получивших одну дозу вакцины «Спутник-V»

- the current number of people who have received one dose of the “Sputnik-V” vaccine

2vac

- текущее количество человек, получивших две дозы вакцины «Спутник-V»

- the current number of people who have received two doses of the “Sputnik-V” vaccine

positive_percent

- доля инфицированных, имеющая антитела IgG к SARS-CoV-2

- proportion of infected people with IgG antibodies to SARS-CoV-2

yandex_index

- индекс самоизоляции (от компании Yandex)

- self-isolation index (proposed by Yandex)

asympt_percent

- текущий процент бессимптомных выявленных случаев

- current percentage of asymptomatic cases detected

 

Для анализа были выбраны следующие поля: new_diagnoses, new_deaths, n_critical, hospitalised, ventilation, поскольку эти поля являются ключевыми для описания динамики распространения SARS-CoV-2 в рассматриваемом регионе.

Метод анализа сингулярного спектра (Singular Spectrum Analysis). Метод Singular Spectrum Analysis (SSA), также известный как «метод гусеницы», представляет собой мощный инструмент для анализа, декомпозиции и прогнозирования временных рядов числовых измерений [10, 13]. Этот метод был разработан в 1980-х гг. и с тех пор получил широкое признание в различных областях, таких как экономика, метеорология, медицина и многие другие. Временным рядом здесь называется последовательность наблюдений за динамической системой.

Принцип работы метода SSA основывается на разложении временного ряда на набор компонент: различные виды трендов, сезонностей, циклов и случайных колебаний. При этом каждая компонента ассоциирована с вкладом сингулярного числа траекторной матрицы ряда и его векторов. Так, будем рассматривать временной ряд Xt = (x1,...,xN) длины N, такой что xi,i{1,...,N}. Метод сингулярного анализа заключается в реализации нескольких шагов.

Шаг 1. Построение траекторной матрицы. Пусть L (1 < L < N) — некоторое целое число (выбираемое пользователем), называемое длиной окна, и K = NL + 1. Траекторной матрицей ряда Xt будем называть

X=x1x2x3xKx2x3x4xK+1x3x4x5xK+2xLxL+1xL+2xN,

где матрица X является ганкелевой размерностью L × K.

Шаг 2. Сингулярное разложение траекторной матрицы. Далее для траекторной матрицы получают сингулярное разложение, позволяющее оценить собственные значения и собственные векторы матрицы X. Пусть d = rank(X). Тогда X представимо в виде суммы элементарных матриц:

X=i=1dλiUiViT=i=1dXi.

Здесь Ui, i = 0,...,d – 1 и Vi, i = 0,...,d – 1 — левые и правые сингулярные вектора, которые по свойству SVD составляют ортонормированные базисы пространства строк и пространства столбцов матрицы X, соответствующие упорядоченным по убыванию собственным числам li, i = 0,...,d – 1 матрицы S = XXT. Матрицы Xi называют элементарными.

Шаг 3. Группировка элементарных матриц. Далее элементарные матрицы с похожими свойствами могут быть сгруппированы. Множество всех индексов {0,...,d – 1} разбивается на m непересекающихся подмножеств I1,...,Im. Пусть I = {i1,...,ip}, тогда результирующая матрица XI, соответствующая группе I, определяется как XI = Xi1 +...+ Xip. Тогда траекторная матрица X представляется в виде суммы сгруппированных матриц X = XI1 +...+ XIm.

Шаг 4. Диагональное усреднение. Далее каждую сгруппированную матрицу XI1 необходимо развернуть обратно во временной ряд. Для этого каждая матрица XIj сгруппированного разложения ганкелизуется и затем полученная ганкелева матрица трансформируется в новый временной ряд длины N. Диагональное усреднение, примененное к каждой результирующей матрице XIi, производит восстановленные ряды X~t(k)=(x~1(k),,x~N(k)), k = 1,...,m. Таким образом, исходный ряд Xt раскладывается в сумму m восстановленных рядов:

Xt=k=1mX~t(k).

(1)

Разложение (1) является главным результатом алгоритма SSA, поскольку каждая результирующая компонента X~t(k) соотносится с набором собственных значений траекторной матрицы исходного ряда и может быть интерпретируема либо как тренд, либо как колебания (периодики), либо как шум. Метод SSA обладает рядом преимуществ для анализа временных рядов. Во-первых, метод не требователен к структуре ряда, не требователен к предположению распределения данных, применим к нестационарным временным рядам. Во-вторых, компоненты, полученные в результате анализа, легко интерпретируются в рамках исследуемых данных и визуализируются. В-третьих, метод достаточно устойчив к шуму в данных. К недостаткам метода относят сложность выбора гиперпараметров метода: выбор размера окна L для формирования траекторной матрицы и количества ключевых компонент ряда может быть затруднительным, зависит, в большей степени, от субъективного мнения исследователя и требует адаптации под конкретные данные. Другой сложностью является выбор набора элементарных матриц, которые могут быть сгруппированы на шаге 3. Этот выбор также определяется исследователем.

Различные модификации метода используются для заполнения пропусков в данных [32], поиска разладок [2] и прогнозирования [29]. Можно найти большое число работ по прогнозированию развития пандемии COVID-19 с использованием метода SSA в период начала развития эпидемии (см., например, работы [3, 14]). Работ по постанализу данных известно не много. Например, в работе [20] проведены исследования причинно-следственных связей между изменениями погоды и распространением COVID-19 через показатели мобильности населения (несоблюдение изоляции), в том числе с помощью SSA-анализа. Хотелось бы отметить еще работу [11], где проведен анализ многомерных, многомасштабных клинических данных и лабораторных результатов для классификации клинических фенотипов.

Результаты применения метода SSA к имеющимся данным

Данные по числу новых детектированных инфицированных

Сначала представим результаты постанализа для данных по числу новых выявленных случаев заражения коронавирусом (поле new_diagnoses в датасете). На рис. 1 представлен вклад i-той элементарной матрицы этого ряда, ассоциированной с i-тым сингулярным числом траекторной матрицы, отсортированным в порядке убывания. Из рисунка видно, что максимальное собственное число вносит четверть вклада в последовательность данных, а первые 10 элементарных матриц объясняют 80% траекторной матрицы ряда.

 

Рисунок 1. Процент объяснительной возможности первых 30-ти элементарных матриц для траекторной для числа новых детектированных инфицированных

Figure 1. Percentage of explanatory power of the first 30 elementary matrices for the trajectory for the number of newly detected infected

 

Элементарные матрицы были сгруппированы по принципу совпадения частот соответствующих им элементарных рядов. На рис. 2 изображены выделенные методом SSA основные компоненты из временного ряда по числу новых заболевших коронавирусом в г. Новосибирске за период с 2020 по 2023 г. Так, нулевая компонента была выделена в отдельный ряд, представляющий собой общий тренд развития заболеваемости с течением пандемии. Этот тренд, соответствующий изменению скорости распространения вируса при переходе от одного штамма вируса к другому, на рисунке представлен синей линией. Первая, вторая и третья компоненты были объединены и развернуты в один ряд, который соответствует периодам повышения количества случаев обнаружения заболевания, ассоциированным с появлением нового штамма (оранжевая линия). Отметим, что полученные периоды повышения по датам совпадают с официально зарегистрированным появлением штаммов Whuhan, Delta, Omicron, Deltacron. Оставшиеся с 4-й по 10-ю компоненты также были объединены в один ряд. Так были выбраны периоды повышения количества случаев обнаружения заболевания, не связанные со штаммами. Такие периоды могут быть ассоциированы с сезонностью заболеваемости и ее хроническим течением (зеленая линия). Отметим, что последний выделенный ряд имеет периодичность в пределах 3-х месяцев. Выделенные ряды объясняют 80% ряда. Остальные компоненты классифицированы как шум.

 

Рисунок 2. SSA-анализ временного ряда по числу новых заболевших коронавирусом в г. Новосибирске за период с 2020 по 2023 гг.

Figure 2. Caption: SSA analysis of time series of new coronavirus cases in Novosibirsk for the period from 2020 to 2023

 

Данные по числу новых умерших и людей в критическом состоянии

Сходный анализ был выполнен для данных по числу людей, умерших от коронавируса (new_deaths) или находящихся в критическом состоянии (n_critical). На рис. 3 и 4 представлены вклады элементарных матриц, ассоциированных с сингулярными числами траекторных матриц для умерших и больных в критическом состоянии соответственно. Из рисунков видно, что максимальные сингулярные числа для таких рядов вносят превалирующий вклад (92% для умерших, 82% для больных в критическом состоянии). Это может быть объяснено тем, что изменение в уровне смертности (и числа больных в критическом состоянии) в основном объясняется сменой штамма вируса и развитием качества медицинской помощи и профилактических мер на протяжении борьбы с эпидемией, а не с сезонными вспышками.

 

Рисунок 3. Процент объяснительной возможности первых 10-ти элементарных матриц для траекторной для числа новых детектированных умерших от коронавируса

Figure 3. Percentage of explanatory power of the first 10 elementary matrices for the trajectory for the number of newly detected deaths from coronavirus

 

Рисунок 4. Процент объяснительной возможности первых 10-ти элементарных матриц для траекторной для числа новых детектированных больных в критическом состоянии

Figure 4. Percentage of explanatory power of the first 10 elementary matrices for the trajectory for the number of newly detected critically ill patients

 

Таким образом, из данных было выделено по две компоненты — тренд, соответствующий нулевой элементарной матрице, и периодическая компонента, объединяющая с 1 по 6 элементарные матрицы. Выделенные компоненты согласно рис. 3, 4 объясняют более 97% исходных временных рядов. На рис. 5 предложено сравнение нормированных в пределах от [0, 1] выделенных трендов и периодик для обоих рядов. Из рис. 5 видно, что для обоих временных рядов тренды идентичны, что может указывать на их линейную зависимость. Периодичность числа критических случаев в целом совпадает с периодами повышения заболеваемости, обозначенными на рис. 2 как хроническое течение болезни. Пики повышения уровня умерших смещены относительно критических в пределах 1–3 недель для разных штаммов.

 

Рисунок 5. Сравнение выделенных трендовых и сезонных компонент для числа больных в критическом состоянии и умерших больных

Figure 5. Comparison of the obtained trend and seasonal components for the number of critical and deceased patients

 

Данные по числу госпитализированных и пациентов, находящихся на ИВЛ

И, наконец, анализ был выполнен для людей, поступивших на госпитализацию (hospitalised) и находящихся на искусственной вентиляции легких (ventilation) (ИВЛ). Для экономии текста мы не приводим здесь вклад сингулярных чисел (и ассоциированных с ними элементарных матриц) для текущих рядов. Вклад максимальных собственных чисел относительно общего разложения для рядов госпитализированных людей и пациентов, находящихся на ИВЛ, составляет 75 и 73% соответственно. Вклад каждого следующего по модулю сингулярного числа составляет менее 5%. Первые 10 максимальных по модулю сингулярных чисел (и ассоциированных с ними элементарных матриц) объясняют более 95% траекторной матрицы исходного ряда.

Как и в предыдущем случае, трендовые компоненты (см. рис. 6) обоих рядов имеют одинаковое поведение. Пики периодических компонент совпадают между собой для двух исследуемых рядов для вспышки, ассоциированной со штаммом Delta, для остальных имеют смещение в пределах 3-х недель. То есть после пика повышения числа госпитализированных в течение 3-х недель будет наблюдаться пиковая потребность в аппаратах ИВЛ. Возникновение пиков в периодических компонентах совпадает со вспышками, определенными как «сезонные» (ассоциированные с хроническим течением болезни) на рис. 2.

 

Рисунок 6. Сравнение выделенных трендовых и периодических компонент для числа госпитализированных больных и больных, находящихся на ИВЛ

Figure 6. Comparison of the obtained trend and periodic components for the number of hospitalized patients and patients on mechanical ventilation

 

Оценка восприимчивости населения к разным штаммам вируса SARS-CoV-2 с помощью инструментов математического моделирования

Для моделирования динамики распространения коронавируса в период 2020–2022 гг. разрабатывалось большое число математических моделей. В данной работе не будет приводиться детальное описание разных разработанных подходов — существует большое число обзорных работ, описывающих преимущества и недостатки разных моделей. Отметим лишь обзорную работу 2022 г. [1], освещающую развитие области в период быстрого распространения эпидемии, и работу 2024 г. [6], проделанную после завершения пандемии. В большинстве разработанных для прогнозирования распространения COVID-19 моделей лежит принцип SIR-динамики, предложенный еще Кермаком и МакКендриком в 1920-х гг. [15], где популяция разбивается на несколько эпидемиологических групп (в оригинальных работах на три группы: S — неиммунные, I — инфицированные, R — иммунные) и передача вируса определяется через взаимодействие этих групп между собой и набором параметров, описывающих характер распространения вируса (скорость инфицирования, контактное число, скорость выздоровления и т. д.). На основе такого принципа моделирования было разработано большое число более сложных моделей, например, в форме систем обыкновенных дифференциальных уравнений [26], уравнений в частных производных [22], моделей оптимального управления [5] и агентно-ориентированных моделей [4]. Основой для качества такого типа моделирования является правильное определение параметров, определяющих распространение вируса. В работе [17, 19] было показано, что наиболее чувствительным параметром, влияющим на результаты моделирования, является параметр скорости распространения вируса. Вместе с тем определение этого параметра является сложной задачей, поскольку сам параметр включает в себя заразность вируса, среднее число контактов заболевшего с неинфицированной частью населения, информацию о соблюдении изоляции и противовирусных мер и т. д. В математическом моделировании для определения этого параметра используются постановки обратных задач относительно реальных данных по числу инфицированных [17].

На основе анализируемых данных для описания распространения вируса SARS-CoV-2 в г. Новосибирске была предложена дифференциальная модель SEIR-HCD [16]. Наличие большого числа измеряемых показателей по распространению пандемии совместно с эпидемиологами позволило разработать сложную математическую модель, позволяющую учесть многие аспекты исследуемого вируса. Модель представляется в виде системы дифференциальных уравнений вида

dS/dt=(5a)αIS(t)I(t)+αES(t)E(t)/5+ωimmR(t),dE/dt=(5a)αIS(t)I(t)+αES(t)E(t)/5ωincE(t),dI/dt=ωincE(t)ωinfI(t),dR/dt=βωinfI(t)+(1εHC)ωhospH(t)ωimmR(t),dH/dt=(1β)ωinfI(t)+1μωcritC(t)ωhospH(t),dC/dt=εHCωhospH(t)ωcritC(t),dD/dt=μωcritC(t)

(2)

с известными начальными условиями

S(0) = S0, E(0) = E0, I(0) = I0, R(0) = R0,

H(0) = H0, C(0) = C0, D(0) = D0.

(3)

Здесь популяция разделена на 7 групп: восприимчивые к заболеванию (S), подвергшиеся воздействию или бессимптомные (E), инфицированные или имеющие симптомы (I), иммунные или выздоровевшие (R), госпитализированные (H), больные в критическом состоянии (C) и умершие (D). В каждый момент времени S(t)+E(t)+I(t)+R(t)+H(t)+C(t)+D(t) = 1, где 1 означает всю популяцию. Параметры a,aI, aE,winc,winf,b,eHC,whosp,wimm,m,wcritR, называются эпидемиологическими параметрами и описывают распространение вируса. Здесь a — индекс самоизоляции; aE,aI — параметры заразности вируса в пределах эпидемиологических групп E и I; b — доля инфицированных без осложнений; m — смертность; eHC — доля критических случаев от числа госпитализированных; winc,winf,whosp,wimm,m,wcrit — обратные величины среднему числу дней (winc) от контакта до заражения, (winf) продолжительности симптоматического периода, (whosp) развития тяжелых случаев в критические, (wcrit) критического состояния, (wimm) поддержания иммунитета. Область изменения параметров для пандемии COVID-19 и их более подробное описание предложены в [23]. Данная модель была успешно использована для прогнозирования развития COVID-19 в г. Новосибирске и Москве [16]. Модель хорошо исследована [17] и на ее основе предлагались модели оптимального управления [21] и модели среднего поля [23].

Для Новосибирской области параметры модели (2), (3) были восстановлены с помощью решения обратной задачи по данным. Метод восстановления параметров описан в работе [16]. Данные по количеству людей в каждой эпидемиологической группе S, E, I, R, H, C, D были получены из исследуемых в первой части работы данных и представлены в файле по ссылке https://disk.yandex.ru/i/vCTMirdmeGgJwQ. Восстановленные параметры модели (2), (3) могут быть найдены там же.

Скорость передачи вируса здесь определяется совокупностью параметров aI (5 – a)/5. Напомним, что параметр a здесь является индексом самоизоляции, рассчитываемым во время пандемии компанией Yandex и изменяющимся от 0 до 5, а значения параметра aI восстанавливались с помощью решения обратной задачи. Вместе с тем динамика скорости передачи вируса со сменой разных штаммов определяется трендом, выделенным по числу новых заболевших и отображенным на рис. 2 (синяя линия). Скорость, с которой динамика передачи вируса развивается, представляет собой первую разность от выделенного тренда и должна отображать динамику изменения скорости передачи вируса. На рис. 7 синей линией изображен нормированный ряд первой разности от выделенного тренда изменения числа инфицированных (см. рис. 2 (синяя линия)). Эти значения сравниваются с нормированным рядом значений параметра скорости передачи вируса aI (5 – a)/5.

 

Рисунок 7. Сравнение восстановленной по данным через решение обратной задачи для модели (2), (3) совокупности параметров aI (5 – a)/5 (скорость передачи вируса, черная линия) и первой разности для ряда, отображающего тренд изменения количества инфицированных в зависимости от развития штамма (синяя линия)

Figure 7. Comparison of the parameter aI (5 – a)/5 (virus transmission rate, black line) reconstructed from the data by solving the inverse problem for model (2), (3) and the first difference for a series displaying the trend in the number of infected people depending on the development of the strain (blue line)

 

Из рис. 7 видно, что по данным детектированных инфицированных рост скорости распространения вируса начался сильно раньше, чем это улавливает обратная задача. Покажем, что динамика, полученная по данным (синяя линия из рис. 7) лучше отображает распространения вируса, чем параметры, восстановленные с помощью обратной задачи (черная линия из рис. 7). Положим, что динамика изменения параметра aI (5 – a)/5 определяется согласно синей линии из рис. 7 и подставим новые полученные значения в модель (2), (3). На рис. 8 приведено сравнение результатов моделирования реальных данных по количеству населения в эпидемиологической группе инфицированных (I) (оранжевая линия), данных, приближенных с помощью модели (2), (3) и динамикой распространения вируса, определяемой через решение обратной задачи (черная линия), и данных, приближенных с помощью модели (2), (3) и динамикой распространения вируса, определяемой через выделенный методом SSA тренд инфицирования населения (зеленая линия). Результаты представлены только для короткого 100-дневного периода, поскольку визуальное различие кривых на всем двухлетнем промежутке нивелируется отличием в масштабе пиковых значений, присущих различным штаммам. Средняя квадратичная разница на всем промежутке между кривой с реальными данными и кривой, посчитанной как решение модели (2), (3) с восстановленными через решение обратной задачи параметрами — 28,96 (в количестве человек). Средняя квадратичная разница на всем промежутке между кривой с реальными данными и кривой, посчитанной как решение модели (2), (3) с восстановленными через SSA-анализ — 22,86 (в количестве человек).

 

Рисунок 8. Сравнение реальных данных по числу инфицированных с результатами моделирования динамики распространения вируса по модели (2), (3), где скорость распространения вируса восстановлена по тренду, выделенному методом SSA (зеленая линия), или через решение обратной задачи (черная линия)

Figure 8. Comparison of real data on the number of infected with the results of modeling the dynamics of the spread of the virus using model (2), (3), where the rate of spread of the virus is reconstructed by the trend identified by the SSA method (green line), or by solving the inverse problem (black line)

 

Выводы

В работе предложен постанализ данных о наблюдениях за динамикой вируса SARS-CoV-2 в г. Новосибирске за период с 2020 по 2023 гг. Анализ данных проводился с помощью метода SSA. Преимущество такого подхода состоит в том, что метод позволяет разбить исследуемый исходный временной ряд на сумму составляющих временных рядов, каждый из которых ассоциирован с некоторым набором сингулярных чисел траекторной матрицы, построенной из элементов исходного временного ряда. Такой подход позволяет строить декомпозицию временного ряда на составляющие: тренды, сезонности, циклы. Метод был применен к данным по числу ежедневно выявляемых случаев заболеваемости COVID-19, числу больных в критическом состоянии, новым случаям смерти от инфекции и числу госпитализированных за промежуток времени с 2020 по 2022 г.

Были получены следующие результаты. Во-первых, метод позволил отделить периоды распространения эпидемии, ассоциированные с появлением нового штамма, от сезонного распространения инфекции. Показано, что вклад изменения штамма вируса в рост (или спад) числа новых случаев заболеваемости в 2020–2022 гг. составлял всего порядка 50%, а оставшиеся случаи приходились на «фоновое» распространение вируса с небольшими сезонными вспышками. Во-вторых, выделен тренд, который соответствовал изменению скорости распространения вируса от перехода от одного штамма вируса к другому. Выдвинута гипотеза, что выделенный тренд может быть использован для уточнения параметра контагиозности вируса, используемого в эпидемиологических моделях, которая была подтверждена на примере использования дифференциальной модели SEIR-HCD. Показан наблюдаемый временной лаг между госпитализацией человека и развитием у него критического состояния.

×

About the authors

Viktoriya S. Petrakova

Institute of Computational Modeling SB RAS; Sobolev Institute of Mathematics SB RAS

Author for correspondence.
Email: vika-svetlakova@yandex.ru
ORCID iD: 0000-0003-1126-2148

PhD (Physics and Mathematics), Senior Researcher, Researcher

Russian Federation, Krasnoyarsk; Novosibirsk

References

  1. Afzal A., Tanveer M., Rehman A., Abbas S., Ali F. Merits and limitations of mathematical modeling and computational simulations in mitigation of COVID19 pandemic: a comprehensive review. Arch. Comput. Methods Eng., 2022, vol. 29, no. 2, pp. 1311–1337. doi: 10.1007/s11831-021-09634-2
  2. Alanqary A., Alomar A., Shah D. Change point detection via multivariate singular spectrum analysis. Adv. Neural Inf. Process. Syst., 2021, vol. 34, pp. 23218–23230.
  3. Alharbi N. Forecasting the COVID-19 Pandemic in Saudi Arabia using a modified singular spectrum analysis approach: model development and data analysis. JMIR X Med., 2021, vol. 2, no. 1: e21044.
  4. Alsaeed N.I., Eman Y., Muazzam A. An Agent-based Simulation of the SIRD model of COVID19 Spread. Int. J. Biol. Biomed. Eng., 2020, vol. 14, pp. 210–217. doi: 10.46300/91011.2020.14.28
  5. Balderrama R., Prieto-Castrillo F., Abramson G. Optimal control for a SIR epidemic model with limited quarantine. Sci. Rep., 2022, vol. 12, no. 1: 12583. doi: 10.1038/s41598-022-16619-z
  6. Cao L., Qing L. COVID-19 modeling: A review. ACM Comput. Surv., 2024, vol. 57, no. 1, pp. 1–42. doi: 10.1145/3686150
  7. Chu J. A statistical analysis of the novel coronavirus (COVID-19) in Italy and Spain. PLoS One, 2021, vol. 16, no. 3: e0249037. doi: 10.1371/journal.pone.0249037
  8. De Souza F.S.H., Hojo-Souza N.S., Öztürk D.B., Terceiro I.M., Kakehasi A.M. On the analysis of mortality risk factors for hospitalized COVID-19 patients: A data-driven study using the major Brazilian database. PLoS One, 2021, vol. 16, no. 3: e0248580. doi: 10.1371/journal.pone.0248580
  9. Desson Z., Weller E., McMeekin P., Ammi M. An analysis of the policy responses to the COVID-19 pandemic in France, Belgium, and Canada. Health Policy Technol., 2020, vol. 9, no. 4, pp. 430–446. doi: 10.1016/j.hlpt.2020.09.002
  10. Elsner J.B., Tsonis A.A. Singular spectrum analysis: a new tool in time series analysis. Springer Science & Business Media, 2013.
  11. Er A.G., Demiray C., Özdemir M., Oğuz M., Eroğlu A., Çoban G., Eroğlu Z. Multimodal data fusion using sparse canonical correlation analysis and cooperative learning: a COVID-19 cohort study. NPJ Digit. Med., 2024, vol. 7, no. 1: 117. doi: 10.1038/s41746-024-01128-2
  12. Fanelli D., Piazza F. Analysis and forecast of COVID19 spreading in China, Italy and France. Chaos Solitons Fractals, 2020, vol. 134: 109761. doi: 10.1016/j.chaos.2020.109761
  13. Golyandina N. Particularities and commonalities of singular spectrum analysis as a method of time series analysis and signal processing. Wiley Interdiscip. Rev.: Comput. Stat., 2020, vol. 12, no. 4: e1487. doi: 10.1002/wics.1487
  14. Kalantari M. Forecasting COVID-19 pandemic using optimal singular spectrum analysis. Chaos Solitons Fractals, 2021, vol. 142: 110547. doi: 10.1016/j.chaos.2020.110547
  15. Kermack W.O., McKendrick A.G. A contribution to the mathematical theory of epidemics. Proc. R. Soc. Lond. Ser. A, 1927, vol. 115, no. 772, pp. 700–721. doi: 10.1098/rspa.1927.0118
  16. Krivorotko O., Kabanikhin S.I., Zyuev N.V., Evtushenko Y.G., Pyatkov S.G. Mathematical modeling and prediction of COVID-19 in Moscow city and Novosibirsk region. arXiv:2006.12619, 2020. URL: https://arxiv.org/abs/2006.12619
  17. Krivorotko O., Zvonareva T., Neverov A. Identifiability of the spatial SEIR-HCD model of COVID-19 propagation. arXiv:2412. 18858, 2024. URL: https://arxiv.org/abs/2412.18858
  18. Li W.T., Bronchuk A.N., Zhang W. Using machine learning of clinical data to diagnose COVID-19: a systematic review and meta-analysis. BMC Med. Inform. Decis. Mak., 2020, vol. 20, pp. 1–13. doi: 10.1186/s12911-020-01266-z
  19. Ma Ch., Huang K., Schünemann H.J., Soltani F., Fabbri L.M., Cheng L. Understanding dynamics of pandemic models to support predictions of COVID-19 transmission: parameter sensitivity analysis of SIR-type models. IEEE J. Biomed. Health Inform., 2022, vol. 26, no. 6, pp. 2458–2468. doi: 10.1109/JBHI.2022.3168825
  20. Nichita D.R., Dima M., Boboc L., Hancean M.G. Data analysis evidence beyond correlation of a possible causal impact of weather on the COVID-19 spread, mediated by human mobility. Sci. Rep., 2024, vol. 14, no. 1: 17782. doi: 10.1038/s41598-024-67918-6
  21. Petrakova V.S. Planner model for estimating the dynamic of epidemic spread under limited resources. Eurasian J. Math. Comput. Appl., 2025, vol. 13, no. 1, pp. 89–99. doi: 10.32523/2306-6172-2025-13-1-89-99
  22. Petrakova V., Krivorotko O. Comparison of Two Mean Field Approaches to Modeling an Epidemic Spread. J. Optim. Theory Appl., 2025, vol. 204, no. 3: 39. doi: 10.1007/s10957-024-02604-1
  23. Petrakova V., Krivorotko O. Sensitivity of MFG SEIR-HCD epidemiological model. Lobachevskii J. Math., 2023, vol. 44, no. 7, pp. 2856–2869. doi: 10.1134/S199508022307034X
  24. Prakash K.B., Imambi S., Ismail S., Bhat S., Kumar A., Sridhar S. Analysis, prediction and evaluation of COVID-19 datasets using machine learning algorithms. Int. J. Eng. Technol. Res., 2020, vol. 8, no. 5, pp. 2199–2204. doi: 10.30534/ijeter/2020/ 117852020
  25. Qorib M., Oladunni T., Denis M., Ososanya E., Cotae P. Covid-19 vaccine hesitancy: Text mining, sentiment analysis and machine learning on COVID-19 vaccination Twitter dataset. Expert Syst. Appl., 2023, vol. 212: 118715. doi: 10.1016/j.eswa.2022.118715
  26. Ram V., Schaposnik L.P. A modified age structured SIR model for COVID-19 type viruses. Sci. Rep., 2021, vol. 11, no. 1: 15194. doi: 10.1038/s41598-021-94609-3
  27. Riedmann U., Muri L., Engstedt Åk., Meissner K., Rössler H., Marques A.M., Popp R., Gall F., Rieth U., Stelzl E., Tscherne M., Blüml G., Santacroce R. Estimates of SARS-CoV-2 infections and population immunity after the COVID-19 pandemic in Austria: Analysis of national wastewater data. J. Infect. Dis., 2025, vol. 231, no. 5, pp. e921–e928. doi: 10.1093/infdis/jiaf054
  28. Shuja J., Alanazi E., Alasmary W., Alashaikh A. COVID-19 open source data sets: a comprehensive survey. Appl. Intell., 2021, vol. 51, no. 3, pp. 1296–1325. doi: 10.1007/s10489-020-01862-6
  29. Sulandari W., Rodrigues P.C., Webel R. SSA-based hybrid forecasting models and applications. Bull. Electr. Eng. Inform., 2020, vol. 9, no. 5, pp. 2178–2188. doi: 10.11591/eei.v9i5.1950
  30. Taylan O., Alkabaa A.S., Yılmaz M.T. Impact of COVID-19 on G20 countries: analysis of economic recession using data mining approaches. Financ. Innov., 2022, vol. 8, no. 1: 81. doi: 10.1186/s40854-022-00385-y
  31. Xu B., Gutierrez B., Mekaru S., Sewalk K., Goodwin L., Loskill A., Cohn E.L., Buczinski S., Ananda-Rajah M.R., Kraemer M.U.G., Wu J.T., Leung K. Epidemiological data from the COVID-19 outbreak, real-time case information. Sci. Data, 2020, vol. 7, no. 1: 106. doi: 10.1038/s41597-020-0448-0
  32. Yi S., Sneeuw N. Filling the data gaps within GRACE missions using singular spectrum analysis. J. Geophys. Res.: Solid Earth, 2021, vol. 126, no. 5: e2020JB021227. doi: 10.1029/2020JB021227

Supplementary files

Supplementary Files
Action
1. JATS XML
2. Figure 1. Percentage of explanatory power of the first 30 elementary matrices for the trajectory for the number of newly detected infected

Download (157KB)
3. Figure 2. Caption: SSA analysis of time series of new coronavirus cases in Novosibirsk for the period from 2020 to 2023

Download (270KB)
4. Figure 3. Percentage of explanatory power of the first 10 elementary matrices for the trajectory for the number of newly detected deaths from coronavirus

Download (137KB)
5. Figure 4. Percentage of explanatory power of the first 10 elementary matrices for the trajectory for the number of newly detected critically ill patients

Download (152KB)
6. Figure 5. Comparison of the obtained trend and seasonal components for the number of critical and deceased patients

Download (306KB)
7. Figure 6. Comparison of the obtained trend and periodic components for the number of hospitalized patients and patients on mechanical ventilation

Download (451KB)
8. Figure 7. Comparison of the parameter aI (5 – a)/5 (virus transmission rate, black line) reconstructed from the data by solving the inverse problem for model (2), (3) and the first difference for a series displaying the trend in the number of infected people depending on the development of the strain (blue line)

Download (193KB)
9. Figure 8. Comparison of real data on the number of infected with the results of modeling the dynamics of the spread of the virus using model (2), (3), where the rate of spread of the virus is reconstructed by the trend identified by the SSA method (green line), or by solving the inverse problem (black line)

Download (185KB)

Copyright (c) 2026 Petrakova V.S.

Creative Commons License
This work is licensed under a Creative Commons Attribution 4.0 International License.

СМИ зарегистрировано Федеральной службой по надзору в сфере связи, информационных технологий и массовых коммуникаций (Роскомнадзор).
Регистрационный номер и дата принятия решения о регистрации СМИ: серия ПИ № ФС 77 - 64788 от 02.02.2016.