Построение высокочастотного медиаиндикатора региональной экономической активности на основе анализа публикаций СМИ с применением больших языковых моделей
Скачать статьюкандидат экономических наук, руководитель направления экономического отдела Отделения по Ставропольскому краю Южного главного управления Центрального банка Российской Федерации, г. Ставрополь, Россия; ORCID 0009-0001-5334-0020
e-mail: akademik.st.2018@mail.ruдоктор экономических наук, профессор, заведующая кафедрой финансов и кредита ФГАОУ ВО «Северо-Кавказский федеральный университет», г. Ставрополь, Россия; ORCID 0000-0001-9336-8100
e-mail: nkunitcyna@ncfu.ruРаздел: Искусственный интеллект в исследованиях медиа и коммуникации
Наличие временных лагов в публикациях официальных статистических материалов обуславливает повышенный интерес к альтернативным источникам информации. Одним из них является массив текстовых данных СМИ, обрабатываемый с помощью больших языковых моделей (LLM). Целью исследования стала разработка показателя экономической активности субъекта Российской Федерации на основе анализа новостных публикаций региональных СМИ с использованием LLM. Материалом для изучения стали тексты интернет-изданий за 2021–2025 гг. Методика исследования включает несколько этапов: формирование базы новостных публикаций, тематическую классификацию текстов по укрупненным секторам экономики с использованием модели zero-shot классификации, определение экономической тональности новостей с помощью большой языковой модели GigaChat, построение агрегированного медиапоказателя. В результате сформирован интегральный медиапоказатель экономической динамики IBVEDMedia, сопоставление которого с официальным индексом выпуска товаров и услуг по базовым видам экономической деятельности продемонстрировало наличие статистически значимой связи между ними. Следовательно, новостной поток региональных СМИ содержит существенную информацию о текущем состоянии региональной экономики. Предложенный медиапоказатель может рассматриваться как композитный индикатор экономической динамики, дополняющий официальную статистику и расширяющий инструментарий анализа экономической конъюнктуры. Валидация его оперативных свойств является предметом дальнейших исследований.
DOI: 10.55959/msu.vestnik.journ.3.2026.328Введение
Современная денежно-кредитная политика во многом зависит от скорости и качества информационного обеспечения. Классические макропоказатели официальной статистики, такие как индекс промышленного производства, динамика ВВП и ВРП, оборот розничной торговли, остаются «золотым стандартом» для ретроспективного анализа. Однако их ключевой недостаток в контексте принятия оперативных решений – значительное запаздывание публикации в статистических сборниках, зачастую с лагом от нескольких месяцев до года (в случае с ВВП/ВРП)2, что вынуждает Банк России, Министерство экономического развития РФ, Министерство финансов РФ и бизнес принимать решения на основе ретроспективных данных, не отражающих текущие шоки и краткосрочные колебания конъюнктуры рынка.
Эта проблема особенно остро стоит на региональном уровне. Динамика развития субъектов Российской Федерации отличается неоднородностью и зависимостью от локальных факторов: агроклиматических условий, отраслевой структуры, реализации конкретных инвестиционных проектов. Федеральная статистика, обеспечивая необходимую унификацию и сопоставимость, не отражает быстрые точечные изменения в экономической конъюнктуре конкретного региона.
Возникает насущная потребность в разработке и внедрении оперативных индикаторов экономической активности, которые могли бы служить надежным источником сигналов «в режиме, близком к реальному времени», компенсируя лаги официальной статистики. Важным информационным ресурсом становятся потоки неструктурированных текстовых данных, в том числе публикации в СМИ. Новостные ленты, в отличие от статистических сводок, реагируют на события практически мгновенно, аккумулируя информацию о запуске новых производств или модернизации старых, заключении контрактов, колебаниях урожайности, проблемах на транспортных узлах и изменении потребительской активности. Мы выдвинули гипотезу: совокупное информационное поле, формируемое региональными СМИ, несет в себе скрытый, но структурируемый сигнал об изменении экономической динамики отдельного региона. Проверку этой гипотезы мы и осуществили в исследовании.
Обзор литературы
Мониторинг состояния экономики в режиме, близком к реальному времени, на основе оперативного косвенного расчета официальных показателей является сутью методологии наукастинга (Nowcasting), которая служит «мостом» между ретроспективной статистикой и потребностями в актуальных данных для принятия решений. В настоящем исследовании мы не стремились к реализации полной процедуры наукастинга. Задача заключалась в разработке высокочастотного медиаиндикатора, который может быть использован в моделях наукастинга. Тем не менее, поскольку данный индикатор ориентирован на применение именно в этой парадигме, а сама методология наукастинга определяет требования к оперативности и качеству входных данных, считаем необходимым рассмотреть существующие подходы к наукастингу с целью позиционирования нашей разработки в рамках сложившейся исследовательской практики.
В экономической науке наукастинг представляет собой оценку текущего состояния экономики, как правило, на основе поступающих высокочастотных данных, позволяющих частично компенсировать информационный разрыв (Ghysels, 2016).
В зарубежной литературе наукастинг получил широкое распространение в 2000-х гг. Изначально в его основе лежали динамические факторные модели, модели со смешанной частотностью (Mixed-Data Sampling, MIDAS и др.), векторные авторегрессии (VAR), позволяющие использовать данные с разной периодичностью при прогнозировании ВРП, инфляции и уровня безработицы (Clements, Galvão, 2009; Ghysels, 2016; Dahlhaus, Guénette, Vasishtha, 2017; Mikosch, Solanko, 2019).
Впоследствии инструментарий наукастинга пополнился панельными моделями, которые также учитывают и кросс-секционные зависимости исследуемых объектов. В частности, ученые при наукастинге регионального объема выпуска применяли VAR (Vector Autoregression), BVAR (Bayesian Vector Autoregression) и MF-PVAR (Mixed-Frequency Panel Vector Autoregression) с панельной структурой данных. Такой подход обеспечил более качественный прогноз по сравнению с классическими эконометрическими методами, особенно на коротких временных рядах (Koop, Korobilis, Pettenuzzo, 2019; Acedański, 2024; Fosten, Greenaway-McGrevy, 2022).
В последнее время для оперативной оценки макроэкономических показателей экономисты стали использовать и методы классического машинного обучения (Machine Learning, ML). Исследователи применили для наукастинга ВВП Новой Зеландии методы градиентного бустинга, Lasso- и Ridge-регрессии, а также метод опорных векторов (Richardson, van Florenstein Mulder, Vehbi, 2021). В результате авторы выявили, что ML-алгоритмы способны значимо повысить точность наукастинга по сравнению с классическими эконометрическими моделями.
Аналогичный вывод на данных о ВВП Китая сделали китайские исследователи (Zhang, Ni, Xu, 2023). Они провели псевдовыборочный эксперимент на основе 89 показателей и установили, что классический ML, в частности Ridge-регрессия с регуляризацией, превосходят MIDAS по точности оперативной оценки, особенно в периоды высокой волатильности.
В российской литературе исследования наукастинга также получили развитие, однако они сосредоточены преимущественно на анализе индикаторов общенационального уровня. Значительная часть работ посвящена оценке текущей динамики ВВП России с использованием динамических факторных моделей, MIDAS-подходов и BVAR-моделей, DSGE-моделей (Dynamic Stochastic General Equilibrium) (Поршаков, Пономаренко, Синяков, 2016; Станкевич, 2023; Eliseev, 2025; Зубарев, Рыбак, 2021; Фокин, 2023). В. Бойко с соавторами (Boyko, Kislyak, Nikitin, Oborin, 2020) сравнивают методологию Росстата и методы темпорального дезагрегирования для получения более оперативных оценок регионального выпуска. Авторы показывают, что использование дополнительных индикаторов позволяет повысить точность квартальных оценок ВРП.
В исследованиях ученые используют и альтернативные источники данных, включая поисковые запросы, что позволяет повысить оперативность оценок и чувствительность моделей к изменению ожиданий экономических агентов (Лазарян, Герман, 2018; Shulyak, 2022; Макеева, Станкевич, 2022).
Как можно заметить, большинство существующих исследований – и мировых, и российских – опирается на количественные статистические показатели. При этом вопрос использования текстовых данных и медиаинформации для оперативной оценки региональной экономической активности остается относительно малоизученным. Вместе с тем область обработки текстовых данных и естественного языка (NLP) в условиях развития технологий вызывает повышенный интерес и позволяет расширить инструментарий экономического анализа в условиях высокой неопределенности (Гареев, Полбин, 2022).
Так, К. Яковлева (Yakovleva, 2018) для наукастинга динамики экономической активности в России предложила методику расчета высокочастотного индикатора, использовав более 59 000 статей крупных федеральных СМИ. Все тексты прошли предварительную обработку – токенизицию и лемматизацию. Семантическое моделирование осуществлено с использованием метода опорных векторов. Тренировочная выборка размечена автором вручную.
Аналогичный подход при расчете новостного индекса применяет в практической деятельности и Банк России3. Методика регулятора также основана на определении частотности вхождения слов в тексты новостей. На первом этапе используется модель, автоматически выделяющая темы, из которых по ключевым словам определяется одна, максимально покрывающая тематику. Затем для каждой новости на основе обученной модели выявляется ее релевантность и тональность путем определения баланса слов с положительной и отрицательной коннотацией. Для этого применяются методы латентного распределения Дирихле и модифицированный стохастический алгоритм, сглаживающий неравномерное распределение количества новостей по источникам.
А. Г. Евстигнеева и Д. А. Карпов4 исследовали влияние новостей на формирование инфляционных ожиданий населения. После токенизации и лемматизации слов в текстах новостей авторы применили численные метрики: TF-IDF (Term Frequency – Inverse Document Frequency) и Count Vectorizer. Тематическая классификация проведена на основе латентного распределения Дирихле (Latent Dirichlet allocation, LDA), метода опорных векторов (Support Vector Machine, SVM), случайного леса (Random Forest) и градиентного бустинга (eXtreme Gradient Boosting, XGBoost). Для обучения авторы сформировали выборку из 100 000 новостей по 25 источникам, представленным в равных долях. При этом для выделения негативных новостей специалисты также применили LDA: этот алгоритм требует на вход список экспертно выбранных якорных токенов, описывающих тему.
Достоинствами рассмотренных подходов являются простота реализации на практике и «мягкие» требования к вычислительным мощностям компьютера. Главным же недостатком – то, что подобные модели основаны на подсчете лишь частоты упоминаний слов в коллекциях текстов. При этом совершенно не учитывается контекст, который может диаметрально изменить тональность текста.
Ограничения частотных и тематических моделей обусловили интерес к методам, способным учитывать контекст и семантические связи в тексте. Кроме того, применение описанных выше алгоритмов, как правило, требует формирования обучающих выборок и ручной разметки текстов, что связано с существенными трудовыми затратами и снижает масштабируемость исследования. В этой связи внимание исследователей привлекают большие языковые модели (LLM), позволяющие осуществлять семантическую интерпретацию текстов без предварительной разметки корпуса и отличающиеся практически полным отсутствием ручной настройки классификаторов.
LLM-модели – это класс статистических моделей, предназначенных для изучения структуры человеческого языка. Такие модели достигают цели, оценивая вероятность токена
с учетом всех ранее наблюдаемых токенов в документе
, используя особую архитектуру нейронной сети, известную как трансформеры (Vaswani, Shazeer, Parmar, Uszkoreit et al., 2017).
Одну из таких моделей в своем исследовании применил Л. Биби (Bybee, 2023). Для воссоздания инфляционных ожиданий опрашиваемых экспертов были использованы новостные тексты и ChatGPT. Автор сравнил ожидания модели с существующими экономическими ожиданиями экспертов-аналитиков, такими как Survey of Professional Forecasters (SPF), American Association of Individual Investors (AAII), Duke CFO Survey. Его основной вывод состоит в том, что ожидания GPT-3.5 коррелируют с опросными данными и воспроизводят те же отклонения от рациональных ожиданий, которые наблюдаются у людей: недостаточно быструю корректировку прогнозов при появлении новой информации и склонность формировать ожидания на основе прошлых тенденций в области финансовых рынков. Однако данный подход требует больших финансовых затрат, поэтому автор сильно ограничил выборку текстов.
В последние годы в экономической литературе появились работы, в которых LLM используются непосредственно для получения оперативных макроэкономических показателей. Так, в препринте Федеральной резервной системы США ChatMacro: Evaluating Inflation Forecasts of Generative AI5 исследуется возможность применения генеративных языковых моделей для прогнозирования инфляции в режиме, близком к реальному времени. Авторы формируют систему промптов, на основе которых большие языковые модели генерируют количественные прогнозы инфляции и сопоставляют полученные оценки с официальными статистическими данными и результатами профессиональных опросов. Результаты такого подхода следует рассматривать как дополнение в официальной статистике, а не ее замену.
Таким образом, обзор литературы позволяет констатировать, что опыт использования LLM в целях наукастинга экономических показателей остается ограниченным. Практически отсутствуют исследования, ориентированные на формирование оперативного индикатора региональной экономической активности на основе публикаций местных СМИ, сопоставимого с официальными статистическими показателями выпуска по базовым видам экономической деятельности. Данный исследовательский пробел определяет методологический подход настоящей работы, направленный на использование больших языковых моделей для классификации и агрегирования информации из новостных текстов различных СМИ с целью построения индикатора региональной экономической активности.
Методика
Исследование ориентировано на решение двух блоков задач – классификацию новостей и построение показателя экономической активности региона. С этой целью нами реализованы следующие этапы.
I. Формирование корпуса и фильтрация данных
Обработка новостных текстов включала в себя 3 этапа:
1) Формирование корпуса текстов
Поскольку формирование коллекции новостных статей и ее преобразование в необходимый вид – трудоемкий процесс, для его автоматизации нами применена процедура Web Scraping. В Python разработана программа с использованием библиотек Requests и BeautifulSoup. Источниками данных выступили все тексты региональных СМИ Ставропольского края с 2022 по 2025 гг. включительно: газеты «Ставропольская правда» и «Вечерний Ставрополь», еженедельник «Аргументы и факты: Северный Кавказ», информационный портал АТВ-Медиа, информационное агентство «Победа 26», сетевое издание NewsTracker. Данные издания являются наиболее популярными в регионе и охватывают широкий круг социально-экономических тем. Общий объем собранного корпуса составил свыше 100 000 новостных публикаций. Отметим, что из материалов были исключены все статьи до 2022 г. и статьи объемом менее 100 слов.
Во избежание дублирования одного и того же события проведено их исключение: новости, имеющие аналогичные/схожие заголовки и опубликованные в пределах 3 дней определялись как дубликаты, в итоговом списке сохранялась первая по дате новость.
2) Тематическая классификация
Под экономической активностью в настоящем исследовании будем понимать Индекс выпуска товаров и услуг по базовым видам экономической деятельности (ИБВЭД). В соответствии с Приказом Министерства экономического развития Российской Федерации от 30.09.2021 г. № 609 «Об утверждении официальной статистической методологии расчета показателя “Индекс выпуска товаров и услуг по базовым видам экономической деятельности”» в ИБВЭД включены следующие отрасли (см. табл. 1). Поскольку индекс охватывает отраслевые сегменты, которые в регионе представлены слабо, в настоящем исследовании мы их укрупнили.
Из коллекции текстов региональных СМИ отобраны те, которые соответствуют базовым отраслям. Классический подход к анализу текстовых данных для экономических задач традиционно предполагает создание размеченных обучающих выборок с последующим применением методов машинного обучения, таких как алгоритмы на основе TF-IDF- векторизации в сочетании с линейными моделями или ансамблевыми методами. Однако данная методология сталкивается с ограничением – необходимостью наличия большого массива текстов для обучения моделей, вручную размеченных экспертами по базовым отраслям экономики.
Создание такой выборки для региональных СМИ представляет собой трудоемкую задачу: требует привлечения специалистов, знакомых с экономической тематикой, и сопряжено со значительными временными затратами.
Для отбора публикаций использована модель для мультиязычной классификации MoritzLaurer/xlm-v-base-mnli-xnli (платформа Hugging Face, 2025), основанная на архитектуре трансформера и позволяющая осуществлять классификацию текстов без предварительного дообучения на специализированной размеченной выборке. Это позволило отказаться от формирования трудоемкой экспертной разметки корпуса уже на первом этапе исследования (см. табл. 2).
С целью обеспечения качества тематической фильтрации установлен порог вероятности принадлежности текста к категории, равный 0,5. Значение порога выбрано на основе тестирования альтернативных значений (0,2–0,9) в векторе обеспечения баланса между полнотой и точностью отбора.
Для проверки качества классификации случайная подвыборка из 200 текстов была вручную проверена экспертами. Совпадение составило около 80%. После тематической фильтрации итоговая выборка расширена до 8 000 публикаций (7,5% от исходного массива). Отраслевая структура текстов СМИ представлена на рисунке 1.
II. Оценка экономической тональности публикаций 1) Использование LLM-модели
Для определения тональности отобранных текстов мы использовали LLM-модель GigaChat с подключением по API. Выбор этой модели обусловлен акцентом на работу именно с русским языком, а также возможностью обработки текстов без обучения и разметки.
2) Принципы определения тональности
Экономическая тональность определялась на основе заранее заданного промпта (см. рис. 2), содержащего:
– критерии позитивного, негативного и нейтрального экономического воздействия;
– правила анализа;
– примеры классификации.
Для оценки качества определения тональности моделью GigaChat была проведена экспертная проверка. Из итогового корпуса отобранных текстов новостей случайным образом сформирована подвыборка объемом в 100 текстов, вручную размеченная экспертами. Сравнение автоматической классификации с экспертной показало совпадение на уровне 78%. Анализ матрицы ошибок подтверждает, что основные расхождения приходятся на пары «нейтральный – позитивный» и «нейтральный – негативный». При этом прямые ошибки между позитивными и негативными классами встречаются реже.
Полученная точность в 78% рассматривается нами как приемлемая для построения балансового индекса, поскольку агрегирование большого числа новостей частично компенсирует индивидуальные ошибки классификации, а преобладание ошибок на границе с нейтральным классом снижает риск систематического смещения индекса в ту или иную сторону.
III. Построение индекса IBVEDMedia 1) Расчет отраслевых индексов тональности
Агрегированный показатель тональности для каждой отрасли в месяц
рассчитывался как баланс скорректированных позитивных сообщений и негативных текстов:
(1),
где Tonality i,m – уровень тональности новостей по соответствующей тематике в i-й отрасли в m-й месяц;
Positive i,m – количество текстов, имеющих позитивную тональность;
Negative i,m – количество текстов, имеющих негативную тональность;
All_news i,m – количество всех новостей по соответствующей тематике.
Значение показателя лежит в интервале [-1; 1], где:
– положительные значения отражают преобладание позитивной экономической информации;
– отрицательные – доминирование негативных сообщений;
– значения, близкие к нулю, указывают на нейтральный информационный фон.
Нормализация на общее число публикаций позволяет учитывать различия в интенсивности информационного потока между отраслями и временными периодами.
2) Агрегирование в сводный индекс
Для формирования интегрального показателя экономического информационного фона рассчитывался агрегированный индекс тональности по всем укрупненным отраслям.
Месячное значение сводной тональности определялось как взвешенная сумма отраслевых индексов:
(2),
где
– вес i-й отрасли в структуре валовой добавленной стоимости.
Веса определяются на основе официальных статистических данных о структуре региональной экономики и отражают вклад соответствующих отраслей в формирование валовой добавленной стоимости региона. Использование отраслевых весов позволяет обеспечить сопоставимость медиаиндикатора со структурой экономики.
Именно на данном этапе индикатор обладает потенциальной оперативностью, так как может быть рассчитан сразу по окончании календарного месяца без дополнительных преобразований. Однако для целей сравнения с официальным ИБВЭД, который публикуется в форме годового прироста, нам потребовалось привести индикатор к сопоставимому виду (этапы 3 и 4).
3) Усреднение за 12 месяцев
Поскольку официальный показатель ИБВЭД рассчитывается в годовом выражении, показатель также агрегирован до годового уровня. Подчеркнем, что данная процедура не является необходимым элементом расчета оперативного индикатора, она используется исключительно для сопоставления с официальными данными. Для этого сначала определено среднегодовое значение сводной тональности:
(3),
где
– среднегодовая тональность;
– значение средней тональности месяца m года t.
Усреднение позволяет снизить влияние краткосрочных информационных всплесков и повысить устойчивость показателя. Именно по этой причине новости за 2022 г. использованы исключительно с целью формирования среднегодового значения в 2023 г. При этом оперативные свойства построенного индикатора сохраняются на этапе агрегирования тональности отраслевых индексов (этап 2), которые могут использоваться для мониторинга текущего состояния экономической активности без дополнительного усреднения.
4) Расчет индекса IBVEDMedia
Итоговый индикатор экономической динамики рассчитывается как годовой темп прироста тональности:
(4),
где
– показатель динамики экономической активности в году t;
– значение показателя тональности в предыдущем году.
Таким образом, структура индекса отражает реальный вклад отраслей в экономику региона.
5) Интерпретация индекса
Индекс IBVEDMedia интерпретируется следующим образом:
– значения свыше 0 указывают на улучшение экономического информационного фона;
– значение менее 0 свидетельствуют о росте негативной экономической повестки;
– значения, близкие к 0, отражают нейтральный информационный фон.
Результаты и их анализ
1. Динамика отраслевой тональности
Исследование динамики отраслевых индексов тональности новостных публикаций показало, что повестка региональных СМИ характеризуется устойчивым преобладанием положительной информации (см. рис. 3).
Для оценки устойчивости результатов нами проведена ручная проверка подвыборки текстов (n=100), показавшая совпадение классификации на уровне 78%.


Наиболее позитивные значения тональности наблюдаются в сельском хозяйстве и строительстве, где значения индекса на протяжении большей части исследуемого периода находятся в диапазоне 0,6–0,8. Это отражает активное освещение региональными СМИ инвестиционных проектов, развития аграрного производства и инфраструктурного строительства.
В промышленности тональность также сохраняется на относительно высоком уровне (0,4–0,8), однако во второй половине 2024 и в 2025 г. наблюдается заметное снижение позитивного информационного фона.
Наиболее волатильной оказалась тональность в секторе транспорта. Это может быть связано с эпизодическими событиями и меньшим количеством публикаций по данной тематике.
В секторе торговли наблюдается постепенное ослабление позитивной тональности, что может отражать рост обсуждения ценовой динамики и потребительских ожиданий.
Следовательно, повестка местных СМИ во многом соответствует отраслевой структуре экономики региона, где ведущую роль играет аграрный сектор.
2. Динамика показателя IBVEDMedia
На основе отраслевых индексов рассчитан интегральный показатель экономической динамики IBVEDMedia, отражающий изменение информационного фона региональной экономики.
Результаты расчета показывают, что индикатор на протяжении всего исследуемого периода находится в отрицательной зоне. При этом он имеет выраженную циклическую динамику (см. рис. 4). В течение 2023 г. наблюдалось постепенное ухудшение тональности, что сопровождалось снижением индекса. Данный период характеризуется массовым обсуждением экономических рисков, инфляционного давления и ограничений внешней торговли.
В 2024 г. показатель IBVEDMedia становится более стабильным. В этот период экономика как региона, так и страны в целом адаптируется к новой макроэкономической конъюнктуре, что сопровождается большим объемом позитивного контента в СМИ.
Однако уже в 2025 г. динамика показателя демонстрирует повышенную волатильность. Именно в этот период в СМИ наблюдается увеличение числа публикаций, связанных с проблемами почти во всех базовых отраслях.
3. Сравнение с официальным ИБВЭД
Сопоставление IBVEDMedia с реальным ИБВЭД Ставропольского края свидетельствует, что динамика показателя в значительной степени согласуется с данными официальной статистики. Коэффициент корреляции между предложенным индикатором и значением ИБВЭД составил около 0,4, что указывает на наличие умеренной связи и объясняется высокой волатильностью регионального ИБВЭД, для которого свойственны краткосрочные сезонные колебания. Это подтверждает достаточно высокую степень связи между информационным фоном СМИ и фактической динамикой региональной экономики.
Важно отметить, что IBVEDMedia измеряет темп прироста тональности, а не ее абсолютный уровень, поэтому отрицательная динамика возникает при снижении тональности относительно соответствующего месяца предыдущего года, что подтверждается данными рисунка 3.
4. Проверка опережающего характера показателя
Дополнительно нами проведена проверка гипотезы о возможном опережающем характере оперативного индикатора. Для этого построены временные лаги IBVEDMedia относительно официального показателя ИБВЭД.
Результаты расчетов показывают, что учет временных лагов не приводит к устойчивому увеличению коэффициента корреляции между показателями. При анализе различных временных интервалов коэффициент корреляции варьируется в диапазоне от 0,40 до 0,80.
Заключение
Проведенное исследование ставило целью разработку высокочастотного медиаиндикатора экономической активности региона на основе анализа новостных публикаций средств массовой информации с использованием методов обработки естественного языка и больших языковых моделей.
В работе сформирован методический подход к построению показателя экономической динамики, включающий несколько последовательных этапов: сбор массива новостных публикаций региональных СМИ, тематическую классификацию текстов по укрупненным секторам экономики, оценку экономической тональности новостей с использованием большой языковой модели, агрегирование полученных оценок в показатель IBVEDMedia.
Эмпирическая апробация методики на материалах Ставропольского края свидетельствует, что новостной поток региональных СМИ содержит значимую информацию о состоянии экономики региона. Однако СМИ склонны к фиксации позитивных событий.
Расчет показателя IBVEDMedia позволил оцифровать динамику изменения информационного фона в базовых отраслях экономики региона. Его сравнение с официальным ИБВЭД продемонстрировало наличие статистически значимой взаимосвязи, следовательно, разработанный оперативный индикатор может отражать изменения динамики в отраслях экономики и выступать в роли дополнительного источника информации.
Кроме того, полученные результаты подтверждают возможность использования LLM-моделей для извлечения экономически значимой информации из текстовых данных. Вместе с тем мы признаем, что текущая валидация ограничена внутривыборочным корреляционным анализом на коротком временном промежутке и не может быть рассмотрена как полноценная проверка предсказательных свойств построенного индикатора. Позиционирование данного показателя как инструмента наукастинга требует проведения псевдовыборочного эксперимента в реальном времени. В этой связи перспективные направления дальнейших исследований включают: формирование базы данных реального времени для ИБВЭД, проведение псевдовыборочного эксперимента для строгого выявления оперативных свойств индикатора, апробацию и внедрение новых языковых моделей.
Примечания
1 Настоящая статья отражает личную позицию авторов. Содержание и результаты данного исследования не следует рассматривать, в том числе цитировать в каких-либо изданиях, как официальную позицию Банка России или указание на официальную политику или решение регулятора.
2 На момент подготовки итоговой версии статьи (март 2026 г.) имеются данные по ВРП и ВВП только за 2023 г.
3 Селезнев С., Шибитов Д., Яковлева К., Власов С. и др. Новая методология новостного индекса // Доклады об экономических исследованиях. 2021. Режим доступа: https://cbr.ru/Collection/Collection/File/35503/index_2107.pdf (дата обращения: 26.11.2025).
4 Евстигнеева А. Г., Карпов Д. А. Влияние негативных новостей на восприятие инфляции населением // Доклады об экономических исследованиях. 2023. № 111. Режим доступа: https://cbr.ru/Content/Document/File/144918/wp_111.pdf (дата обращения: 20.11.2025).
5 Alam M. J., Boyle S., Li H., Sekhposyan T. (2026) ChatMacro: Evaluating Inflation Forecasts of Generative AI. Federal Reserve Bank of San Francisco, Working Paper Series 2026-04. Available at: https://ideas.repec.org/p/fip/fedfwp/102407.html (accessed: 24.02.2026).
6 Показана вероятность отнесения текста к соответствующей теме, т. е. «уверенность». Рассчитывается моделью MoritzLaurer/xlm-v-base-mnli-xnli автоматически при проведении текстовой классификации.
7 Для отражения сопоставимых данных на графике ИБВЭД уменьшен на 100 п. п.
8 Для дополнительной оценки устойчивости связи было применено скользящее трехмесячное усреднение. Мы признаем, что данная процедура дополнительного сглаживания снижает оперативность индикатора. Она используется нами исключительно как аналитический прием для демонстрации того, что выявленная связь не является элементом высокочастотного шума. В практике оперативного мониторинга трехмесячное сглаживание не является обязательным.
Библиография
Гареев М. Ю., Полбин А. В. Наукастинг: оценка изменения ключевых макроэкономических показателей с использованием методов машинного обучения // Вопросы экономики. 2022. № 8. С. 133–157. DOI: 10.32609/0042-8736-2022-8-133-157
Зубарев А. В., Рыбак К. С. Наукастинг ВВП: динамическая факторная модель и официальные прогнозы // Экономическое развитие России. 2021. № 12. С. 34–40.
Лазарян С. С., Герман Н. Е. Прогнозирование текущей динамики ВВП на основе данных поисковых запросов // Финансовый журнал. 2018. № 6. С. 83–94. DOI: 10.31107/2075-1990-2018-6-83-94
Макеева Н. М., Станкевич И. П. Наукастинг элементов использования ВВП России // Экономический журнал Высшей школы экономики. 2022. № 4. С. 598–622. DOI: 10.17323/1813-8691-2022-26-4-598-622
Поршаков А. С., Пономаренко А. А., Синяков А. А. Оценка и прогнозирование ВВП России с помощью динамической факторной модели // Журнал Новой экономической ассоциации. 2016. № 2 (30). С. 60–76. DOI: 10.31737/2221-2264-2016-30-2-3
Станкевич И. П. Применение MIDAS-моделей с марковским переключением для наукастинга ВВП и его компонентов // Прикладная эконометрика. 2023. № 2. С. 122–143. DOI: 10.22394/1993-7601-2023-70-122-143
Фокин Н. Д. Наукастинг и прогнозирование основных российских макроэкономических показателей с помощью MFBVAR-модели // Экономическая политика. 2023. Т. 18. № 3. С. 110–135. DOI: 10.18288/1994-5124-2023-3-110-135
Acedański J. (2024) Disaggregation and Nowcasting of Regional GDP Series with a Simple Smoothing Algorithm. Journal of Official Statistics 40 (4): 508–529. DOI: 10.1177/0282423X241277716.
Boyko V., Kislyak N., Nikitin M., Oborin O. (2020) Methods for Estimating the Gross Regional Product Leading Indicator. Russian Journal of Money and Finance 79 (3): 3–29. DOI: 10.31477/rjmf.202003.03.
Bybee L. (2023) Surveying Generative AI’s Economic Expectations. arXiv. DOI: 10.48550/arXiv.2305.02823. Available at: https://arxiv.org/abs/2305.02823 (accessed: 17.01.2026).
Clements M. P., Galvão A. B. (2009) Forecasting US Output Growth Using Leading Indicators: An Appraisal Using MIDAS Models. Journal of Applied Econometrics 24 (7): 1187–1206. DOI: 10.1002/jae.1075.
Dahlhaus T., Guénette J.-D., Vasishtha G. (2017) Nowcasting BRIC+M in Real Time. International Journal of Forecasting 33 (4): 915–935. DOI: 10.1016/j.ijforecast.2017.05.002.
Eliseev A. (2025) Nowcasting Russian GDP in a Mixed-Frequency DSGE Model with a Panel of Non-Modelled Variables. Russian Journal of Money and Finance 84 (3): 63–93.
Fosten J., Greenaway-McGrevy R. (2022) Panel data nowcasting. Econometric Reviews 41 (7): 675–696. DOI: 10.1080/07474938.2021.2017670.
Ghysels E. (2016) Macroeconomics and the reality of mixed frequency data. Journal of Econometrics 193 (2): 294–314. DOI: 10.1016/j.jeconom.2016.04.008.
Koop G., Korobilis D., Pettenuzzo D. (2019) Bayesian Compressed Vector Autoregressions. Journal of Econometrics 210 (1): 135–154. DOI: 10.1016/j.jeconom.2018.11.009.
Mikosch H., Solanko L. (2019) Forecasting Quarterly Russian GDP Growth with Mixed-Frequency Data. Russian Journal of Money and Finance 78 (1): 19–35. DOI: 10.31477/rjmf.201901.19.
Richardson A., van Florenstein Mulder T., Vehbi T. (2021) Nowcasting GDP using Machine-Learning Algorithms: A Real-Time Assessment. International Journal of Forecasting 37 (2): 941–948. DOI: 10.1016/j.ijforecast.2020.10.005.
Shulyak E. (2022) Macroeconomic Forecasting Using Data from Social Media. Russian Journal of Money and Finance 81 (4): 86–11 2.
Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser L., Polosukhin I. (2017) Attention Is All You Need. arXiv. DOI: 10.48550/arXiv.1706.03762. Available at: https://arxiv.org/abs/1706.03762 (accessed: 24.12.2025).
Yakovleva K. (2018) Text Mining-based Economic Activity Estimation. Russian Journal of Money and Finance 77 (4): 26–41. DOI: 10.31477/rjmf.201804.26.
Zhang Q., Ni H., Xu H. (2023) Nowcasting Chinese GDP in a Data-Rich Environment: Lessons from Machine Learning Algorithms. Economic Modelling 122: 106204. DOI: 10.1016/j.econmod.2023.106204.
Как цитировать: Метель Ю. А., Куницына Н. Н. Построение высокочастотного медиаиндикатора региональной экономической активности на основе анализа публикаций СМИ с применением больших языковых моделей // Вестник Московского университета. Серия 10. Журналистика. 2026. № 3. С. 3–28. DOI: 10.55959/msu.vestnik.journ.3.2026.328
Поступила в редакцию 25.03.2026

