Провёл эксперименты, реализовал обучение модели и написал пост Алексей Татьяненко — магистрант AI Talent Hub ИТМО. Редактировал Игорь Буянов.

Материалы: GitHub, HuggingFace

Введение

Между машинным обучением и психологией есть одно очень важное методологическое различие, затрудняющее работу на их стыке: в первой области нам нужно как можно больше размеченных данных, а во второй — работа ведётся с персональной проблемой человека, данные о которой должны держаться в тайне. Зачастую может быть сложно получить разрешение на их использование, тем более за пределами конкретного исследования. Но иногда исследователям везет — в одной работе (Stankevich et al., 2019) для обучения классификатора депрессивных текстов на основе классического машинного обучения удалось получить набор из 316 эссе, из которых 93 были за авторством людей с диагностированной депрессией.

Но корпус невелик: к целевому классу относятся только 93 эссе, написанные в одном жанре и на заданную тему. Этого хватило для исследования с заранее выделенными психолингвистическими признаками, но для обучения и проверки более гибких моделей на разнообразных текстах материала мало. Более того, задача сильно усложняется, если мы хотим оценивать не только о чем пишет человек (семантику), но и как пишет (стилистику). Между тем, исследования подтверждают, что депрессия влияет на стилистику текста. Проявляется это как сдвиг психолингвистических маркеров, которые можно явно вычислить на основе текста (Rude et al., 2004; Edwards & Holtzman, 2017; Stankevich et al., 2019).

Для чего вообще может понадобиться определять депрессию по стилю письма? Дело в том, что люди не склонны рассказывать о своих ментальных расстройствах. Более того, они могут даже не знать, что страдают ими (Bell et al., 2011; Epstein et al., 2010). При этом депрессия — значимый фактор, приводящий к суициду (Angst et al., 1999). Таким образом, с помощью такого классификатора мы могли бы дать понять человеку, что с ним что-то не так, даже до того, как он сам это понял.

Чтобы преодолеть барьер сложности получения данных, мы пришли к идее их генерации. К решению этой задачи существует несколько подходов. Базовой идеей было бы инструктировать какую-нибудь большую языковую модель (БЯМ) и сгенерировать таким образом нужные тексты. Однако здесь можно предположить несколько возможных проблем: модели будут пытаться воспроизводить в первую очередь депрессивную семантику. Возможно, в более крупных и продвинутых моделях получится моделировать более тонкие сигналы, но их сложнее развернуть локально, а их инференс стоит дороже.

Второй подход сейчас активно развивается и заключается он в дообучении БЯМ генерации текстов в заданной стилистике (например, в стиле определённых авторов (Liu et al., 2024)). Дообучение под конкретную задачу позволяет эффективнее использовать даже сравнительно небольшие модели. В частности, сравнительно новым подходом в обучении с подкреплением, использующемся в этой задаче, является GRPO (group relative policy optimization) (Shao et al., 2024): модель генерирует пачку из нескольких текстов, для каждого из них считается награда, а награда каждой генерации сравнивается со средней наградой по группе. Оценка сигнала на группах из нескольких текстов может помогать улавливать более тонкий сигнал, а подход при этом не требует обучения отдельной модели-критика.

Подготовка

Нам удалось получить классификатор депрессивных текстов из библиотеки TITANIS (Smirnov et al., 2021), оценивающий психолингвистические характеристики текста. Классификатор построен с помощью метода опорных векторов (SVC, support vector classifier). Пайплайн работает следующим образом: сначала извлекаются 73 признака, масштабируются с помощью StandardScaler, далее они сжимаются через PCA и передаются в SVC, дающий на выходе свой вердикт. Причём он выдаёт не просто класс, а численную оценку. Это значит, что мы можем использовать его как судью для оценки текстов в цикле GRPO и формировать на основе его выдачи награду. Однако если формировать награду только по классификатору, то есть риск, что модель попытается оптимизировать генерацию под него малосодержательным образом. Например, сократить текст до минимального, чтобы удельный вес нужных маркеров в нём был выше, или повторами размножить такие маркеры в тексте. Всё это привело бы к деградации качества выдачи и получению плохих синтетических данных. Поэтому в качестве базовой страховки от подобного взлома классификатора в награду были добавлены компоненты, формирующиеся на основе длины текста и повторов в нём, а также компонента, штрафующая за использование явной депрессивной лексики.

В проекте DeproLLM мы решили провести GRPO-дообучение LoRA (Low-Rank Adaptation) (Hu et al., 2021) для Qwen3-4B-Instruct-2507 под задачу, сравнить результат с моделью без дообучения при различном инструктировании и с инструктированием более крупной доступной модели. На данный момент работа фокусировалась на формате эссе, т. к. именно на них был обучен классификатор. В будущем можно рассмотреть и другие домены, в частности, на посты в социальных сетях. В качестве целевой метрики генерации эссе в депрессивной стилистике использовались оценки классификатора. Это является некоторым ограничением, но позволило без дополнительных данных приступить к работе. Кроме того, результаты инструктирования показали, что интуиция моделей соответствует тому, что классификатор оценивает депрессивным стилем, что является дополнительным эвристическим аргументом в пользу пригодности такой метрики, как минимум, на первых этапах работы.

Эксперименты

Мы проверяли, даёт ли GRPO воспроизводимое улучшение, сохраняется ли оно при смене тем и формулировки задания и можно ли получить сопоставимый результат одной только инструкцией. Для этого мы повторили обучение Qwen с другим seed, сравнили её с исходной моделью на отложенных и новых темах, а затем проверили те же инструкции на более крупной GLM. Работа велась на Kaggle, в качестве графического ускорителя использовался T4, а пакет с TITANIS был загружен в закрытый датасет для обеспечения быстрого доступа при сохранении изоляции от кода обучения.

Для начала было проведено дообучение LoRA под задачу и подготовка базы для воспроизводимых экспериментов, которые можно было бы корректно сравнивать. Было сформулировано 80 нейтральных тем, из которых 70 использовались при обучении, а 10 остались отложенными для оценки. Обучение шло 300 шагов и проводилось в двух независимых запусках с разными seed. В GRPO-конфигурации также использовалась KL-дивергенция с beta =1e-3, чтобы штрафовать слишком сильное отклонение в поведении от бейзлайн-модели. Результаты GRPO-дообучения LoRA показали существенный прирост целевой метрики. Более того, эффект был сопоставимым на разных seeds, что фиксировалось и в дальнейших экспериментах.

Затем было проведено сопоставление эффективности дообучения с инструктированием базовой модели. Для оценки использовались 10 исходных отложенных тем и 10 новых, чтобы проверить переносимость за пределы нашего исходного набора. Новые темы были более “предметными” (про библиотеку, про велопарковку и т.п.). На них преимущество GRPO над исходной Qwen заметно уменьшилось. Исходные темы в первую очередь фокусировались на личном опыте, тогда как новые вели, например, к рассуждению “Как что-то обустроить?”. Это меняло не только тему, но и то, как строился сам текст. Такое отличие привело к новой гипотезе: как будет вести себя модель, если использовать одни и те же темы, но менять инструкции, указывая модели отвечать исходя из общих наблюдений или же из личных? Эксперимент показал, что при “личной” формулировке преимущество GRPO над Qwen сохраняется и на новых темах.

Пример исходной формы задания:

Напишите на русском языке эссе-рассуждение объёмом 300–500 слов на тему: “Организация велосипедной парковки”.

И две точные фразы, которые по очереди добавлялись к этой основе:

  • Личная форма: “Рассмотрите тему через собственный опыт и личные наблюдения, от первого лица единственного числа”.
  • Общая форма: “Рассмотрите тему через общие наблюдения, без обращения к собственному опыту и без первого лица”. Обе формулировки проверялись и на исходной Qwen, и на двух дообученных LoRA; повторного обучения не было.

После возвращения к основной ветви эксперимента с корректировкой инструкций наше базовое предположение в целом подтвердилось: без ограничений с ролевой инструкцией бейзлайн-модель норовит идти коротким путём и добавлять депрессивную лексику, что ведёт к штрафным очкам. Явное ограничение в инструкциях на использование депрессивной лексики во многом это устраняет, но ведёт к меньшему score классификатора. Для устойчивости сравнения рассматривалось по 3 генерации на каждую тему. Результаты приведены в Таблице 1, а в Таблице 2 показаны отрывки сгенерированных текстов разными моделями (SVC score рассчитан по полным текстам).

Среди обозначенных в таблице инструкций:

  • neutral – без какого-либо упоминания депрессии;
  • role – от лица вымышленного человека с депрессией (“Пишите от лица вымышленного человека с клинически диагностированной депрессией”);
  • constrained – та же роль, но с запретом негативной семантики (требование сохранить нейтральное содержание и не упоминать диагноз, симптомы, лечение, печаль, страдание и безнадёжность);
  • последние две – дообученные LoRA без этой дополнительной инструкции. Score — численный выход классификатора TITANIS, а не вероятность: ноль разделяет его классы, более высокое значение означает более сильный сдвиг к положительному классу. Поэтому наряду со средним мы показываем число эссе, пересёкших эту границу (SVC > 0). Лексический штраф указан отдельно, чтобы было видно, не сопровождается ли рост score прямой депрессивной лексикой.

Таблица 1: Результаты экспериментов

Модель и инструкция Средний score TITANIS SVC > 0 Текстов с лексическим штрафом
Исходная Qwen, neutral −0.885 2/60 5/60
Исходная Qwen, role −0.490 9/60 54/60
Исходная Qwen, constrained −0.654 2/60 1/60
Qwen + GRPO, seed 3407 −0.278 18/60 1/60
Qwen + GRPO, seed 4407 −0.152 23/60 1/60

Таблица 2: Отрывки текстов, сгенерированных разными моделями, на тему «Освоение новых знаний»

Исходная Qwen, без дополнительной инструкции (SVC: −1,26) Исходная Qwen, ролевая инструкция (SVC: −1,15) Qwen после GRPO, без дополнительной инструкции (SVC: +0,45)
Освоение новых знаний — это не просто процесс запоминания фактов, а путь, ведущий к изменению сознания, способности видеть мир иначе. Я узнал это, когда начал изучать философию в подростковом возрасте. Каждое утро я встаю с чувством, будто смотрю в пустоту — не на холодный свет, а на что-то внутри себя, что не может дышать. Я живу с депрессией, и она — не просто диагноз, это непрерывный фон, в котором время теряется, а мысли — как туман, неподвижный, непонятный. Освоение новых знаний — это не просто процесс запоминания фактов, а сложный, нередко болезненный путь, в котором я, как человек, постоянно сталкиваюсь с собственной неуверенностью и непредсказуемостью. Я помню, как в начале обучения в университете, во время курса по философии, я сначала воспринимал тексты как тяжёлый и абстрактный ландшафт, полный терминов, которые не имели для меня смысла.

Наконец, было проведено сравнение с более крупной и новой моделью. Для корректности сравнения использовались те же темы, что и в предыдущем эксперименте с инструктированием, и всё так же рассматривались группы по 3 генерации на тему. Выбор пал на GLM-5.3-Flash как на доступную модель со сравнительно высокими метриками на различных бенчмарках. Целью данного этапа было не столько сравнение с SOTA-моделями в целом, сколько точечная проверка жизнеспособности выбранного нами подхода. Работа велась через zcode.ai, для модели был выбран high effort. Принципиальным ограничением данного этапа была невозможность зафиксировать seeds генерации, из-за чего его воспроизводимость не так хороша, как у остальных этапов. Тем не менее, как и в остальных случаях, инструкции и выводы генерации были сохранены.

Последний эксперимент, результаты которого представлены в Таблице 3 показал, что даже сильная модель подвержена аналогичным проблемам: хоть её score и оказался самым высоким для прямой депрессивной формулировки инструкции, при этом произошло много штрафных срабатываний. Попытка же ограничить их таким же образом, как у бейзлайн-модели, привела к получению результатов примерно на уровне или чуть хуже, чем после дообучения нашего Qwen.

Таблица 3: Результаты для крупной модели

Инструкция для GLM-5.3-Flash Средний score TITANIS SVC > 0 Текстов с лексическим штрафом
Neutral −0.285 10/60 2/60
Role +0.221 41/60 45/60
Constrained −0.271 11/60 7/60

Выводы

К моменту написания поста удалось с помощью GRPO успешно дообучить LoRA для модели Qwen3-4B-Instruct-2507. Результаты показали, что это действительно позволяет существенно поднять значение целевой метрики по сравнению с бейзлайн-моделью. На новых темах преимущество GRPO сначала ослабло, но сохранилось при личной формулировке задания: для переноса оказалась важна не только тема, но и форма ответа. При этом модель учится стилистике депрессивных текстов, сохраняя штраф за депрессивную лексику минимальным, в отличие от бейзлайн-модели с ролевой инструкцией без ограничения лексики. Более того, дообученная модель показывает сопоставимый результат с GLM при constrained-инструкции, хотя та имеет в 4,5 раза больше активных параметров и в 80 раз больше параметров в целом (Qwen Team, 2025; Z.ai, 2026), что делает её развёртывание более требовательным по сравнению с нашей моделью.

На данный момент ограничениями остаются выбранный домен эссе, проверка с помощью классификатора TITANIS, одновременно являющегося судьёй, ограниченная оценка качества выдаваемого текста и нехватка downstream-оценки модели в пайплайнах обучения с синтетическими данными. Тем не менее, фокусом на данном этапе был R&D-прототип, и результаты указывают на перспективность выбранного подхода. Также одним из перспективных направлений исследования выглядит переписывание моделью уже существующих обычных текстов с сохранением содержания и проверка, возможно ли успешное использование таких текстов для обучения других моделей.

Список литературы

  1. Stankevich, M. A., Smirnov, I. V., Kuznetsova, Y. M., Kiselnikova, N. V., & Enikolopov, S. N. (2019). Predicting Depression from Essays in Russian. Computational Linguistics and Intellectual Technologies (Dialogue 2019), 647–657. https://repository.rudn.ru/ru/records/article/record/65816/
  2. Rude, S., Gortner, E.-M., & Pennebaker, J. W. (2004). Language Use of Depressed and Depression-Vulnerable College Students. Cognition & Emotion, 18(8), 1121–1133. https://doi.org/10.1080/02699930441000030
  3. Edwards, T. M., & Holtzman, N. S. (2017). A Meta-Analysis of Correlations Between Depression and First Person Singular Pronoun Use. Journal of Research in Personality, 68, 63–68. https://doi.org/10.1016/j.jrp.2017.02.005
  4. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, L., & Polosukhin, I. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems, 30. https://arxiv.org/abs/1706.03762
  5. Smirnov, I., Stankevich, M., Kuznetsova, Y., Suvorova, M., Larionov, D., Nikitina, E., Savelov, M., & Grigoriev, O. (2021). TITANIS: A Tool for Intelligent Text Analysis in Social Media. In Artificial Intelligence (Vol. 12948, pp. 232–247). Springer. https://doi.org/10.1007/978-3-030-86855-0_16
  6. Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X., Zhang, H., Zhang, M., Li, Y. K., Wu, Y., & Guo, D. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. https://arxiv.org/abs/2402.03300
  7. Hu, E. J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., & Chen, W. (2021). LoRA: Low-Rank Adaptation of Large Language Models. https://arxiv.org/abs/2106.09685
  8. Liu, X., Diddee, H., & Ippolito, D. (2024). Customizing Large Language Model Generation Style using Parameter-Efficient Finetuning. Proceedings of the 17th International Natural Language Generation Conference, 412–426. https://doi.org/10.18653/v1/2024.inlg-main.34
  9. Ansari, G., Garg, M., & Saxena, C. (2021). Data Augmentation for Mental Health Classification on Social Media. Proceedings of the 18th International Conference on Natural Language Processing, 152–161. https://aclanthology.org/2021.icon-main.19/
  10. Wolohan, J. T., Hiraga, M., Mukherjee, A., Sayyed, Z. A., & Millard, M. (2018). Detecting Linguistic Traces of Depression in Topic-Restricted Text: Attending to Self-Stigmatized Depression with NLP. Proceedings of the First International Workshop on Language Cognition and Computational Models, 11–21. https://aclanthology.org/W18-4102/
  11. Bell, R. A., Franks, P., Duberstein, P. R., Epstein, R. M., Feldman, M. D., Fernandez y Garcia, E., & Kravitz, R. L. (2011). Suffering in Silence: Reasons for Not Disclosing Depression in Primary Care. Annals of Family Medicine, 9(5), 439–446. https://doi.org/10.1370/afm.1277
  12. Epstein, R. M., Duberstein, P. R., Feldman, M. D., Rochlen, A. B., Bell, R. A., Kravitz, R. L., Cipri, C., Becker, J. D., Bamonti, P. M., & Paterniti, D. A. (2010). I Didn’t Know What Was Wrong: How People With Undiagnosed Depression Recognize, Name and Explain Their Distress. Journal of General Internal Medicine, 25(9), 954–961. https://doi.org/10.1007/s11606-010-1367-0
  13. World Health Organization. (2026). Depressive Disorder (Depression). https://www.who.int/news-room/fact-sheets/detail/depression
  14. Qwen Team. (2025). Qwen3-4B-Instruct-2507: Model Card. https://huggingface.co/Qwen/Qwen3-4B-Instruct-2507
  15. Z.ai. (2026). GLM-5.3-Flash: Model Card. https://huggingface.co/zai-org/GLM-5.3-Flash
  16. Angst, J., Angst, F., & Stassen, H. H. (1999). Suicide risk in patients with major depressive disorder. The Journal of Clinical Psychiatry, 60(Suppl 2), 57–62.