Автофагия синтетических данных: экологический предел эволюции генеративного искусственного интеллекта
Аннотация
В статье предлагается концептуальная реконструкция феномена автофагии синтетических данных как системного экологического предела развития генеративного искусственного интеллекта (GenAI). Исходной проблемой выступают исчерпаемость высококачественных, порожденных человеком данных и нарастающее загрязнение обучающих корпусов текстами, изображениями и иными артефактами, созданными самими моделями. Показано, что рекурсивное обучение на синтетических генерациях приводит не только к количественному снижению качества моделей, но и к качественной деградации их репрезентаций: утрате редких семантических элементов, сужению распределения, гомогенизации ответов и ослаблению способности к порождению нетривиальных высказываний. Выделено три уровня экологического предела GenAI: ресурсный, связанный с ограниченностью доступного человеческого корпуса; репрезентационный, проявляющийся в потере редких элементов распределения; эволюционный, выраженный в нарушении законов масштабирования (роста числа параметров) моделей. Обосновывается, что синтетические данные не являются нейтральным расширением обучающей среды, поскольку воспроизводят и усиливают смещения, ошибки и ограничения моделей предыдущих поколений. Тем самым автофагия синтетических данных интерпретируется как форма эпистемической замкнутости, при которой система начинает воспроизводить не внешний мир, а собственные статистические следы. В философском плане автофагия рассмотрена как симптом исчерпанности парадигмы самообучения и как основание для критики метафоры автономной эволюции GenAI. В качестве альтернативы обсуждаются стратегии сохранения открытости обучающих контуров: активный отбор данных, заземление в интерактивных средах и коэволюция человека и искусственного интеллекта. Сделан вывод о необходимости формирования эпистемической экологии GenAI как дисциплины, изучающей условия устойчивого сосуществования человеческих и искусственных когнитивных систем.
Об авторе
Сергей Федорович СергеевРоссия
Сергеев Сергей Федорович – доктор психологических наук, профессор, профессор кафедры информационных систем в искусстве и гуманитарных науках факультета искусств Санкт-Петербургского государственного университета; заведующий научно-исследовательской лабораторией «Эргономика сложных систем» Санкт-Петербургского политехнического университета Петра Великого.
Санкт-Петербург
Список литературы
1. Дубровский, Сергеев 2023 – Дубровский Д.И., Сергеев С.Ф. Методологические проблемы оценки генеративного искусственного интеллекта // Искусственный интеллект. Теория и практика. 2023. № 3 (3). С. 2–10.
2. Коломейцев 2020 – Коломейцев И.В. Экосистемные модели глобального мира в докладах Римского клуба // Социология. 2020. № 2. С. 351–361.
3. Сергеев 2012 – Сергеев С.Ф. Проблема интеллектных симбионтов в техногенных образовательных средах // Образовательные технологии. 2012. № 3. С. 36–50.
4. Сергеев 2013a – Сергеев С.Ф. Интеллектные симбионты в эргатических системах // Научно-технический вестник информационных технологий, механики и оптики. 2013. № 2 (84). С. 149–154.
5. Сергеев 2013б – Сергеев С.Ф. Интеллектные симбионты организованных техногенных средств управления подвижными объектами // Мехатроника, автоматизация, управление. 2013. № 9. С. 30–36.
6. Сергеев 2021 – Сергеев С.Ф. Интеллектный техносимбиоз в сложных человеко-машинных системах // Эргодизайн. 2021. № 1 (11). С. 70–76.
7. Bender, Koller 2020 – Bender E.M., Koller A. Climbing towards NLU: On Meaning, Form, and Understanding in the Age of Data // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020. P. 5185–5198. – URL: https://aclanthology.org/2020.acl-main.463/.
8. Dohmatob et al. 2025 – Dohmatob E., Feng Y., Subramonian A., Kempe J. Strong Model Collapse // International Conference on Learning Representations. 2025. P. 15656–15691. arXiv:2410.04840.
9. Fodor, Pylyshyn 1988 – Fodor J.A., Pylyshyn Z.W. Connectionism and Cognitive Architecture: A Critical Analysis // Cognition. 1988. Vol. 28. No. 1–2. P. 3–71.
10. Gambetta et al. 2025 – Gambetta D., Gezici G., Giannotti F., Pedreschi D., Knott A., Pappalardo L. Characterizing Model Collapse in Large Language Models Using Semantic Networks and Next-Token Probability // arXiv preprint. 2025. arXiv:2410.12341.
11. Haenlein, Kaplan 2019 – Haenlein M., Kaplan A. A Brief History of Artificial Intelligence: On the Past, Present, and Future of Artificial Intelligence // California Management Review. 2019. Vol. 61. No. 4. P. 5–14.
12. Hoffmann et al. 2022 – Hoffmann J., Borgeaud S., Mensch A., Buchatskaya E., Cai T., Rutherford E., …, Sifre L. Training Compute-Optimal Large Language Models // Advances in Neural Information Processing Systems. 2022. Vol. 35. P. 30016–30030.
13. Holtzman et al. 2020 – Holtzman A., Buys J., Du L., Forbes M., Choi Y., Get P. The Curious Case of Neural Text Degeneration // Proceedings of International Conference on Learning Representations. 2020. arXiv:1904.09751.
14. Meadows et al. 1972 – Meadows D.H., Meadows D.L., Randers J., Behrens W.W. III. The Limits to Growth: A Report for the Club of Rome’s Project on the Predicament of Mankind. – New York: Universe Books, 1972.
15. Qin et al. 2025 – Qin Z., Dong Q., Zhang X., Dong L., Huang X., Yang Z., …, Wei F. Scaling Laws of Synthetic Data for Language Models // Conference on Language Modeling. 2025. arXiv:2503.19551.
16. Satharasi, Iyengar 2025 – Satharasi T., Iyengar S.S. Future of AI Models: A Computational Perspective on Model Collapse // arXiv preprint. 2025. arXiv:2511.05535.
17. Seddik et al. 2024 – Seddik M.E.A., Chen S.-W., Hayou S., Youssef P., Debbah M. How Bad Is Training on Synthetic Data? A Statistical Analysis of Language Model Collapse // First Conference on Language Modeling. 2024. arXiv:2404.05090.
18. Searle 1980 – Searle J.R. Minds, Brains, and Programs // Behavioral and Brain Sciences. 1980. Vol. 3. No. 3. P. 417–424.
19. Shumailov et al. 2024 – Shumailov I., Shumaylov Z., Zhao Y., Papernot N., Anderson R., Gal Y. AI Models Collapse When Trained on Recursively Generated Data // Nature. 2024. Vol. 631. P. 755–759.
20. Villalobos et al. 2024 – Villalobos P., Ho A., Sevilla J., Besiroglu T., Heim L., Hobbhahn M. Position: Will We Run Out of Data? Limits of LLM Scaling Based on Human-Generated Data // Proceedings of the 41st International Conference on Machine Learning. 2024. Vol. 235. P. 49523–49544. arXiv:2211.04325.
21. Wu, Papyan 2024 – Wu R., Papyan V. Linguistic Collapse: Neural Collapse in (Large) Language Models // Advances in Neural Information Processing Systems. 2024. Vol. 37. P. 137432–137473.
22. Zhu et al. 2025 – Zhu X., Cheng D., Li H., Zhang K., Hua E., Lv X., …, Zhou B. How to Synthesize Text Data without Model Collapse? // Proceedings of the 42nd International Conference on Machine Learning. 2025. Vol. 267. P. 79746–79771. arXiv:2412.14689.
Рецензия
Для цитирования:
Сергеев С.Ф. Автофагия синтетических данных: экологический предел эволюции генеративного искусственного интеллекта. Философские науки. 2026;69(1).
For citation:
Sergeev S.F. Synthetic Data Autophagy: The Ecological Limit of Generative Artificial Intelligence Evolution. Russian Journal of Philosophical Sciences. 2026;69(1). (In Russ.)
































