Как ИИ-программа НИУ ВШЭ и БГУ усилить ВКР по искусственному интеллекту и машинному обучению
Поддомен: AI/ML
Роль: Data/ML-инженер
Семантический анализ (выполнен):
- Primary keyword: ВКР по машинному обучению с применением ИИ
- LSI-запросы: PyTorch, Scikit-learn, метрики качества модели, архитектура нейросети, валидация модели, кросс-валидация, feature engineering, pipeline ML, AUC-ROC, F1-score
- Вопросы студентов:
- Как показать практическую значимость модели в ВКР, если данных нет?
- Какие метрики считать, чтобы комиссия не придралась?
- Можно ли использовать предобученные модели и не будет ли это плагиатом?
- Как оформить схему обучения модели по ГОСТ?
- Как доказать, что моя модель лучше базовой?
- Ключевые сущности: ГОСТ 34.19-2021 (оформление схем), ISO/IEC 25010 (качество ПО), OWASP (безопасность данных), OpenTelemetry (мониторинг), метрики F1, AUC-ROC
Введение: почему совместная программа ВШЭ и БГУ — шанс усилить ваш диплом
В марте 2026 года НИУ ВШЭ и БГУ запустили совместную ИТ-программу с акцентом на искусственный интеллект — при поддержке Правительства Бурятии. Это не просто новость: это сигнал рынку и вузам, что ИИ-решения в регионах становятся приоритетом. Для вас, как выпускника технического направления, это возможность привязать ВКР к реальному кейсу: подготовка кадров для цифровизации региональных систем — здравоохранения, образования, ЖКХ.
Если вы пишете ВКР в области ИИ или ML, не упустите шанс использовать этот тренд как основу для актуальности и практической значимости. Покажите, что вы не просто строите модель, а решаете задачу, которую сегодня ставят ведущие вузы и госорганы. Такая работа проходит нормоконтроль легче, а на защите вызывает уважение.
Темы ВКР: как превратить новость в дипломный проект
| Тема | Актуальность | Цель | Задачи | Структура ВКР |
|---|---|---|---|---|
| Разработка ML-модели для прогнозирования потребности в ИТ-специалистах в регионах | Прямая отсылка к инициативе ВШЭ и БГУ: подготовка кадров требует анализа спроса. Вы можете предложить инструмент для планирования образовательных программ. | Построить модель, предсказывающую дефицит ИТ-специалистов в субъектах РФ на 1–3 года вперёд. |
1. Собрать и очистить данные по вакансиям (HH API, SuperJob). 2. Провести feature engineering: уровень цифровизации, выпуск студентов, миграция. 3. Обучить модель (Random Forest, XGBoost). 4. Оценить точность и визуализировать прогноз. |
Гл. 1 — Анализ методов прогнозирования кадрового спроса. Гл. 2 — Проектирование и реализация модели. Гл. 3 — Тестирование, метрики, внедрение (макет в Streamlit). |
| Система рекомендаций образовательных траекторий на основе ИИ | Совместная программа — пример межвузовской интеграции. Ваша система может помогать абитуриентам выбирать направления, как ВШЭ и БГУ предлагают совместные треки. | Создать рекомендательную систему для абитуриентов на основе интересов, навыков и рынка труда. |
1. Собрать данные по программам вузов (открытые источники). 2. Реализовать коллаборативную фильтрацию или content-based подход. 3. Добавить веса по востребованности профессий (по hh.ru). 4. Разработать веб-интерфейс. |
Гл. 1 — Анализ рекомендательных систем в образовании. Гл. 2 — Архитектура и реализация. Гл. 3 — Оценка качества (precision@k, recall@k), юзабилити-тесты. |
| Оценка качества совместных образовательных программ с помощью NLP | Как измерить эффективность таких программ, как у ВШЭ и БГУ? Ваша модель может анализировать отзывы студентов, статьи, СМИ. | Автоматизировать оценку восприятия совместных программ с помощью анализа тональности. |
1. Собрать корпус текстов (отзывы, форумы, пресса). 2. Дообучить BERT для русского языка (DeepPavlov, Transformers). 3. Построить дашборд с динамикой тональности. 4. Сравнить с официальными метриками (трудоустройство, рейтинги). |
Гл. 1 — Методы анализа текстов в образовании. Гл. 2 — Обучение и инференс модели. Гл. 3 — Валидация, интерпретация, интеграция в BI. |
Основная часть: как вписать кейс в структуру ВКР
Глава 1: Теоретическая база и анализ — не просто обзор, а аргументация
Не пишите «обзор методов ML». Покажите, почему вы выбрали именно Random Forest, а не нейросеть. Свяжите с задачей: «Для прогнозирования кадрового спроса важна интерпретируемость — поэтому выбраны ансамбли деревьев (Breiman, 2001), а не "чёрные ящики"».
Используйте диаграмму C4 для архитектуры системы:
[Пользователь] --> [Веб-интерфейс (Streamlit)]
[Веб-интерфейс] --> [ML-модель (XGBoost)]
[ML-модель] --> [База данных (SQLite/PostgreSQL)]
[ML-модель] --> [API (FastAPI)]
[API] --> [HH.ru / SuperJob (через парсинг)]
Оформите по ГОСТ 34.19-2021: подпись, номер, пояснения. Не забудьте про источник данных — это критично для нормоконтроля.
Глава 2: Проектирование и реализация — покажите процесс, а не только результат
Раздел «Реализация» должен быть техническим. Пример:
import pandas as pd
from sklearn.ensemble import RandomForestRegressor
from sklearn.model_selection import train_test_split
from sklearn.metrics import mean_absolute_error
# Загрузка данных
df = pd.read_csv('regional_demand.csv')
X = df[['digital_index', 'graduates_count', 'migration_rate']]
y = df['it_jobs_growth']
# Разделение
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)
# Обучение
model = RandomForestRegressor(n_estimators=100)
model.fit(X_train, y_train)
# Оценка
pred = model.predict(X_test)
mae = mean_absolute_error(y_test, pred)
print(f"MAE: {mae:.2f}")
Включите этот код в приложение. В тексте — объясните выбор метрики: MAE понятна заказчику (в отличие от RMSE), а R² покажет объяснённую дисперсию.
Глава 3: Тестирование и эффективность — докажите, что модель работает
Не ограничивайтесь «модель обучена». Проведите сравнение с baseline: например, с наивным прогнозом (среднее за прошлые годы). Используйте кросс-валидацию (5 фолдов) — это покажет стабильность.
Метрики для разных задач:
- Классификация: F1-score (если дисбаланс), AUC-ROC (качество ранжирования)
- Регрессия: MAE, RMSE, R²
- Рекомендации: precision@k, recall@k
Добавьте таблицу сравнения:
| Модель | MAE | R² | Время обучения |
|---|---|---|---|
| Наивная (среднее) | 12.4 | 0.00 | 0.1 с |
| Линейная регрессия | 9.8 | 0.32 | 0.5 с |
| Random Forest | 6.1 | 0.67 | 12 с |
Вывод: «Предложенная модель сократила ошибку на 51% по сравнению с baseline, что подтверждает её применимость для прогнозирования».
Чему вы научитесь
Работая над таким проектом, вы освоите:
- Проектирование ML-пайплайна от данных до интерфейса
- Оформление архитектурных диаграмм по ГОСТ
- Подбор и расчёт метрик качества моделей
- Интеграцию модели в веб-приложение (Streamlit, FastAPI)
- Сравнение эффективности с baseline и интерпретацию результатов
Типичные ошибки студентов
Ошибка 1: Нет baseline-модели. Без сравнения с простым алгоритмом (например, средним значением) вы не можете доказать, что ваша модель работает. Решение: всегда включайте наивный прогноз.
Ошибка 2: Код в тексте главы. Длинные фрагменты кода ломают повествование. Решение: выносите в приложение, в тексте — только ключевые фрагменты с пояснением.
Ошибка 3: Игнорирование ГОСТ 34.19. Схемы без подписей, номеров, пояснений не пройдут нормоконтроль. Решение: используйте шаблоны из вашего вуза или стандартные образцы.
FAQ: ответы на частые вопросы
Можно ли использовать предобученные модели (например, BERT)? Это не будет плагиатом?
Нет, это не плагиат. Использование предобученных моделей — стандартная практика (transfer learning). Главное — указать источник (например, «модель DeepPavlov BERT-base) и описать дообучение. Это даже плюс: вы показываете, что умеете работать с современными инструментами.
Какие требования к коду в ВКР? Нужно ли заливать репозиторий?
Код должен быть в приложении, читаемым, с комментариями. Репозиторий на GitHub — не обязателен, но желателен. Некоторые вузы просят ссылку. Уточните у научрука. Главное — чтобы код соответствовал описанию в работе.
Как доказать, что модель эффективна, если данных мало?
Используйте синтетические данные (например, make_classification из sklearn) или открытые датасеты (Kaggle, UCI). Главное — честно указать источник. Можно провести анализ чувствительности: как модель ведёт себя при разных объёмах данных.
Как оформить схему обучения модели?
Используйте диаграмму последовательности (UML) или блок-схему. Пример: «[Данные] → [Очистка] → [Нормализация] → [Обучение] → [Оценка]». Подпишите по ГОСТ 34.19: «Рисунок 2.1 — Схема процесса обучения модели».
Чек-лист «Что проверить перед сдачей»
- Все ссылки на источники данных и модели указаны
- Цель и задачи соответствуют выводам
- Схемы подписаны по ГОСТ 34.19
- Метрики качества рассчитаны и интерпретированы
- Код вынесен в приложение, в тексте — только фрагменты
- Уникальность > 70% (без переписывания кода)
- Приложения: код, данные (описание), инструкция по запуску
Бесплатная консультация по ВКР
Если вы сомневаетесь в выборе темы, стека или боитесь ошибиться в метриках — наши специалисты помогут. Более 120 часов консультаций уже проведено для студентов ИТ-направлений. Поможем с любой темой: от идеи до защиты. Без спама, только по делу.
Источник: НИУ ВШЭ и БГУ запускают совместную ИТ-программу при поддержке Правительства Бурятии (опубликовано 2026-03-31)