Профессия Data Scientist: чем занимается, какие навыки нужны и как учиться

Профессия Data Scientist: чем занимается, какие навыки нужны и как учиться Полезное

Data Scientist (дата-сайентист, специалист по Data Science) — это специалист, который превращает бизнес-вопрос в задачу на данных, строит статистическую или ML-модель и проверяет, приносит ли она пользу в реальном процессе. Сама Data Science — область на стыке статистики, программирования и предметной экспертизы; профессия — одна из ролей внутри нее.

Эта статья — о профессии и пути в нее: чем дата-сайентист занят в течение рабочего цикла, чем роль отличается от соседних, какие навыки нужны и как выстроить обучение до первого портфолио. Туториал по первым шагам анализа данных вынесен в отдельный материал: Введение в Data Science: с чего начать анализ данных.

Чем занимается Data Scientist

Работа строится циклом, а не линейной цепочкой: на любом шаге можно вернуться назад, если данные оказались не теми или модель не дает эффекта.

  1. Постановка задачи. Перевести вопрос бизнеса («почему уходят клиенты?») в измеримую задачу: что предсказываем, на каком горизонте, какой метрикой меряем успех и что будет считаться провалом.
  2. Данные. Найти источники, выгрузить через SQL, разобраться с пропусками, дублями и ошибками сбора. На этот этап часто уходит заметная часть времени.
  3. Исследование. Посмотреть распределения, связи, выбросы, проверить гипотезы статистикой.
  4. Модель. Сначала простой ориентир (baseline), затем модели сложнее — и только если они реально лучше ориентира.
  5. Проверка эффекта. Офлайн-метрики на отложенной выборке, затем, где возможно, A/B-тест в продукте.
  6. Передача в работу и объяснение. Отчет, дашборд или сервис; объяснить заказчику, что модель умеет и где ошибается.

Где это применяется: ритейл (прогноз спроса), банки (скоринг, антифрод), промышленность (прогноз отказов), медицина (поддержка решения врача, не замена диагноза), онлайн-сервисы (отток, рекомендации).

Data Scientist, аналитик данных и ML-инженер

Три роли часто путают: они работают с одними данными. Разводим их по главному вопросу.

Роль Главный вопрос Типичный результат Ключевые инструменты
Аналитик данных Что произошло и почему? Отчет, дашборд, ответ на вопрос бизнеса SQL, Excel/BI, Python/pandas, статистика
Data Scientist Что произойдет и как на это повлиять? Модель, эксперимент, оценка эффекта Python, SQL, статистика, scikit-learn, градиентный бустинг
ML-инженер Как модель стабильно работает в продукте? Сервис, пайплайн обучения, мониторинг Python, Docker, CI/CD, MLOps-инструменты, облака

Упрощение: границы между ролями зависят от компании. В небольшой команде один человек может делать все три работы, а в крупной внутри Data Science бывают узкие специализации — компьютерное зрение, NLP, рекомендательные системы, работа с LLM. Поэтому при выборе вакансии смотрите на список задач, а не только на название должности.

Есть и соседние роли: дата-инженер строит хранилища и потоки данных (без него дата-сайентисту нечего анализировать), продуктовый аналитик сфокусирован на метриках продукта и A/B-тестах.

Какие навыки нужны

Навыки удобно разделить на три слоя. Первый нужен для первой работы, остальные достраиваются по мере роста.

Фундамент (для junior):
— Python на уверенном уровне: функции, структуры данных, работа с файлами, библиотеки pandas, NumPy, matplotlib или seaborn.
— SQL: выборки, JOIN, группировки, оконные функции — данные почти всегда лежат в базе.
— Статистика и теория вероятностей: распределения, доверительные интервалы, проверка гипотез, ошибки I и II рода.
— Основы машинного обучения: обучение с учителем и без, переобучение, кросс-валидация, метрики качества.

Инструменты рабочей среды: Jupyter, Git, виртуальные окружения, базовая работа в Linux-терминале.

Рост (middle и выше): линейная алгебра и оптимизация на уровне понимания моделей, градиентный бустинг, основы глубокого обучения (PyTorch), дизайн экспериментов, работа с большими данными (Spark), основы вывода модели в продакшн.

Отдельно — навыки, заметные на собеседовании: задать уточняющий вопрос заказчику, объяснить результат без формул, честно сказать «модель здесь не поможет». Английский нужен для документации и статей.

Главная привычка профессии: сравнивать с ориентиром

Разницу между «запустил модель» и «решил задачу» покажет маленький пример — учебная задача оттока: 20 клиентов, признак — сколько дней клиент не заходил в приложение. Код на чистом Python, без библиотек, запускается в Python 3.14.

# Отток клиентов: 1 - ушел, 0 - остался. Признак - дней без входа в приложение.
days_inactive = [2, 40, 5, 1, 35, 3, 8, 50, 4, 6, 2, 45, 7, 1, 3, 9, 30, 2, 5, 4]
churned       = [0,  1, 0, 0,  0, 0, 0,  1, 0, 0, 0,  1, 0, 0, 0, 0,  1, 0, 0, 0]

def accuracy(pred, true):
    return sum(p == t for p, t in zip(pred, true)) / len(true)

def recall(pred, true):
    hits = sum(p == 1 and t == 1 for p, t in zip(pred, true))
    return hits / sum(true)

baseline = [0] * len(churned)                        # "никто не уйдет"
rule = [1 if d >= 30 else 0 for d in days_inactive]  # простое правило

print(f"baseline: accuracy={accuracy(baseline, churned):.2f}, recall={recall(baseline, churned):.2f}")
print(f"rule>=30: accuracy={accuracy(rule, churned):.2f}, recall={recall(rule, churned):.2f}")

В консоли появится:

baseline: accuracy=0.80, recall=0.00
rule>=30: accuracy=0.95, recall=1.00

Что здесь важно для профессии, а не для синтаксиса:

  • Accuracy обманывает при несбалансированных классах. Прогноз «никто не уйдет» верен в 80% случаев, но не находит ни одного уходящего клиента — recall равен нулю. Метрику выбирают под задачу, а не по привычке.
  • Сначала ориентир, потом сложность. Правило в одну строку уже дает recall 1.00; нейросеть имеет смысл, только если заметно лучше такого правила на новых данных.
  • Граница примера. Метрики посчитаны на тех же 20 клиентах, по которым подобран порог 30 дней. В реальной работе порог подбирают на обучающей части, а качество меряют на отложенной выборке — иначе оценка завышена.

Как учиться: дорожная карта до портфолио

Разумный горизонт для человека без опыта программирования — от года и больше при регулярных занятиях; с опытом разработки или аналитики путь короче. Точный срок зависит от стартовой базы и часов в неделю, поэтому ориентируйтесь на артефакты, а не на даты.

  1. Python и SQL. Артефакт: скрипт, который выгружает данные из учебной базы и считает сводку.
  2. Статистика на практике. Артефакт: разбор A/B-теста на открытых данных с проверкой гипотезы и выводом, понятным не-специалисту. Базу по теме дает статья о статистической значимости.
  3. Исследование данных. Артефакт: ноутбук с разведочным анализом одного датасета — вопросы, графики, выводы.
  4. Классическое ML. Артефакт: модель с честной валидацией, сравнением с baseline и объяснением выбора метрики.
  5. Проект под домен. Артефакт: законченный проект в GitHub — от постановки задачи до вывода, с README, где описаны данные, метрика, результат и ограничения.
  6. Подготовка к первой работе. Два-три таких проекта, резюме под конкретные вакансии, повторение SQL и статистики к собеседованиям.

Форматы обучения можно комбинировать:

Формат Сильная сторона Риск
Вуз (математика, прикладная информатика, профильные магистратуры) Глубокая математическая база Долго, практика с реальными данными бывает ограничена
Самообучение Бесплатно, в своем темпе Пробелы в базе, нет обратной связи по проектам
Курсы Структура, дедлайны, ревью от практиков Результат зависит от собственных часов практики

Если не получается

  • Симптом: застрял на математике. Не учите ее отдельно впрок — берите тему под конкретную задачу (гипотезы под A/B-тест, производные под градиентный спуск).
  • Симптом: прошел много курсов, но проектов нет. Остановите новые курсы, доведите один проект до README и публикации.
  • Симптом: модель на учебных данных отличная, на новых — плохая. Почти наверняка переобучение или утечка данных: проверьте, не попали ли признаки из будущего в обучение.
  • Симптом: не зовут на собеседования. Сравните резюме с требованиями вакансий: часто не хватает SQL и одного проекта, близкого к бизнес-задаче.

Спрос и зарплаты

Data Science остается востребованным направлением, но вход для джунов конкурентный: работодатели чаще ждут не сертификат, а проекты и уверенный SQL. Зарплаты сильно зависят от грейда, региона, отрасли и специализации, поэтому ориентироваться лучше на свежие вилки в открытых вакансиях и регулярные зарплатные исследования, а не на усредненные цифры из статей.

Выводы

  • Data Scientist переводит бизнес-вопрос в задачу на данных, строит модель и проверяет ее эффект; работа идет циклом, а не линейно.
  • От аналитика данных роль отличается фокусом на прогнозе и влиянии, от ML-инженера — фокусом на модели и эксперименте, а не на ее эксплуатации.
  • Фундамент для старта — Python, SQL, статистика и основы ML; остальное достраивается по мере роста.
  • Ключевая профессиональная привычка — сравнивать модель с простым ориентиром и выбирать метрику под задачу.
  • Путь в профессию меряется артефактами: два-три законченных проекта важнее числа пройденных курсов.

Где применяется / связь с практикой

Освойте тему на практике

Первый практический шаг на этом пути — уверенная работа с данными на Python: загрузка, очистка, исследование и визуализация. Этот слой закрывает курс «Python для анализа данных», после которого удобно переходить к машинному обучению. Чтобы понять, как работают практики и какие задачи встречаются в реальных командах, можно начать с бесплатных открытых уроков Otus.

FAQ

Можно ли стать Data Scientist без высшего математического образования?
Да, диплом не обязателен, но базу статистики, теории вероятностей и линейной алгебры придется освоить — без нее модели превращаются в черный ящик.

Нужно ли знать R, если есть Python?
Для старта достаточно Python: он основной язык в большинстве вакансий. R встречается в биостатистике и академических исследованиях.

Заменят ли LLM дата-сайентистов?
LLM ускоряют написание кода и черновой анализ, но постановка задачи, выбор метрики, проверка данных и ответственность за вывод остаются за специалистом.

OTUS Журнал