Data Science (наука о данных) простыми словами — это умение по накопленным данным отвечать на практические вопросы: что, скорее всего, будет дальше, к какой группе отнести объект (спам или не спам), сработало ли изменение — и проверять, насколько этому ответу можно верить. Data Scientist (дата-сайентист) — человек, который делает это профессионально: превращает вопрос бизнеса в задачу на данных, строит прогноз или модель и доказывает цифрами, что она работает лучше простого правила.
Содержание
- Три слова, которые путают
- На что похожа эта работа
- Где вы уже встречали работу дата-сайентиста
- Один вопрос — четыре роли
- Как это выглядит на практике: прогноз для кофейни
- Чем Data Scientist не занимается
- Подходит ли вам профессия
- Как войти в профессию: коротко
- Выводы
- Где применяется / связь с практикой
- FAQ
Ниже — объяснение без формул: на что похожа эта работа, чем она отличается от соседних ролей и как понять, подходит ли профессия вам.
Три слова, которые путают
Прежде чем объяснять, стоит развести три понятия — их часто называют одним словом «дата сайнс»:
- Data Science — область знаний и практики: статистика, программирование и знание предметной области вместе.
- Data Scientist — профессия, роль в команде.
- Модель — результат работы: правило или программа, которая по входным данным выдает прогноз (купит / не купит, сколько продадим завтра).
Машинное обучение — один из инструментов Data Science, но не вся она целиком: часть задач решается статистикой, экспериментом или простым правилом без всякого ML.
На что похожа эта работа
Ближайшая бытовая аналогия — синоптик. Он не знает будущего, но по наблюдениям за прошлые годы говорит: «завтра дождь с вероятностью 70%». Потом погода наступает, и видно, насколько прогноз был хорош. Хороший синоптик следит за своей ошибкой и улучшает метод.
Дата-сайентист работает так же, только вместо погоды — продажи, клики, платежи, поломки оборудования. Аналогия упрощенная: в отличие от синоптика, дата-сайентист часто сам решает, какие данные собрать, и может повлиять на результат (например, предложить скидку клиенту, который вот-вот уйдет).
Где вы уже встречали работу дата-сайентиста
| Что видите вы | Что предсказывает модель | Цена ошибки |
|---|---|---|
| Лента рекомендаций в видеосервисе | Какой ролик вы досмотрите | Скучная лента, пользователь уходит |
| Письмо попало в «Спам» | Вероятность, что письмо — спам | Нужное письмо потерялось |
| Банк попросил подтвердить покупку | Похожа ли операция на мошенническую | Лишний звонок или украденные деньги |
| Время доставки в приложении | Сколько минут займет заказ | Опоздание и недовольный клиент |
| Полки магазина не пустеют | Сколько товара продастся на неделе | Пустая полка или списания |
Последняя колонка — ключ к профессии. Модель на реальных данных почти всегда где-то ошибается, вопрос в том, какая ошибка дороже. Решить это дата-сайентист не может в одиночку: цену ошибки задает бизнес.
Один вопрос — четыре роли
Возьмем кофейню. Владелец спрашивает: «Сколько молока заказывать на следующую неделю?». Вот как на этот вопрос смотрят разные специалисты по данным.
| Роль | Что делает с вопросом | Результат |
|---|---|---|
| Дата-инженер | Собирает чеки из кассы в одну таблицу, следит, чтобы данные приходили каждый день | Надежный источник данных |
| Аналитик данных | Смотрит, сколько продали за прошлые недели, в какие дни больше | Отчет или дашборд: что было |
| Data Scientist | Строит прогноз продаж на неделю вперед и проверяет его ошибку | Прогноз и оценка, насколько ему можно верить |
| ML-инженер | Встраивает прогноз в систему заказов, чтобы он обновлялся сам и не ломался | Работающий сервис |
Упрощение: в небольшой компании все четыре роли может выполнять один человек, а граница «аналитик смотрит назад, дата-сайентист — вперед» условна: аналитики тоже строят прогнозы, обычно более простые.
Как это выглядит на практике: прогноз для кофейни
Ниже минимальный рабочий пример на чистом Python, без библиотек. Есть продажи кофе за четыре недели; молоко потом пересчитывают из прогноза чашек по рецептуре. Первые три недели — «прошлое», по ним строим прогноз. Четвертую делаем вид, что не знаем, и сравниваем с ней прогноз. Проверено в Python 3.14.
# Продажи кофе (чашек в день) за 4 недели, с понедельника по воскресенье.
sales = [
120, 115, 118, 122, 140, 190, 210, # неделя 1
118, 121, 116, 125, 145, 185, 205, # неделя 2
122, 119, 120, 128, 150, 195, 215, # неделя 3
125, 120, 123, 130, 148, 200, 220, # неделя 4 - ее "не видим", проверяем прогноз
]
train, test = sales[:21], sales[21:]
def mae(pred, true):
"""Средняя ошибка прогноза в чашках."""
return sum(abs(p - t) for p, t in zip(pred, true)) / len(true)
# Прогноз 1: "завтра будет как в последний известный день".
naive = [train[-1]] * 7
# Прогноз 2: среднее по тому же дню недели за три прошлые недели.
by_weekday = [round(sum(train[d::7]) / 3) for d in range(7)]
print("прогноз 'последний день':", naive, "ошибка:", round(mae(naive, test), 1))
print("прогноз 'по дню недели': ", by_weekday, "ошибка:", round(mae(by_weekday, test), 1))
print("факт недели 4: ", test)
В консоли появится:
прогноз 'последний день': [215, 215, 215, 215, 215, 215, 215] ошибка: 64.1
прогноз 'по дню недели': [120, 118, 118, 125, 145, 190, 210] ошибка: 5.7
факт недели 4: [125, 120, 123, 130, 148, 200, 220]
Что в этом примере от профессии, а не от программирования:
- Проверка на данных, которых прогноз не видел. Четвертая неделя отложена заранее. Если проверять прогноз на тех же днях, по которым он построен, ошибка выйдет заниженной, и вы будете слишком уверены в модели.
- Понимание предметной области. Прогноз «как в последний известный день» ошибается в среднем на 64 чашки, потому что последним известным днем было воскресенье, а в будни покупают меньше. Одна идея «продажи зависят от дня недели» сократила ошибку до 5.7 чашки.
- Ошибка в одну сторону — подсказка. Во все дни четвертой недели прогноз ниже факта: продажи понемногу растут. Следующий шаг — учесть тренд. Так и выглядит работа: гипотеза, проверка, новая гипотеза.
Граница примера: 28 дней — игрушечный объем, праздники, погода и акции не учтены. В реальной работе данных больше, прогноз проверяют на нескольких отложенных периодах, и только если простые правила перестают помогать, переходят к ML-моделям.
Чем Data Scientist не занимается
Вокруг профессии много ожиданий, которые расходятся с практикой:
- Не только нейросети. Значительная часть задач решается таблицами, статистикой и классическими моделями. Сложная модель нужна, только если она заметно лучше простой на новых данных.
- Не гадание и не «магия ИИ». Прогноз без оценки ошибки в профессии не считается готовым результатом. Если данные не содержат ответа, честный вывод — «модель здесь не поможет».
- Не работа в одиночку. Постановку задачи дает бизнес, данные готовят инженеры, внедрение делают разработчики. Умение объяснить результат без формул ценится не меньше кода.
Подходит ли вам профессия
Проверочные вопросы вместо теста «на склонности»:
- Нравится ли разбираться, почему цифры получились именно такими, а не просто их получать?
- Готовы ли вы к тому, что многие гипотезы не подтвердятся, и это нормальный результат?
- Интересна ли вам хотя бы одна предметная область — торговля, медицина, финансы, игры, логистика?
- Готовы ли подтянуть школьную и вузовскую математику: вероятности, статистику, основы линейной алгебры?
Если на первые два вопроса ответ «нет», профессия может разочаровать, даже если нравится программирование: ближе окажется разработка. Если на первые три вопроса ответ «да», а четвертый пугает, начать можно с аналитики данных и двигаться дальше.
Как войти в профессию: коротко
Путь удобно мерить готовыми работами, а не пройденными уроками:
- Python и SQL. Результат: скрипт, который выгружает данные из учебной базы и считает сводку.
- Статистика на практике. Результат: разбор эксперимента (A/B-теста) на открытых данных с выводом, понятным не-специалисту.
- Первая модель с честной проверкой. Результат: проект, где модель сравнивается с простым правилом на отложенных данных, как в примере с кофейней.
- Портфолио. Два-три законченных проекта с описанием задачи, данных, метрики и ограничений.
Подробная дорожная карта с навыками по уровням и форматами обучения — в статье о профессии Data Scientist и пути обучения, а практический старт с анализом первого датасета — во введении в Data Science.
Если не получается
- Много теории, но непонятно, что делать с реальной таблицей. Возьмите один открытый датасет и задайте к нему один вопрос, как «сколько молока заказать».
- Модель «отлично» работает, а на новых данных — плохо. Проверьте, не проверяли ли вы ее на тех же данных, на которых строили, и не попали ли в признаки сведения из будущего.
Спрос на специалистов по данным держится, но вход для новичков конкурентный: работодатели смотрят на проекты и уверенный SQL больше, чем на сертификаты. Зарплаты сильно зависят от уровня, города и отрасли, поэтому ориентироваться лучше на актуальные вакансии в своем регионе.
Выводы
- Data Science простыми словами — ответы на вопросы по данным (чаще всего прогноз) плюс честная проверка, насколько им можно верить; Data Scientist — профессия, которая делает это для бизнеса.
- Модель почти всегда где-то ошибается; работа дата-сайентиста — выбрать, какая ошибка допустима, и доказать, что модель лучше простого правила.
- Дата-инженер готовит данные, аналитик объясняет прошлое, дата-сайентист строит и проверяет прогноз, ML-инженер делает из него работающий сервис; в маленьких командах роли совмещают.
- Понимание предметной области часто дает больше, чем сложный алгоритм: в примере с кофейней учет дня недели снизил ошибку с 64 до 5.7 чашки.
- Вход в профессию измеряется готовыми проектами с отложенной проверкой, а не числом курсов.
Где применяется / связь с практикой
Освойте тему на практике
Пример с кофейней — первый шаг к тому, чем занимаются на работе: дальше идут настоящие данные, библиотеки pandas и scikit-learn, модели классификации и регрессии, выбор метрики и кросс-валидация. Этот путь от простого правила к модели машинного обучения с честной оценкой качества проходят на курсе по основам машинного обучения.
Освойте тему на практике
Чтобы понять, интересна ли вам профессия, до выбора длинной программы, можно послушать практиков на открытых уроках Otus — там разбирают живые задачи по данным и ML.
FAQ
Можно ли стать Data Scientist после гуманитарного образования?
Да, но придется последовательно закрыть математику (вероятности, статистику) и программирование. Знание гуманитарной области бывает преимуществом в задачах с текстами и исследованиями поведения.
Чем Data Science отличается от искусственного интеллекта?
ИИ — широкая область о системах, решающих интеллектуальные задачи; Data Science — о выводах и прогнозах из данных. Они пересекаются через машинное обучение, но не совпадают.
Нужно ли дата-сайентисту уметь пользоваться нейросетями-ассистентами?
Они ускоряют написание кода и черновой анализ, но постановка задачи, проверка данных и ответственность за вывод остаются за специалистом.



