Компьютерное зрение (computer vision, CV) — область искусственного интеллекта, в которой программа получает изображение или видео и делает вывод о его содержимом: что или кто в кадре, где находится объект, что происходит. Ключевой признак — на выходе не новая картинка, а понимание: метка, координаты, текст, число, событие.
Содержание
- Разбор теста: почему подходит только распознавание лиц
- Короткий словарь: четыре термина, которые путают
- Минимальный пример: одна картинка, две разные операции
- Какие задачи решает компьютерное зрение
- 6 областей, где применяется компьютерное зрение
- Где компьютерное зрение ошибается
- Выводы
- Где применяется / связь с практикой
- FAQ
Отсюда ответ на тестовый вопрос «какой из примеров относится к компьютерному зрению». В ИТ-диктанте сентября 2025 года варианты такие: программа, которая распознает лица на фотографии; плеер, который увеличивает громкость музыки; калькулятор, который складывает числа; браузер, который открывает сайты. Верный ответ — программа, которая распознает лица: только она анализирует содержимое изображения. Плеер обрабатывает звук, калькулятор — числа, браузер загружает и показывает страницы, картинки никто из них не понимает.
В других версиях теста дистракторы сложнее, и там нужен уже критерий «вход — выход»:
- программа, которая распознает лица на фотографии или анализирует видеопоток, — да, это компьютерное зрение: она извлекает из кадра смысл (чье лицо, что происходит);
- нейросеть, которая генерирует изображения с котятами, — нет: это генеративная модель, она создает картинку, а не анализирует существующую;
- алгоритм, который убирает шум, корректирует баланс белого и повышает резкость, — нет: это обработка изображений, фото на входе и улучшенное фото на выходе, содержимое кадра программа не распознает;
- сайт с капчей на распознавание предметов — нет: предметы распознает человек, а капча проверяет, что перед ней не бот.
Ниже — как отличать такие случаи по одному критерию, какие задачи решает CV и шесть областей, где оно работает в 2026 году.
Разбор теста: почему подходит только распознавание лиц
Вариант с плеером, калькулятором и браузером решается сразу: там нет изображения на входе. Сложные версии тестов проверяют другое различие: анализ содержимого против изменения или создания картинки. Удобно свести варианты в таблицу.
| Вариант | Что на входе | Что на выходе | Как это называется | CV? |
|---|---|---|---|---|
| Распознавание лиц, анализ видеопотока | Фото, видео | Имя, координаты лица, событие | Компьютерное зрение | Да |
| Генерация изображений с котятами | Текстовый запрос | Новая картинка | Генеративный ИИ | Нет |
| Шумоподавление, баланс белого, резкость | Фото | Исправленное фото | Обработка изображений | Нет |
| Капча «выберите все светофоры» | Картинка человеку | Ответ человека | Тест на человека (CAPTCHA) | Нет |
Две оговорки, чтобы не спорить с тестом в неправильную сторону. Первая: границы на практике размыты. Генеративные модели учатся на тех же данных и часто на тех же архитектурах, что и модели зрения, а шумоподавление в научной литературе иногда называют «низкоуровневым зрением». Но в формулировке теста главное — есть ли понимание сцены, и его нет ни у генератора котят, ни у фильтра резкости.
Вторая: с капчей связаны два разных процесса. Ответы людей на капчах могут использоваться как разметка для обучения моделей, а бот, который пытается решить такую капчу автоматически, сам применял бы компьютерное зрение. Но сайт с капчей как пример — это проверка человека, а не CV.
Короткий словарь: четыре термина, которые путают
- Обработка изображений (image processing) — преобразование картинки в картинку: фильтры, шумоподавление, сжатие, коррекция цвета. Часто служит подготовкой данных для CV.
- Компьютерное зрение — извлечение смысла из изображения: классы, объекты, их положение, текст, движение.
- Компьютерная графика и генеративный ИИ — создание изображения по описанию, модели сцены или запросу. Направление обратное зрению: от смысла к пикселям.
- Распознавание образов — более общее понятие про классификацию сигналов любой природы (звук, текст, изображения). Распознавание объектов на фото — его часть внутри CV.
Минимальный пример: одна картинка, две разные операции
Разницу между обработкой и зрением проще всего увидеть в коде. Картинка 5×5 задана числами яркости: белая вертикальная линия и две точки шума. Сначала фильтр чистит шум (обработка), потом функция делает вывод о содержимом (упрощенный аналог зрения).
# "Картинка" 5x5 в оттенках серого: 0 - черный, 9 - белый.
# Белая вертикальная линия в столбце 2 и две точки шума (значение 7).
image = [
[0, 0, 9, 0, 0],
[0, 7, 9, 0, 0],
[0, 0, 9, 0, 0],
[0, 0, 9, 7, 0],
[0, 0, 9, 0, 0],
]
def median_column(img):
"""Обработка изображения: картинка на входе -> картинка на выходе.
Медиана по трем соседям по вертикали; верхнюю и нижнюю строку не трогаем."""
out = [row[:] for row in img]
for y in range(1, len(img) - 1):
for x in range(len(img[0])):
out[y][x] = sorted([img[y - 1][x], img[y][x], img[y + 1][x]])[1]
return out
def describe(img):
"""Зрение (сильно упрощенно): картинка на входе -> вывод о содержимом."""
for x in range(len(img[0])):
if all(row[x] > 5 for row in img):
return f"вертикальная линия в столбце {x}"
return "линий не найдено"
clean = median_column(image)
print("после фильтра:")
for row in clean:
print(row)
print("вывод:", describe(clean))
Результат запуска на Python 3.14 (на 3.9 вывод тот же):
после фильтра:
[0, 0, 9, 0, 0]
[0, 0, 9, 0, 0]
[0, 0, 9, 0, 0]
[0, 0, 9, 0, 0]
[0, 0, 9, 0, 0]
вывод: вертикальная линия в столбце 2
Функция median_column вернула ту же сетку без шума — это аналог «убрать шум на фото». Функция describe вернула фразу о содержимом — это и есть задача зрения. Обработка при этом не нейтральна: если в том же коде считать медиану по горизонтали, тонкая линия толщиной в один пиксель почти исчезнет (от нее останутся два пикселя со значением 7 там, где рядом был шум), и describe ответит «линий не найдено». Поэтому фильтры в CV подбирают под задачу, а не применяют «для красоты».
Граница примера: реальные системы не ищут объекты правилом > 5, а используют обученные нейросети (сверточные сети, трансформеры для изображений) на тысячах и миллионах размеченных кадров. Пример показывает только разницу входа и выхода.
Какие задачи решает компьютерное зрение
Почти любое применение CV собирается из нескольких базовых задач. Их полезно знать по именам — так проще понять, что именно делает система в каждой отрасли.
| Задача | Что выдает модель | Пример |
|---|---|---|
| Классификация | Метка всего кадра | «на снимке есть трещина» / «нет» |
| Детекция объектов | Рамки и классы объектов | Пешеходы и машины на дороге |
| Сегментация | Маска для каждого пикселя | Контур опухоли на снимке КТ |
| Трекинг | Траектории объектов между кадрами | Путь покупателя по залу |
| Распознавание текста (OCR) | Строки текста | Номер автомобиля, паспорт |
| Оценка позы | Координаты суставов | Проверка техники приседа |
| Оценка глубины и 3D | Карта расстояний, облако точек | Навигация робота, дрона |
6 областей, где применяется компьютерное зрение
1. Медицина
Модели сегментируют органы и новообразования на КТ и МРТ, ищут подозрительные участки на маммограммах и рентгене грудной клетки, оценивают снимки глазного дна и родинок. Важная граница: такие системы работают как поддержка решения врача — подсвечивают участки, сортируют очередь снимков, — а диагноз ставит специалист. Медицинское ПО с ИИ в большинстве стран проходит регистрацию как медицинское изделие, и качество модели проверяют на данных конкретных клиник.
2. Транспорт
Самые массовые примеры — распознавание номерных знаков (детекция номера + OCR) в камерах фиксации нарушений, на парковках и платных дорогах, а также системы помощи водителю: контроль полосы, распознавание знаков, предупреждение о пешеходах и объектах в слепой зоне. Беспилотные автомобили используют CV вместе с радарами и лидарами: одной камеры для надежного восприятия в дождь, снег и темноту обычно недостаточно.
3. Розничная торговля
Камеры над полками находят пустые места и неправильную выкладку, кассы самообслуживания распознают товары без штрихкода (фрукты, выпечку), видеоаналитика считает посетителей и очереди. Трекинг покупателей по залу технически возможен, но упирается в законы о персональных данных: анализ лиц и биометрии в России и ЕС регулируется отдельно, поэтому в ритейле чаще считают обезличенные потоки.
4. Производство
Визуальный контроль качества — один из самых зрелых сценариев: камера над конвейером ищет царапины, сколы, непропай на платах, ошибки маркировки. Плюс контроль средств защиты (каска, жилет) и чтение показаний стрелочных приборов. Ограничение — редкие дефекты: примеров брака мало, поэтому модели часто обучают на «норме» и ищут отклонения от нее.
5. Сельское хозяйство
Дроны и спутниковые снимки показывают участки поля с болезнями или нехваткой влаги, модели отличают сорняки от культурных растений для точечного опрыскивания, сортировочные линии отделяют испорченные плоды. На фермах камеры помогают следить за поведением и здоровьем животных. Результат зависит от условий съемки: модель, обученная на одном регионе и сезоне, может ошибаться на другом.
6. Спорт и фитнес
Оценка позы по видео находит суставы и сравнивает технику упражнения с эталоном, приложения подсказывают, что колени «заваливаются» внутрь или спина округляется. В профессиональном спорте CV отслеживает мяч и игроков: судейские системы в теннисе и футболе, статистика перемещений. Для домашних тренировок это подсказка, а не замена тренеру: при плохом ракурсе или свете точность падает.
Кроме этих шести областей, CV широко применяется в безопасности (видеоаналитика), банках и госуслугах (распознавание документов), логистике (сканирование посылок и складских ячеек) и робототехнике.
Где компьютерное зрение ошибается
У любой системы CV есть общие слабые места, о которых стоит помнить при оценке «волшебных» кейсов:
- сдвиг данных — модель обучена на одних камерах, свете и объектах, а работает на других;
- редкие случаи — необычный ракурс, погода, объект, которого не было в обучающей выборке;
- смещения в данных — если в выборке мало людей определенного возраста или цвета кожи, качество распознавания для них ниже;
- приватность — распознавание лиц и видеонаблюдение требуют правового основания и защиты данных.
Выводы
- Компьютерное зрение — это извлечение смысла из изображения или видео: метки, объекты, текст, движение.
- В тестовом вопросе к CV относится только программа, распознающая лица или анализирующая видеопоток; плеер, калькулятор, браузер, а в сложных версиях генерация картинок, фильтры фото и капча — нет.
- Простой критерий: картинка -> смысл = зрение; картинка -> картинка = обработка; описание -> картинка = генерация.
- Основные применения — медицина, транспорт, ритейл, производство, сельское хозяйство и спорт; везде CV собирается из задач классификации, детекции, сегментации, трекинга, OCR и оценки позы.
- Качество CV-системы определяют данные и условия съемки, поэтому в ответственных областях она поддерживает решение человека, а не заменяет его.
Где применяется / связь с практикой
Освойте тему на практике
Чтобы самому собирать такие системы, нужны Python, основы линейной алгебры и машинного обучения, работа с OpenCV и фреймворками глубокого обучения, а главное — навык готовить данные и честно проверять модель на новых кадрах. Эти темы от классических алгоритмов до детекции и сегментации нейросетями разбираются на курсе «Компьютерное зрение». Если хочется сначала посмотреть на практические задачи ML и CV вживую, подойдут бесплатные открытые уроки Otus.
FAQ
Фильтр в камере смартфона, который надевает маску на лицо, — это компьютерное зрение?
Частично да: чтобы наложить маску, приложение сначала находит лицо и ключевые точки (глаза, рот) — это зрение, а сама отрисовка маски уже компьютерная графика.
Распознавание текста на фото (OCR) относится к CV?
Да, это одна из классических задач компьютерного зрения: на входе изображение, на выходе строки текста.
Нужна ли для компьютерного зрения нейросеть?
Не обязательно: простые задачи (поиск контуров, подсчет объектов на однородном фоне, чтение штрихкодов) решаются классическими алгоритмами, например из OpenCV. Нейросети нужны там, где объекты разнообразны и условия съемки меняются.



