Компьютерное зрение: что это и где применяется — 6 примеров

Компьютерное зрение: что это и где применяется - 6 примеров Про IT

Компьютерное зрение (computer vision, CV) — область искусственного интеллекта, в которой программа получает изображение или видео и делает вывод о его содержимом: что или кто в кадре, где находится объект, что происходит. Ключевой признак — на выходе не новая картинка, а понимание: метка, координаты, текст, число, событие.

Отсюда ответ на тестовый вопрос «какой из примеров относится к компьютерному зрению». В ИТ-диктанте сентября 2025 года варианты такие: программа, которая распознает лица на фотографии; плеер, который увеличивает громкость музыки; калькулятор, который складывает числа; браузер, который открывает сайты. Верный ответ — программа, которая распознает лица: только она анализирует содержимое изображения. Плеер обрабатывает звук, калькулятор — числа, браузер загружает и показывает страницы, картинки никто из них не понимает.

В других версиях теста дистракторы сложнее, и там нужен уже критерий «вход — выход»:

  • программа, которая распознает лица на фотографии или анализирует видеопоток, — да, это компьютерное зрение: она извлекает из кадра смысл (чье лицо, что происходит);
  • нейросеть, которая генерирует изображения с котятами, — нет: это генеративная модель, она создает картинку, а не анализирует существующую;
  • алгоритм, который убирает шум, корректирует баланс белого и повышает резкость, — нет: это обработка изображений, фото на входе и улучшенное фото на выходе, содержимое кадра программа не распознает;
  • сайт с капчей на распознавание предметов — нет: предметы распознает человек, а капча проверяет, что перед ней не бот.

Ниже — как отличать такие случаи по одному критерию, какие задачи решает CV и шесть областей, где оно работает в 2026 году.

Разбор теста: почему подходит только распознавание лиц

Вариант с плеером, калькулятором и браузером решается сразу: там нет изображения на входе. Сложные версии тестов проверяют другое различие: анализ содержимого против изменения или создания картинки. Удобно свести варианты в таблицу.

Вариант Что на входе Что на выходе Как это называется CV?
Распознавание лиц, анализ видеопотока Фото, видео Имя, координаты лица, событие Компьютерное зрение Да
Генерация изображений с котятами Текстовый запрос Новая картинка Генеративный ИИ Нет
Шумоподавление, баланс белого, резкость Фото Исправленное фото Обработка изображений Нет
Капча «выберите все светофоры» Картинка человеку Ответ человека Тест на человека (CAPTCHA) Нет

Две оговорки, чтобы не спорить с тестом в неправильную сторону. Первая: границы на практике размыты. Генеративные модели учатся на тех же данных и часто на тех же архитектурах, что и модели зрения, а шумоподавление в научной литературе иногда называют «низкоуровневым зрением». Но в формулировке теста главное — есть ли понимание сцены, и его нет ни у генератора котят, ни у фильтра резкости.

Вторая: с капчей связаны два разных процесса. Ответы людей на капчах могут использоваться как разметка для обучения моделей, а бот, который пытается решить такую капчу автоматически, сам применял бы компьютерное зрение. Но сайт с капчей как пример — это проверка человека, а не CV.

Короткий словарь: четыре термина, которые путают

  • Обработка изображений (image processing) — преобразование картинки в картинку: фильтры, шумоподавление, сжатие, коррекция цвета. Часто служит подготовкой данных для CV.
  • Компьютерное зрение — извлечение смысла из изображения: классы, объекты, их положение, текст, движение.
  • Компьютерная графика и генеративный ИИ — создание изображения по описанию, модели сцены или запросу. Направление обратное зрению: от смысла к пикселям.
  • Распознавание образов — более общее понятие про классификацию сигналов любой природы (звук, текст, изображения). Распознавание объектов на фото — его часть внутри CV.

Минимальный пример: одна картинка, две разные операции

Разницу между обработкой и зрением проще всего увидеть в коде. Картинка 5×5 задана числами яркости: белая вертикальная линия и две точки шума. Сначала фильтр чистит шум (обработка), потом функция делает вывод о содержимом (упрощенный аналог зрения).

# "Картинка" 5x5 в оттенках серого: 0 - черный, 9 - белый.
# Белая вертикальная линия в столбце 2 и две точки шума (значение 7).
image = [
    [0, 0, 9, 0, 0],
    [0, 7, 9, 0, 0],
    [0, 0, 9, 0, 0],
    [0, 0, 9, 7, 0],
    [0, 0, 9, 0, 0],
]


def median_column(img):
    """Обработка изображения: картинка на входе -> картинка на выходе.
    Медиана по трем соседям по вертикали; верхнюю и нижнюю строку не трогаем."""
    out = [row[:] for row in img]
    for y in range(1, len(img) - 1):
        for x in range(len(img[0])):
            out[y][x] = sorted([img[y - 1][x], img[y][x], img[y + 1][x]])[1]
    return out


def describe(img):
    """Зрение (сильно упрощенно): картинка на входе -> вывод о содержимом."""
    for x in range(len(img[0])):
        if all(row[x] > 5 for row in img):
            return f"вертикальная линия в столбце {x}"
    return "линий не найдено"


clean = median_column(image)
print("после фильтра:")
for row in clean:
    print(row)
print("вывод:", describe(clean))

Результат запуска на Python 3.14 (на 3.9 вывод тот же):

после фильтра:
[0, 0, 9, 0, 0]
[0, 0, 9, 0, 0]
[0, 0, 9, 0, 0]
[0, 0, 9, 0, 0]
[0, 0, 9, 0, 0]
вывод: вертикальная линия в столбце 2

Функция median_column вернула ту же сетку без шума — это аналог «убрать шум на фото». Функция describe вернула фразу о содержимом — это и есть задача зрения. Обработка при этом не нейтральна: если в том же коде считать медиану по горизонтали, тонкая линия толщиной в один пиксель почти исчезнет (от нее останутся два пикселя со значением 7 там, где рядом был шум), и describe ответит «линий не найдено». Поэтому фильтры в CV подбирают под задачу, а не применяют «для красоты».

Граница примера: реальные системы не ищут объекты правилом > 5, а используют обученные нейросети (сверточные сети, трансформеры для изображений) на тысячах и миллионах размеченных кадров. Пример показывает только разницу входа и выхода.

Какие задачи решает компьютерное зрение

Почти любое применение CV собирается из нескольких базовых задач. Их полезно знать по именам — так проще понять, что именно делает система в каждой отрасли.

Задача Что выдает модель Пример
Классификация Метка всего кадра «на снимке есть трещина» / «нет»
Детекция объектов Рамки и классы объектов Пешеходы и машины на дороге
Сегментация Маска для каждого пикселя Контур опухоли на снимке КТ
Трекинг Траектории объектов между кадрами Путь покупателя по залу
Распознавание текста (OCR) Строки текста Номер автомобиля, паспорт
Оценка позы Координаты суставов Проверка техники приседа
Оценка глубины и 3D Карта расстояний, облако точек Навигация робота, дрона

6 областей, где применяется компьютерное зрение

1. Медицина

Модели сегментируют органы и новообразования на КТ и МРТ, ищут подозрительные участки на маммограммах и рентгене грудной клетки, оценивают снимки глазного дна и родинок. Важная граница: такие системы работают как поддержка решения врача — подсвечивают участки, сортируют очередь снимков, — а диагноз ставит специалист. Медицинское ПО с ИИ в большинстве стран проходит регистрацию как медицинское изделие, и качество модели проверяют на данных конкретных клиник.

2. Транспорт

Самые массовые примеры — распознавание номерных знаков (детекция номера + OCR) в камерах фиксации нарушений, на парковках и платных дорогах, а также системы помощи водителю: контроль полосы, распознавание знаков, предупреждение о пешеходах и объектах в слепой зоне. Беспилотные автомобили используют CV вместе с радарами и лидарами: одной камеры для надежного восприятия в дождь, снег и темноту обычно недостаточно.

3. Розничная торговля

Камеры над полками находят пустые места и неправильную выкладку, кассы самообслуживания распознают товары без штрихкода (фрукты, выпечку), видеоаналитика считает посетителей и очереди. Трекинг покупателей по залу технически возможен, но упирается в законы о персональных данных: анализ лиц и биометрии в России и ЕС регулируется отдельно, поэтому в ритейле чаще считают обезличенные потоки.

4. Производство

Визуальный контроль качества — один из самых зрелых сценариев: камера над конвейером ищет царапины, сколы, непропай на платах, ошибки маркировки. Плюс контроль средств защиты (каска, жилет) и чтение показаний стрелочных приборов. Ограничение — редкие дефекты: примеров брака мало, поэтому модели часто обучают на «норме» и ищут отклонения от нее.

5. Сельское хозяйство

Дроны и спутниковые снимки показывают участки поля с болезнями или нехваткой влаги, модели отличают сорняки от культурных растений для точечного опрыскивания, сортировочные линии отделяют испорченные плоды. На фермах камеры помогают следить за поведением и здоровьем животных. Результат зависит от условий съемки: модель, обученная на одном регионе и сезоне, может ошибаться на другом.

6. Спорт и фитнес

Оценка позы по видео находит суставы и сравнивает технику упражнения с эталоном, приложения подсказывают, что колени «заваливаются» внутрь или спина округляется. В профессиональном спорте CV отслеживает мяч и игроков: судейские системы в теннисе и футболе, статистика перемещений. Для домашних тренировок это подсказка, а не замена тренеру: при плохом ракурсе или свете точность падает.

Кроме этих шести областей, CV широко применяется в безопасности (видеоаналитика), банках и госуслугах (распознавание документов), логистике (сканирование посылок и складских ячеек) и робототехнике.

Где компьютерное зрение ошибается

У любой системы CV есть общие слабые места, о которых стоит помнить при оценке «волшебных» кейсов:

  • сдвиг данных — модель обучена на одних камерах, свете и объектах, а работает на других;
  • редкие случаи — необычный ракурс, погода, объект, которого не было в обучающей выборке;
  • смещения в данных — если в выборке мало людей определенного возраста или цвета кожи, качество распознавания для них ниже;
  • приватность — распознавание лиц и видеонаблюдение требуют правового основания и защиты данных.

Выводы

  • Компьютерное зрение — это извлечение смысла из изображения или видео: метки, объекты, текст, движение.
  • В тестовом вопросе к CV относится только программа, распознающая лица или анализирующая видеопоток; плеер, калькулятор, браузер, а в сложных версиях генерация картинок, фильтры фото и капча — нет.
  • Простой критерий: картинка -> смысл = зрение; картинка -> картинка = обработка; описание -> картинка = генерация.
  • Основные применения — медицина, транспорт, ритейл, производство, сельское хозяйство и спорт; везде CV собирается из задач классификации, детекции, сегментации, трекинга, OCR и оценки позы.
  • Качество CV-системы определяют данные и условия съемки, поэтому в ответственных областях она поддерживает решение человека, а не заменяет его.

Где применяется / связь с практикой

Освойте тему на практике

Чтобы самому собирать такие системы, нужны Python, основы линейной алгебры и машинного обучения, работа с OpenCV и фреймворками глубокого обучения, а главное — навык готовить данные и честно проверять модель на новых кадрах. Эти темы от классических алгоритмов до детекции и сегментации нейросетями разбираются на курсе «Компьютерное зрение». Если хочется сначала посмотреть на практические задачи ML и CV вживую, подойдут бесплатные открытые уроки Otus.

FAQ

Фильтр в камере смартфона, который надевает маску на лицо, — это компьютерное зрение?
Частично да: чтобы наложить маску, приложение сначала находит лицо и ключевые точки (глаза, рот) — это зрение, а сама отрисовка маски уже компьютерная графика.

Распознавание текста на фото (OCR) относится к CV?
Да, это одна из классических задач компьютерного зрения: на входе изображение, на выходе строки текста.

Нужна ли для компьютерного зрения нейросеть?
Не обязательно: простые задачи (поиск контуров, подсчет объектов на однородном фоне, чтение штрихкодов) решаются классическими алгоритмами, например из OpenCV. Нейросети нужны там, где объекты разнообразны и условия съемки меняются.

OTUS Журнал
Скидка 5% 14-20 сентября на курсы (popup)