О чём урок
Ранее мы видели, что нейронные сети хорошо справляются с обработкой изображений, и даже однослойный перцептрон способен распознавать рукописные цифры из набора данных MNIST с приемлемой точностью. Однако набор данных MNIST очень специфичен: все цифры центрированы внутри изображения, что упрощает задачу. В реальной жизни мы хотим уметь распознавать объекты на изображении независимо от их точного расположения. Компьютерное зрение отличается от общей классификации, потому что при поиске определённого объекта на изображении мы сканируем его в поисках специфических шаблонов и их комбинаций. Например, при поиске кошки мы сначала можем искать горизонтальные линии, которые могут образовывать усы, а затем определённая комбинация усов может подсказать нам, что это действительно изображение кошки. Важны относительное положение и наличие определённых шаблонов, а не их точное расположение на изображении. Для извлечения шаблонов мы будем использовать понятие свёрточных фильтров. Как вы знаете, изображение представлено двумерной матрицей или трёхмерным тензором с глубиной цвета. Применение фильтра означает, что мы берём относительно небольшую матрицу ядра фильтра и для каждого пикселя в исходном изображении вычисляем взвешенное среднее с соседними точками. Это можно представить как небольшое окно, скользящее по всему изображению и усредняющее все пиксели в соответствии с весами в матрице ядра фильтра. Изображение Дмитрия Сошникова Например, если мы применим фильтры вертикальных и горизонтальных краёв 3x3 к цифрам MNIST, мы получим выделения (то есть высокие значения) там, где в исходном изображении есть вертикальные и горизонтальные края. Таким образом, эти два фильтра можно использовать для «поиска» краёв. Аналогично, мы можем разрабатывать различные фильтры для поиска других низкоуровневых шаблонов: Изображение банка фильтров Люнга-Малика Однако, хотя мы можем вручную разрабатывать фильтры для извлечения некоторых шаблонов, мы также можем спроектировать сеть таким образом, чтобы она обучалась шаблонам автоматически. Это одна из основных идей, лежащих в основе CNN. Принцип работы CNN основан на следующих важных идеях: Свёрточные фильтры могут извлекать шаблоны.
План урока
- Тест перед лекцией
- Основные идеи CNN
- ✍️ Упражнения: Свёрточные нейронные сети
- Пирамидальная архитектура
- Наиболее известные архитектуры CNN
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.