Эпоха 2 · Фундамент · 2009

15 ImageNet

ImageNet: A Large-Scale Hierarchical Image Database · Deng, …, Fei-Fei Li · CVPR
🟦 хватит конспекта~30–45 миноригинал ↗
Суть за 20 секунд. Не алгоритм, а датасет: ~14 млн размеченных изображений в ~22 тысячах категорий по иерархии WordNet. Дал арену (конкурс ILSVRC), на которой глубокие сети показали превосходство — без него не было бы прорыва AlexNet-2012. Урок эпохи: данные — двигатель не хуже архитектур.

Контекст

В середине 2000-х зрение упиралось не только в модели, но и в данные — наборы были маленькими. Фей-Фей Ли с командой делает ставку на масштаб данных, против тогдашнего консенсуса «важнее алгоритм».

Идея и механизм

~14 млн изображений, размеченных по ~22 тысячам категорий иерархии понятий WordNet. Собран краулингом веба, размечен краудсорсингом (Amazon Mechanical Turk, ~49k разметчиков из 167 стран) с контролем качества — несколько разметчиков на картинку и «золотые» примеры с известным ответом. На его основе — ежегодный конкурс ILSVRC (подмножество: 1000 классов, ~1.2 млн картинок), где и мерилась гонка.

NumPy Метрика ILSVRC: top-5 error
import numpy as np

def top5_error(logits, labels):           # logits: (N, 1000)
    top5 = np.argsort(-logits, axis=1)[:, :5]        # 5 самых вероятных классов
    hit  = (top5 == labels[:, None]).any(axis=1)     # истинный класс в топ-5?
    return 1 - hit.mean()                  # доля промахов
# именно её AlexNet (2012) срезал с 26% до 15%
сущность животное млекопит. ретривер иерархия WordNet ~14 000 000 изображений ~22 000 категорий ILSVRC: 1000 классов, ~1.2 млн картинок
Категории организованы по иерархии понятий WordNet. Масштаб — ключевая характеристика: на порядки больше прежних наборов.
Аналогия. ImageNet — это как составить толковый словарь мира в картинках до того, как кто-то научился бегло читать. Модели тех лет ещё «не умели читать» такой объём, но как только появился «грамотный» ученик (глубокая CNN на GPU) — словарь стал тем учебником, на котором он всех обошёл.

Почему это важно

ImageNet дал арену, на которой глубокие сети показали превосходство — без него не было бы прорыва AlexNet-2012 (#16). Закрепил урок эпохи: данные — такой же двигатель, как архитектуры и compute (data-centric взгляд). Нюанс: на постере CVPR-2009 датасет почти не заметили (многие сомневались, что огромный набор важен); признание пришло через 3 года.

Связи

→ зажигает16. AlexNet

ImageNet — это топливо, AlexNet — двигатель. Конкурс ILSVRC-2012 дал глубокой CNN масштаб данных, на котором она разгромно выиграла и запустила революцию. Дата-веха и архитектурный прорыв нераздельны.

↔ перекликается40. CLIP

Та же ставка на масштаб данных, но следующий уровень: вместо 14M размеченных вручную картинок — 400M пар «картинка-подпись» из веба, где разметка — естественный язык. Эволюция «данные-как-двигатель»: от кураторской разметки к веб-масштабу.

↔ контекст37. Scaling Laws

ImageNet эмпирически показал ценность масштаба данных в зрении. Scaling laws спустя десятилетие формализуют это для языка: качество — предсказуемая функция данных, параметров и compute. «Больше данных лучше» из наблюдения становится законом.

Вопросы пытливого ума

Почему именно top-5 error, а не top-1 — не занижает ли это сложность?

Top-5 терпит неоднозначность: на фото может быть несколько объектов, а близкие классы (породы собак) трудно различимы даже людям. Засчитывать правильным, если истинный класс в пяти лучших, — это про «понял ли в принципе», а не про идеальную точность. Top-1 тоже репортят, но top-5 был основной метрикой гонки как более устойчивый к шуму разметки.

14 миллионов картинок размечены краудом — насколько чистые эти метки?

Не идеально. Несмотря на «золотые» примеры и нескольких разметчиков, в ImageNet находят ошибочные и неоднозначные метки, дубликаты и культурные перекосы (что считать «правильным» объектом). Поздние аудиты показали заметную долю спорных меток в validation-наборе. Это напоминание: «бенчмарк» — не истина, а измеримое приближение.

Датасет может нести предвзятость — это реальная проблема?

Да, и серьёзная. Источник (веб) и разметчики вносят географические, культурные и социальные перекосы; печально известна была «person»-ветвь ImageNet с оскорбительными категориями, которую позже вычистили. Модель наследует смещения данных — поэтому состав и происхождение датасета сегодня считают частью ответственного ML, а не технической мелочью.

Что читать в оригинале

Конспекта достаточно — это инфраструктурная веха, а не теория. Если интересно, посмотрите, как устроены сбор и контроль качества разметки: это образец того, как «просто датасет» меняет ход целой области.