Как собрать огромный датасет и не потратить годовой бюджет маленькой страны

24 ноября, 13:30, «h4»

Средняя сложность
Доклад принят в программу конференции
Обработка данных
ML
Расширение кругозора
Machine Learning
Обработка данных
ML
Расширение кругозора
Machine Learning

Мнение Программного комитета о докладе

Если вам нужно собирать данные для обучения моделей и вы задумываетесь, не использовать ли для этого краудсорсинговую платформу типа Толоки, то опыт Карины и Александра будет вам интересен и полезен.

Целевая аудитория

Data-сайентисты, ML и Data-инженеры.

Тезисы

Летом мы опубликовали самый большой жестовый набор данных HaGRID и сегодня расскажем, как собирать и размечать огромные датасеты.

В нашем докладе мы: * поговорим про основные лайфхаки при работе с краудсорсинг-платформами, * расскажем о том, как существенно снизить стоимость проекта и повысить качество разметки, * научим работать с непослушными разметчиками, от которых зависит будущее датасета, * пройдем полный путь от идеи до создания автоматизированного пайплайна, с помощью которого можно одной кнопкой собрать много данных.

Датасет, код обучения моделей и сами модели доступны в OpenSource! 💪

Спикеры

Александр Капитанов
Руководит исследовательскими ML-командами в SberDevices. В прошлом инженер-железячник в области цифровой обработки сигналов на FPGA и ASIC, в частности, для обработки изображений и звука. Автор топовых лекций по обработке сигналов и регулярный спикер на научно-технических конференциях. Активный контрибьютор в Open Source.

Другие доклады секции