
Немската организация с нестопанска цел LAION публикува LAION-BVD (Big Video Dataset) — свободно достъпен набор от 80 милиона видеа с обща продължителност 10 милиона часа. Наборът, кодът за обработка и научната статия излязоха в края на август 2026 г. и са предназначени изключително за изследователска работа, не за търговски продукти. Това е най-големият публичен видео набор от този тип досега.
Какво точно има вътре
Според проектната страница на LAION наборът тръгва от 1,3 милиарда линка към видеа, извлечени от архивите на CommonCrawl. От тях са изтеглени 80 милиона файла, а върху тях е пусната обработка, която ги разрязва на отделни сцени.
Резултатът е разпределен на няколко части в Hugging Face:
- BVD-RAW — суровите 80 милиона видеа, 10 милиона часа (с заявка за достъп)
- BVD-V-55M — 55 милиона клипа с автоматично генерирани описания
- BVD-A-10M и BVD-A-1,7M — аудио клипове с описания на звука
- BVD-I-300M — 300 милиона отделни кадъра за обучение по двойки изображение–текст
Има и „леки“ варианти само с URL адреси и метаданни, ако не искате да теглите терабайти видео.
Описанията са писани от модел, не от хора
Ключовата част от работата не е тегленето, а анотирането. Конвейерът на LAION минава през четири етапа — сваляне, курация, описване и обучение. Разрязването на сцени е автоматично и се води по съдържанието на кадъра, а не по фиксиран интервал, така че всеки клип съдържа една смислена сцена.
След това модел генерира кратко текстово описание за картината и отделно описание за звука. Именно тази двойка позволява на един модел да свърже видяното, чутото и написаното — нещо, което липсва в наборите само от изображения.
От сцените са извадени и кадри с рязка смяна на съдържанието. LAION твърди, че тези кадри имат различно визуално разпределение от типичните снимки в мрежата, тоест допълват, а не дублират съществуващите източници за обучение.
Колко струва това на практика
Екипът е обучил три вида модели, за да покаже, че данните вършат работа. Най-конкретният резултат: ViCLIP, обучен върху BVD, изпреварва сравним модел, обучен върху InternVid, с до 2,1 процентни пункта на стандартните тестове за търсене на видео по текст, съобщава the-decoder.
Аудио моделите CLAP се държат наравно с други големи некурирани набори, а CLIP моделите върху извадените кадри дават добри резултати при търсене на изображение по текст. Подобренията растат с мащаба на модела и на обучението — обичайният знак, че данните не се изчерпват бързо.
Два процентни пункта звучат скромно, но при отворените модели точно такива разлики решават дали един малък модел ще стигне големите. Наскоро видяхме подобно — модел с 8 милиарда параметъра, който настига Claude Opus 4.5 на конкретен тест.
Статията LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training е качена в arXiv на 25 август, а сред дванайсетте ѝ автори са Андреас Хохленерт, Мариана Нежурина, Мехди Черти, Кристоф Шуман, Женя Житцев, Бернхард Шьолкопф и Матиас Бетге. Кодът е в GitHub хранилището на проекта.
Правната страна е най-деликатната
Мнозинството от видеата идват от YouTube и преобладаващата част са на английски. Наборът не съдържа самите файлове в общия случай — той съдържа адреси, метаданни и описания, а достъпът до суровите видеа минава през заявка.
LAION изрично пише, че материалът се публикува само за изследователски цели и не за търговска употреба, и моли потребителите да зачитат правата на авторите на съдържанието. Организацията стъпва на решението на Областния съд в Хамбург от 2024 г., което ѝ позволи да събира защитено с авторско право съдържание за некомерсиални научни цели по германското изключение за text and data mining.
Това е защита срещу иск, а не разрешение за всичко. Компания, която реши да обучи търговски видео модел върху BVD, няма да се скрие зад същото решение — а границата между „изследване“ и „предварително обучение на продукт“ е точно там, където се водят повечето днешни дела. В същото време спорът кой печели от съдържанието в мрежата продължава и на други фронтове, например при автоматичните AI отговори на Google.
Заключение
LAION направи с видеото това, което направи с изображенията при LAION-5B: свали бариерата пред университетите и малките лаборатории, които не могат да си купят достъп до затворени данни. Ако резултатите се потвърдят от други екипи, следващата вълна отворени видео модели ще тръгне оттук.
Отворено остава дали правната конструкция ще издържи извън Германия и колко от изтеглените адреси ще работят след година — при данни от YouTube това е реален проблем. Дотогава обаче 10 милиона часа с готови описания са най-доброто, което публичната наука има.
Харесва ви? Отбележете ни и ще ни виждате по-нагоре в Google.
Предпочитан източник в Google