Глава Ленинки оценил полную оцифровку архивов в 200 млрд рублей
Полная оцифровка всех архивов Российской государственной библиотеки обойдётся примерно в 200 млрд рублей. Такую оценку в разговоре с РБК привёл генеральный директор РГБ Вадим Дуда, отталкиваясь от средней стоимости обработки одной страницы в 10 рублей.
При этом он подчеркнул, что расчёт очень приблизительный. В нём не учтены расходы на реставрацию ветхих документов, подготовку материалов, создание метаданных и последующее хранение цифровых копий.
Фонды Ленинки насчитывают около 200 млн единиц хранения, среди которых 300 тысяч редких книг и полмиллиона рукописей. На сегодняшний день библиотека перевела в цифру лишь 1,2 млн документов, из которых 150 тысяч - уникальные рукописи и книжные памятники.
Если сохранять текущий темп, на обработку всего массива ушло бы почти две тысячи лет, признал Дуда.
Однако процесс ускоряется. По словам директора, ежегодно оцифровываются десятки тысяч изданий, а в работу внедряют роботизированные комплексы, способные сканировать до трёх тысяч страниц в час.
Финансирование смешанное: государственные субсидии по федеральному проекту «Цифровая культура» сочетаются с собственными доходами библиотеки, грантами и деньгами меценатов.
Дуда пояснил, что РГБ не стремится оцифровать всё подряд. Подход остаётся выборочным и стратегическим.
В первую очередь в цифру переводят книжные памятники, редкие издания и материалы, востребованные наукой. Значительную роль играют и ограничения авторского права: далеко не всё из хранящегося в библиотеке можно легально выложить в открытый доступ.
Архивы Ленинки уже работают на развитие искусственного интеллекта. Специалисты фонда специального хранения и проектного офиса «Нейросети Ленинки» формируют датасеты из книг, карт, диссертаций и справочников.
На этих данных обучают модели ИИ, которые проходят опытную эксплуатацию - они помогают читателям и сотрудникам получать точные библиографические справки.
Стратегическая цель библиотеки - перейти от простого поиска по ключевым словам к смысловому анализу текста и интеллектуальной навигации по первоисточникам. «Мы действуем максимально ответственно: прорабатываем вопросы авторского права, защиты персональных данных, этики и предотвращения предвзятости алгоритмов», - заверил Дуда.
Доступ к таким сервисам предоставляется только в стенах библиотеки с соблюдением всех юридических норм.
Ранее источники РБК на медиарынке отмечали, что вопрос оцифровки архивов РГБ остро волнует разработчиков российских нейросетей. Доступ к отечественным массивам данных необходим им для ускоренного обучения моделей.
Однако в пресс-службе Минкультуры на запрос издания не ответили. Компании «Яндекс» и «Сбер», развивающие собственные нейросети, также промолчали.