Загрузка котировок…
Радар.

OCR на пенсии: как FineBooks собирается спасти обучение ИИ

1 ч назад · ⏱ 1 мин чтения
📚 OCR на пенсии: как FineBooks собирается спасти обучение ИИ

Когда речь заходит о старинных книгах и их цифровизации, мы часто сталкиваемся с проблемой, которая называется OCR (оптическое распознавание текста). Этот процесс до сих пор не идеален, особенно когда дело касается исторических текстов. Проект FineBooks от Hugging Face и EleutherAI решил взяться за эту задачу всерьез. Они протестировали 14 моделей OCR на более чем 2000 страниц из исторических книг, чтобы определить, какая из них лучше всего справляется с задачей.

И вот, победитель — модель под названием dots.mocr. Она достигла впечатляющей точности в 97,6% при распознавании символов, и это обошлось всего в два доллара за тысячу страниц. Отличный результат для обучения ИИ, но, как отмечает команда, пока не дотягивает до уровня, необходимого для научных транскрипций. Тем не менее, это значительный шаг вперед в улучшении качества данных для обучения языковых моделей.

◾️ Точность распознавания: 97,6%
◾️ Стоимость: 2 доллара за 1000 страниц
◾️ Количество протестированных страниц: более 2000

> «Это пока не подходит для научных транскрипций, но достаточно для обучения ИИ», — отметили в команде FineBooks.

Кажется, старые книги нашли нового союзника в борьбе за точность. Как думаете, скоро ли мы увидим ИИ, читающего древние манускрипты как новинки?
Оцените:
Первоисточник ↗
Комментарии

Пока нет комментариев — будьте первым.

Читайте также