OCR на пенсии: как FineBooks собирается спасти обучение ИИ
📚 OCR на пенсии: как FineBooks собирается спасти обучение ИИ
Когда речь заходит о старинных книгах и их цифровизации, мы часто сталкиваемся с проблемой, которая называется OCR (оптическое распознавание текста). Этот процесс до сих пор не идеален, особенно когда дело касается исторических текстов. Проект FineBooks от Hugging Face и EleutherAI решил взяться за эту задачу всерьез. Они протестировали 14 моделей OCR на более чем 2000 страниц из исторических книг, чтобы определить, какая из них лучше всего справляется с задачей.
И вот, победитель — модель под названием dots.mocr. Она достигла впечатляющей точности в 97,6% при распознавании символов, и это обошлось всего в два доллара за тысячу страниц. Отличный результат для обучения ИИ, но, как отмечает команда, пока не дотягивает до уровня, необходимого для научных транскрипций. Тем не менее, это значительный шаг вперед в улучшении качества данных для обучения языковых моделей.
◾️ Точность распознавания: 97,6%
◾️ Стоимость: 2 доллара за 1000 страниц
◾️ Количество протестированных страниц: более 2000
> «Это пока не подходит для научных транскрипций, но достаточно для обучения ИИ», — отметили в команде FineBooks.
Кажется, старые книги нашли нового союзника в борьбе за точность. Как думаете, скоро ли мы увидим ИИ, читающего древние манускрипты как новинки?
Подписаться на «Нейро Пульс»
Первоисточник ↗
Когда речь заходит о старинных книгах и их цифровизации, мы часто сталкиваемся с проблемой, которая называется OCR (оптическое распознавание текста). Этот процесс до сих пор не идеален, особенно когда дело касается исторических текстов. Проект FineBooks от Hugging Face и EleutherAI решил взяться за эту задачу всерьез. Они протестировали 14 моделей OCR на более чем 2000 страниц из исторических книг, чтобы определить, какая из них лучше всего справляется с задачей.
И вот, победитель — модель под названием dots.mocr. Она достигла впечатляющей точности в 97,6% при распознавании символов, и это обошлось всего в два доллара за тысячу страниц. Отличный результат для обучения ИИ, но, как отмечает команда, пока не дотягивает до уровня, необходимого для научных транскрипций. Тем не менее, это значительный шаг вперед в улучшении качества данных для обучения языковых моделей.
◾️ Точность распознавания: 97,6%
◾️ Стоимость: 2 доллара за 1000 страниц
◾️ Количество протестированных страниц: более 2000
> «Это пока не подходит для научных транскрипций, но достаточно для обучения ИИ», — отметили в команде FineBooks.
Кажется, старые книги нашли нового союзника в борьбе за точность. Как думаете, скоро ли мы увидим ИИ, читающего древние манускрипты как новинки?
Пока нет комментариев — будьте первым.