VibeKit CLI
Защитный слой для безопасной работы с кодинг-агентами вроде Claude Code и Gemini с автоматической очисткой конфиденциальных данных.
Pdf Inspector — это библиотека на Rust для анализа PDF-файлов: она определяет тип документа (текстовый, отсканированный или смешанный) и, если внутри есть настоящий текст, вытаскивает его с сохранением структуры и превращает в чистый Markdown. Главная фишка — работает без OCR и без нейросетей, поэтому справляется за миллисекунды там, где другие инструменты тратят секунды на распознавание изображений. Разработали её в Firecrawl, чтобы не гонять через дорогие OCR-сервисы те PDF, где текст уже есть в машиночитаемом виде — а таких, по их подсчётам, больше половины.
Сервис умеет классифицировать документ за 10-50 миллисекунд, анализируя содержимое потоков данных внутри PDF. На выходе — один из четырёх типов (текстовый, скан, изображение или смешанный) плюс оценка уверенности от 0 до 1 и рекомендация, какие страницы стоит отправить на OCR, а какие можно обработать локально.
При извлечении текста Pdf Inspector учитывает координаты, шрифты и порядок чтения — в том числе для многоколоночных вёрсток и текста, идущего справа налево. Библиотека распознаёт заголовки по размеру шрифта, списки, блоки кода по моноширинным шрифтам, жирный и курсивный текст, ссылки и разрывы страниц. Отдельно стоит детекция таблиц: она работает в двух режимах — по геометрии линий в PDF и по выравниванию текста, что позволяет корректно собирать финансовые таблицы, сноски и таблицы, разбитые на несколько страниц.
Для шрифтов с нестандартной кодировкой (Type0/Identity-H) предусмотрено декодирование через ToUnicode CMap с поддержкой UTF-16BE, UTF-8 и Latin-1. Если кодировка всё же битая, инструмент сам это заметит и подскажет, что документ стоит отправить на OCR как запасной вариант.
По заявленным бенчмаркам на корпусе из 200 PDF-файлов Pdf Inspector показывает лучший результат среди локальных парсеров без ML-моделей — как по качеству извлечения структуры, так и по скорости обработки. Особенно хорошо подходит для отчётов, научных статей, счетов и юридических документов, где важны точный порядок текста и структура таблиц.
Библиотека написана на чистом Rust с единственной зависимостью — lopdf — и доступна в нескольких форматах:
Проект открытый и бесплатный, исходники доступны на GitHub вместе с документацией по API для каждого языка.
Защитный слой для безопасной работы с кодинг-агентами вроде Claude Code и Gemini с автоматической очисткой конфиденциальных данных.
Нейросеть для создания LEGO-инструкций из текстовых описаний. Превращает любую идею в пошаговую схему сборки конструктора с детализированными 3D-моделями.
ИИ-генератор иконок для приложений, который создает готовые к использованию иконки за 3 простых шага из текстового описания.