ИсследованияOpensource чтения

Count Anything: нейросеть, которая умеет считать объекты на любом изображении

Count Anything считает объекты на фото по текстовому запросу: люди в толпе, клетки под микроскопом, детали на конвейере. В тестах ошибка вдвое меньше, чем у предыдущих моделей.

Count Anything: нейросеть, которая умеет считать объекты на любом изображении
  • Count Anything распознаёт и маркирует объекты на спутниковых снимках, медицинских сканах и обычных фотографиях по текстовому запросу.
  • Система построена на базе Meta SAM3 и совмещает два подхода: рамки вокруг крупных объектов и точечные метки на мелких, плотно расположенных, с последующим слиянием без дублирования.
  • Модель обучена на датасете CLOC и превосходит многих конкурентов в тестах, хотя размытые запросы и очень плотные сцены по-прежнему снижают точность.

Современные языковые модели описывают изображения, читают графики, извлекают текст из фото. Мультимодальность давно стала нормой. Но одна на вид простая задача остаётся неожиданно сложной: надёжно посчитать объекты на картинке.

Задача вполне прикладная. Врач анализирует гистологический срез, фермер оценивает урожай по аэрофото, градостроитель считает машины на перекрёстке. Каждый из них зависит от точного числа. До последнего времени каждая такая задача требовала отдельной специализированной системы.

Count Anything - попытка это изменить. Модель, разработанная исследователями из Университета Цинхуа и ряда других институтов, нацелена на универсальный подсчёт: головы в толпе, машины на спутниковых снимках, клетки в медицинских сканах, бактериальные колонии в лаборатории. Всё это одной моделью, по текстовому запросу. Среди opensource-нейросетей подобный подход встречается редко.

🔢 Два счётчика лучше одного

Ключевая идея: совместить два подхода, которые хорошо дополняют друг друга. Первый специализируется на крупных, чётко видимых объектах и обводит их рамками. Второй работает с мелкими, плотно расположенными - ставит точку на каждый обнаруженный.

Схема архитектуры модели Count Anything: два параллельных счётчика и механизм слияния результатов

Система строится поверх Meta SAM3 - модели сегментации, которую Meta выпустила как открытую. Count Anything дополняет её двумя специализированными ветками и механизмом слияния, объединяющим результаты без двойного счёта.

Наивное объединение двух детекторов неизбежно даёт дубли. Разработчики реализовали алгоритм подавления дублирования: он сопоставляет результаты обеих веток и оставляет только уникальные метки.

Датасет CLOC: шесть визуальных доменов

Для обучения универсальной модели команда собрала датасет CLOC, охватывающий шесть визуальных областей: общие сцены, дистанционное зондирование, гистопатология, клеточная микроскопия, сельское хозяйство и микробиология.

Примеры изображений из шести доменов датасета CLOC: сцены, спутники, гистология, клетки, агро, микробиология

Датасет содержит около 220 000 изображений, 619 категорий и 15 миллионов размеченных объектов — по заявлению авторов, крупнейший датасет для подсчёта объектов с текстовым управлением. Каждый домен принципиально отличается от остальных - по масштабу объектов, их плотности, текстуре фона. Клетки под микроскопом и автомобили на аэроснимке - совершенно разные задачи визуального восприятия, и обе должны решаться одной моделью.

📊 Что показывают тесты

В сравнительных тестах Count Anything вдвое снижает среднюю абсолютную ошибку (MAE) относительно предыдущих систем-обобщителей. На типичной сцене модель ошибается вдвое реже, чем предшественники.

График масштабирования Count Anything: зависимость ошибки от размера модели и объёма данных

В среднем модель ошибается примерно на 9 объектов на запрос; ближайшие конкуренты — CountGD, CLIP-Count, Grounding DINO — промахиваются более чем вдвое. В задаче подсчёта толпы Count Anything конкурентоспособна, но не превосходит лучшие специализированные системы.

Слабые места предсказуемы. Размытые или неоднозначные запросы сбивают модель с толку - как и любую систему, опирающуюся на семантику. Очень плотные сцены, где объекты перекрываются или сливаются, тоже снижают точность.

🔬 Кому это реально нужно

Подсчёт объектов возникает в неожиданно широком круге задач. В медицине - анализ гистологических срезов и клеточных культур. В сельском хозяйстве - подсчёт плодов, растений, животных по аэрофото. В экологии - мониторинг популяций. В городском планировании - анализ пешеходных и транспортных потоков.

Примеры работы Count Anything на изображениях из разных доменов: толпа, клетки, спутниковый снимок

Раньше каждый такой сценарий требовал отдельно обученной модели. Count Anything предлагает единую точку входа: достаточно описать объект текстом. Насколько это окажется практичным за пределами лабораторных тестов, покажет время, но направление выглядит разумно.

Код опубликован на GitHub, датасет CLOC также открыт. Открытые исследовательские инструменты такого рода обычно быстро обрастают адаптациями под конкретные прикладные задачи.

Смотрите также

Каталог приложений Telegram Mini Apps

340+ проверенных мини-приложений: нейросети, утилиты, игры. Открываются прямо в мессенджере — без установки.

Открыть →

Поддержите Ailibri

Если наш каталог оказался полезным, вы можете оставить небольшой донат. Это поможет нам развивать проект.

♥ Поддержать

Будьте в курсе новых нейросетей — подпишитесь на наш Telegram-канал

Ежедневные обзоры свежих AI-инструментов, лайфхаки и инструкции прямо в вашем мессенджере.

Подписаться
Бесплатно · Нейросеть

Генерация изображений прямо в Telegram

3 бесплатные генерации в день через нейросеть nano banana — просто подпишись на канал @n_seti

Быстро Точно Качественно
Попробовать @gen_neurosila_bot

Нейросети и ИИ-инструменты

Все теги →
github223 text-to-text142 text-to-image117 image-to-image32 tool31 каталог31 удалить фон19 курсы19 text-to-sound18 браузер18 api17 создание чат-ботов15 desktop-приложение15 генератор голоса14 text-to-video14 замена лица13 ии-музыка12 python11 удалить объект с фото11 voice-to-text11
AILibri – главная страница
Ctrl / ⌘+K