Count Anything: нейросеть, которая умеет считать объекты на любом изображении
Count Anything считает объекты на фото по текстовому запросу: люди в толпе, клетки под микроскопом, детали на конвейере. В тестах ошибка вдвое меньше, чем у предыдущих моделей.
- Count Anything распознаёт и маркирует объекты на спутниковых снимках, медицинских сканах и обычных фотографиях по текстовому запросу.
- Система построена на базе Meta SAM3 и совмещает два подхода: рамки вокруг крупных объектов и точечные метки на мелких, плотно расположенных, с последующим слиянием без дублирования.
- Модель обучена на датасете CLOC и превосходит многих конкурентов в тестах, хотя размытые запросы и очень плотные сцены по-прежнему снижают точность.
Современные языковые модели описывают изображения, читают графики, извлекают текст из фото. Мультимодальность давно стала нормой. Но одна на вид простая задача остаётся неожиданно сложной: надёжно посчитать объекты на картинке.
Задача вполне прикладная. Врач анализирует гистологический срез, фермер оценивает урожай по аэрофото, градостроитель считает машины на перекрёстке. Каждый из них зависит от точного числа. До последнего времени каждая такая задача требовала отдельной специализированной системы.
Count Anything - попытка это изменить. Модель, разработанная исследователями из Университета Цинхуа и ряда других институтов, нацелена на универсальный подсчёт: головы в толпе, машины на спутниковых снимках, клетки в медицинских сканах, бактериальные колонии в лаборатории. Всё это одной моделью, по текстовому запросу. Среди opensource-нейросетей подобный подход встречается редко.
🔢 Два счётчика лучше одного
Ключевая идея: совместить два подхода, которые хорошо дополняют друг друга. Первый специализируется на крупных, чётко видимых объектах и обводит их рамками. Второй работает с мелкими, плотно расположенными - ставит точку на каждый обнаруженный.

Система строится поверх Meta SAM3 - модели сегментации, которую Meta выпустила как открытую. Count Anything дополняет её двумя специализированными ветками и механизмом слияния, объединяющим результаты без двойного счёта.
Наивное объединение двух детекторов неизбежно даёт дубли. Разработчики реализовали алгоритм подавления дублирования: он сопоставляет результаты обеих веток и оставляет только уникальные метки.
Датасет CLOC: шесть визуальных доменов
Для обучения универсальной модели команда собрала датасет CLOC, охватывающий шесть визуальных областей: общие сцены, дистанционное зондирование, гистопатология, клеточная микроскопия, сельское хозяйство и микробиология.

Датасет содержит около 220 000 изображений, 619 категорий и 15 миллионов размеченных объектов — по заявлению авторов, крупнейший датасет для подсчёта объектов с текстовым управлением. Каждый домен принципиально отличается от остальных - по масштабу объектов, их плотности, текстуре фона. Клетки под микроскопом и автомобили на аэроснимке - совершенно разные задачи визуального восприятия, и обе должны решаться одной моделью.
📊 Что показывают тесты
В сравнительных тестах Count Anything вдвое снижает среднюю абсолютную ошибку (MAE) относительно предыдущих систем-обобщителей. На типичной сцене модель ошибается вдвое реже, чем предшественники.

В среднем модель ошибается примерно на 9 объектов на запрос; ближайшие конкуренты — CountGD, CLIP-Count, Grounding DINO — промахиваются более чем вдвое. В задаче подсчёта толпы Count Anything конкурентоспособна, но не превосходит лучшие специализированные системы.
Слабые места предсказуемы. Размытые или неоднозначные запросы сбивают модель с толку - как и любую систему, опирающуюся на семантику. Очень плотные сцены, где объекты перекрываются или сливаются, тоже снижают точность.
🔬 Кому это реально нужно
Подсчёт объектов возникает в неожиданно широком круге задач. В медицине - анализ гистологических срезов и клеточных культур. В сельском хозяйстве - подсчёт плодов, растений, животных по аэрофото. В экологии - мониторинг популяций. В городском планировании - анализ пешеходных и транспортных потоков.

Раньше каждый такой сценарий требовал отдельно обученной модели. Count Anything предлагает единую точку входа: достаточно описать объект текстом. Насколько это окажется практичным за пределами лабораторных тестов, покажет время, но направление выглядит разумно.
Код опубликован на GitHub, датасет CLOC также открыт. Открытые исследовательские инструменты такого рода обычно быстро обрастают адаптациями под конкретные прикладные задачи.
Смотрите также
-
Opensource·pxpipe: опенсорс-инструмент, который прячет текст в PNG и снижает расходы на Claude Code до 70%
-
ИИ-агент·Claude Science: рабочая среда Anthropic для учёных
-
ИИ-агент·Sakana AI представила Fugu Ultra — мультиагентную систему для сложных задач
-
Opensource·North Mini Code от Cohere: агентная модель для разработчиков вышла в open-source
-
Opensource·Mellum2 от JetBrains: быстрая модель для ИИ-систем
-
Opensource·Kimi K2.6 - открытая модель с роем агентов
-
Opensource·Stability AI выпустила модель для генерации 6-минутных треков
-
Исследования·arXiv грозит баном за непроверенный текст от ИИ
-
Opensource·OpenSquilla - агентный рантайм, который экономит токены