Генератор изображений чтения

GLM-Image: китайский ИИ для создания изображений с улучшенной работой с текстом

Китайская компания Zhipu AI представила новую модель GLM-Image, которая использует семантические токены для более точного распознавания элементов изображения и улучшенной работы с текстом.

GLM-Image: китайский ИИ для создания изображений с улучшенной работой с текстом

Компания Zhipu AI разработала инновационную модель GLM-Image, которая по-новому подходит к созданию изображений с помощью искусственного интеллекта. Модель состоит из двух основных частей общим объемом 16 миллиардов параметров.

Первая часть - авторегрессионный модуль на 9 миллиардов параметров, основанный на языковой модели GLM-4. Он создает семантическое представление изображения, определяя его содержание и компоновку. Вторая часть - диффузионный декодер с 7 миллиардами параметров, преобразующий это представление в финальное изображение высокого разрешения от 1024 до 2048 пикселей.

Главное отличие GLM-Image от конкурентов - использование семантических токенов вместо классических VQVAE. Эти токены содержат не только информацию о цвете, но и о смысловом значении области изображения - является ли она текстом, лицом или фоном. По заявлению разработчиков, такой подход ускоряет обучение и делает результаты более надежными.

Для работы с текстом в изображениях GLM-Image использует специальный модуль Glyph-byT5, обрабатывающий текстовые области посимвольно. Это особенно важно при работе с китайскими иероглифами.

Обучение модели проходит в два этапа. Сначала обучаются оба модуля по отдельности с помощью обучения с подкреплением. Авторегрессионный модуль получает обратную связь по эстетике и точности контента, а диффузионный декодер тренируется на качество визуального результата.

Для работы GLM-Image требуются серьезные вычислительные мощности - видеокарта с памятью более 80 гигабайт или система из нескольких GPU. Примечательно, что это первая открытая модель для создания изображений, полностью обученная на китайском оборудовании, что демонстрирует растущую независимость Китая в сфере ИИ.

Модель доступна под лицензией MIT на платформах Hugging Face и GitHub. Ее выпуск отражает общую тенденцию китайских компаний к разработке моделей с улучшенной обработкой текста в изображениях, как это ранее продемонстрировали Alibaba с Qwen-Image и Meituan с LongCat-Image.

Смотрите также

Каталог приложений Telegram Mini Apps

340+ проверенных мини-приложений: нейросети, утилиты, игры. Открываются прямо в мессенджере — без установки.

Открыть →

Поддержите Ailibri

Если наш каталог оказался полезным, вы можете оставить небольшой донат. Это поможет нам развивать проект.

♥ Поддержать

Будьте в курсе новых нейросетей — подпишитесь на наш Telegram-канал

Ежедневные обзоры свежих AI-инструментов, лайфхаки и инструкции прямо в вашем мессенджере.

Подписаться
Бесплатно · Нейросеть

Генерация изображений прямо в Telegram

3 бесплатные генерации в день через нейросеть nano banana — просто подпишись на канал @n_seti

Быстро Точно Качественно
Попробовать @gen_neurosila_bot

Нейросети и ИИ-инструменты

Все теги →
github223 text-to-text142 text-to-image117 image-to-image32 tool31 каталог31 удалить фон19 курсы19 text-to-sound18 браузер18 api17 создание чат-ботов15 desktop-приложение15 генератор голоса14 text-to-video14 замена лица13 ии-музыка12 python11 удалить объект с фото11 voice-to-text11
AILibri – главная страница
Ctrl / ⌘+K