GLM-Image: китайский ИИ для создания изображений с улучшенной работой с текстом
Китайская компания Zhipu AI представила новую модель GLM-Image, которая использует семантические токены для более точного распознавания элементов изображения и улучшенной работы с текстом.
Компания Zhipu AI разработала инновационную модель GLM-Image, которая по-новому подходит к созданию изображений с помощью искусственного интеллекта. Модель состоит из двух основных частей общим объемом 16 миллиардов параметров.
Первая часть - авторегрессионный модуль на 9 миллиардов параметров, основанный на языковой модели GLM-4. Он создает семантическое представление изображения, определяя его содержание и компоновку. Вторая часть - диффузионный декодер с 7 миллиардами параметров, преобразующий это представление в финальное изображение высокого разрешения от 1024 до 2048 пикселей.

Главное отличие GLM-Image от конкурентов - использование семантических токенов вместо классических VQVAE. Эти токены содержат не только информацию о цвете, но и о смысловом значении области изображения - является ли она текстом, лицом или фоном. По заявлению разработчиков, такой подход ускоряет обучение и делает результаты более надежными.
Для работы с текстом в изображениях GLM-Image использует специальный модуль Glyph-byT5, обрабатывающий текстовые области посимвольно. Это особенно важно при работе с китайскими иероглифами.

Обучение модели проходит в два этапа. Сначала обучаются оба модуля по отдельности с помощью обучения с подкреплением. Авторегрессионный модуль получает обратную связь по эстетике и точности контента, а диффузионный декодер тренируется на качество визуального результата.
Для работы GLM-Image требуются серьезные вычислительные мощности - видеокарта с памятью более 80 гигабайт или система из нескольких GPU. Примечательно, что это первая открытая модель для создания изображений, полностью обученная на китайском оборудовании, что демонстрирует растущую независимость Китая в сфере ИИ.

Модель доступна под лицензией MIT на платформах Hugging Face и GitHub. Ее выпуск отражает общую тенденцию китайских компаний к разработке моделей с улучшенной обработкой текста в изображениях, как это ранее продемонстрировали Alibaba с Qwen-Image и Meituan с LongCat-Image.
Смотрите также
-
Генератор изображений·Нейросети для фотосессии: топ-10 сервисов и моделей для генерации фото онлайн
-
Генератор изображений·Google выпустил Nano Banana 2 Lite и Gemini Omni Flash
-
Автоматизация·Майские обновления Алисы AI — что нового
-
Генератор изображений·ИИ-фото на резюме: в Южной Корее начался хаос на рынке труда
-
Генератор изображений·Luma выпустила UNI-1 - модель, которая понимает и рисует одновременно
-
Генератор изображений·Ностальгия по пикселям: как превратить битвы из Game Boy в детализированные картины с помощью ИИ
-
Генератор изображений·Google выкатил Nano Banana 2 - теперь ИИ рисует еще реалистичнее
-
Проверка на ИИ·Новый детектор ИИ-изображений ищет фейки в базе разоблачённых картинок
-
Генератор изображений·Сравнение двух AI-генераторов картинок - победитель удивит