
Шесть часов на один рендер: как я собрал нативную студию Ideogram 4 на Swift и MLX
abgitdev 37 минут назад Шесть часов на один рендер: как я собрал нативную студию Ideogram 4 на Swift и MLX Средний 12 мин 930 macOS * Swift * Машинное обучение * Обработка изображений * Open source * Кейс Эта картинка...
<5 — 2026'da uzaya kaç SpaceX Starship fırlatması ulaşacak?
Вот важная новость с фронта ИИ: abgitdev 37 минут назад Шесть часов на один рендер: как я собрал нативную студию Ideogram 4 на Swift и MLX Средний 12 мин 930 macOS * Swift * Машинное обучение * Обработка изображений * Open source * Кейс Эта картинка рисовалась на моём Mac 384 минуты 55 секунд. Quality, 48 шагов, 2048×2048 — 384 минуты 55 секунд, почти шесть с половиной часов. Приложение не зависло.
Рендер честно дошёл до 48-го шага и выдал портрет размером 2048×2048. Просто за время ожидания я успел поработать, поесть, поспать и вернуться к той же девушке в кафе. Она всё ещё рисовалась.
Технические детали
Так я понял, что главная задача моей новой локальной студии — не добавить ещё одну кнопку Generate. Нужно было сделать тяжёлую модель предсказуемой для живого человека и не превратить Mac с 32 ГБ памяти в дорогую грелку с пляжным мячом. Это продолжение моего странного эксперимента: Mac + Swift + MLX = локальный inference без Python-процесса и облачного API.
В первой статье я рассказывал, как три ночи чинил картинки, которые на самом деле не были сломаны. Во второй — как сам придумал главное ограничение своего приложения, поверил в него и даже написал для него тултип. Теперь эксперимент добрался до Ideogram 4.
Главное окно Cyclonminigen 1. 1 (build 19): генерация, настройки композиции и локальная телеметрия в одном нативном интерфейсе. Зачем ещё один генераторПосле Typhoonminigen мне не хотелось делать тот же интерфейс вокруг модели потяжелее.
Отраслевые последствия
В Ideogram 4 меня заинтересовали две вещи: типографика и композиция. 1 (build 19): главное окно со скрытой навигацией, быстрыми инструментами и локальной телеметрией. 1 (build 19): раскрытая панель Fine-tuning с размером холста, пресетом, режимом скорости, Dual CFG и Live Preview.
Модель умеет генерировать изображение сразу на холсте до 2048 пикселей по каждой стороне, работать со структурированными caption и принимать приблизительное расположение объектов через bounding boxes. Из этого получаются вывески, плакаты, character sheet, схемы и сцены, в которых можно заранее попросить: персонаж слева, машина справа, заголовок сверху. Под капотом это тоже не обычный «один трансформер и один сэмплер».
Официальный качественный путь использует asymmetric dual-CFG — два transformer-компонента с собственными файлами весов:conditional-трансформер получает текстовое conditioning и латент изображения;unconditional-трансформер получает тот же латент, но нулевое текстовое conditioning;их направления смешиваются с guidance и обновляют латент. Unconditional здесь — не negative prompt. Это отдельная ветка модели без пользовательского отрицательного текста.
Этот прогресс даёт важные сигналы о будущем отрасли, и технологический мир внимательно наблюдает.





