HiDream.ai показала модель, которая обещает превращать текст и фото в интерактивные 3D-миры
HiDream.ai показала модель, которая обещает превращать текст и фото в интерактивные 3D-миры
Китайская HiDream.ai объявила о HiDream-O1-World — нативной мультимодальной модели мира. По сообщению компании, она строит целые исследуемые трёхмерные сцены по короткому текстовому запросу, одному изображению или управляющему действию. Затем пользователь может перемещаться по миру, менять ракурс и взаимодействовать с объектами.
Новость вышла 24 августа через Media OutReach. В публикации прямо указано, что за её содержание отвечает эмитент, поэтому описанные возможности и показатели следует читать как заявления HiDream.ai.
Обещание — не просто сгенерировать кадр
Компания выделяет три режима: навигацию, редактирование и взаимодействие. В качестве примера она описывает цифровую копию комнаты по фотографии: модель должна достраивать панораму и позволять исследовать её от первого или третьего лица. Пользователь также может задавать персонажу действия — взять предмет, бежать, присесть или прыгнуть — либо запускать событие вроде дождя.
Главное техническое обещание — не терять геометрию сцены при поворотах и приближении камеры: объекты не должны исчезать или деформироваться. HiDream.ai также заявляет о «физической согласованности» — правдоподобных столкновениях, перекрытиях объектов и реакции на гравитацию. Эти свойства критичны для интерактивной сцены: красивый видеоролик не становится миром, если при следующем взгляде меняется планировка.
Таблица лидеров и границы заявления
По данным HiDream.ai, HiDream-O1-World заняла первое место в подтаблице Navi бенчмарка WBench со средним результатом 80,9; по согласованности компания указывает 88,0, по физическому измерению — 73,3. Это результаты, приведённые в релизе самой компании, а не независимое подтверждение редакции.
HiDream.ai называет возможными областями применения интерактивное кино и игры, симуляторы для робототехники, автономного вождения и производства, а также создание 3D-сцен. Пока это скорее направление, чем доказанная готовность для этих задач. Но релиз показывает, куда смещается гонка генеративного ИИ: от единичных картинок и роликов — к сценам, которые должны выдерживать действие пользователя.













