Назад
25 августа 2026 г. в 22:03 AI HiDream.ai мультимодальные модели 3D модели мира HiDream.ai / Media OutReach через Vietnam Investment Review

HiDream.ai показала модель, которая обещает превращать текст и фото в интерактивные 3D-миры

HiDream.ai показала модель, которая обещает превращать текст и фото в интерактивные 3D-миры

HiDream.ai показала модель, которая обещает превращать текст и фото в интерактивные 3D-миры

Китайская HiDream.ai объявила о HiDream-O1-World — нативной мультимодальной модели мира. По сообщению компании, она строит целые исследуемые трёхмерные сцены по короткому текстовому запросу, одному изображению или управляющему действию. Затем пользователь может перемещаться по миру, менять ракурс и взаимодействовать с объектами.

Новость вышла 24 августа через Media OutReach. В публикации прямо указано, что за её содержание отвечает эмитент, поэтому описанные возможности и показатели следует читать как заявления HiDream.ai.

Обещание — не просто сгенерировать кадр

Компания выделяет три режима: навигацию, редактирование и взаимодействие. В качестве примера она описывает цифровую копию комнаты по фотографии: модель должна достраивать панораму и позволять исследовать её от первого или третьего лица. Пользователь также может задавать персонажу действия — взять предмет, бежать, присесть или прыгнуть — либо запускать событие вроде дождя.

Главное техническое обещание — не терять геометрию сцены при поворотах и приближении камеры: объекты не должны исчезать или деформироваться. HiDream.ai также заявляет о «физической согласованности» — правдоподобных столкновениях, перекрытиях объектов и реакции на гравитацию. Эти свойства критичны для интерактивной сцены: красивый видеоролик не становится миром, если при следующем взгляде меняется планировка.

Таблица лидеров и границы заявления

По данным HiDream.ai, HiDream-O1-World заняла первое место в подтаблице Navi бенчмарка WBench со средним результатом 80,9; по согласованности компания указывает 88,0, по физическому измерению — 73,3. Это результаты, приведённые в релизе самой компании, а не независимое подтверждение редакции.

HiDream.ai называет возможными областями применения интерактивное кино и игры, симуляторы для робототехники, автономного вождения и производства, а также создание 3D-сцен. Пока это скорее направление, чем доказанная готовность для этих задач. Но релиз показывает, куда смещается гонка генеративного ИИ: от единичных картинок и роликов — к сценам, которые должны выдерживать действие пользователя.

Ещё новости

Anthropic запретила «жестокость» к Claude — но границы пока размыты
9 октября 2026 г.
Anthropic запретила «жестокость» к Claude — но границы пока размыты

Anthropic внесла в правила Claude запрет на «длительное и беспричинное» оскорбительное или жестокое поведение по отношению к своим моделям. Компания обещает применять пункт лишь в крайних случаях, но публичного критерия для этой границы пока нет.

GitHub Copilot CLI научился находить локальные модели Ollama
9 октября 2026 г.
GitHub Copilot CLI научился находить локальные модели Ollama

В Copilot CLI появилась команда, которая показывает совместимые модели из уже запущенного Ollama. Но локальная модель сама по себе не делает сессию офлайн и не отменяет телеметрию GitHub.

Google представила Gemini agent: рабочий ИИ с доступом к корпоративным системам
9 октября 2026 г.
Google представила Gemini agent: рабочий ИИ с доступом к корпоративным системам

Google Cloud представила Gemini agent — корпоративного агента, который получает контекст компании, выбирает модели и выполняет задачи через подключённые системы. Главное для команд — это не новый чат, а ещё одна точка, где придётся заранее определить права, бюджеты и проверку результата.

Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио
8 октября 2026 г.
Google выпустила EmbeddingGemma 2 для локального поиска по фото, видео и аудио

Google DeepMind представила открытую 740-миллионную EmbeddingGemma 2: модель сопоставляет текст, изображения, кадры видео и аудио в одном векторном пространстве. Для разработчиков это путь к локальному поиску по медиатеке без обязательной отправки файлов в облако.

В Codex CLI появился вход в MCP-серверы из терминала
8 октября 2026 г.
В Codex CLI появился вход в MCP-серверы из терминала

В версии Codex CLI 0.161.0 OpenAI добавила команду для входа в MCP-серверы из активной терминальной сессии. Обновление также меняет стандартную модель в части каталогов и добавляет настройки голосового режима.

Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле
7 октября 2026 г.
Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле

Anthropic представила Claude Haiku 5.5 — малую модель для быстрых и недорогих задач: от классификации и суммаризации до субагентов и работы в браузере. Для запросов до 100 тысяч токенов вход и выход стали в десять раз дешевле, чем у Haiku 4.5.

Google запустил Playground: игры по текстовому запросу
7 октября 2026 г.
Google запустил Playground: игры по текстовому запросу

Google открыл экспериментальную платформу Playground: пользователь описывает игру текстом, тестирует её в браузере и делится ссылкой. На старте сервис доступен совершеннолетним пользователям из США, а возможности создания зависят от подписки Google One.

OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены
7 октября 2026 г.
OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены

OpenAI открыла каталог результатов внутренней модели: 722 рукописи в 372 связанных семействах. Компания подчёркивает, что материалы находятся на разных стадиях проверки, а часть результатов без формализации в Lean может содержать ошибки.

Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой
7 октября 2026 г.
Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой

Georgia Tech получила одобрение на новую онлайн-магистратуру по искусственному интеллекту. Старт намечен на 2027 год: программа обещает шесть направлений и обязательный проект с компанией или организацией, но детали приёма и стоимости пока не раскрыты.

Mistral Large 4: API уже доступен, веса — в конце октября
6 октября 2026 г.
Mistral Large 4: API уже доступен, веса — в конце октября

Mistral открыла public preview Mistral Large 4 — мультимодальной модели с 1 трлн параметров, из которых активно 49 млрд. В API её уже можно попробовать, но обещанные open weights появятся лишь в конце октября.

Reflection показала Beam на 501 млрд параметров — но веса выйдут позже
6 октября 2026 г.
Reflection показала Beam на 501 млрд параметров — но веса выйдут позже

Reflection представила Beam — открытую по весам MoE-модель для кода, рассуждений и агентов. Пока это ранний доступ: веса, model card и технический отчёт обещаны лишь позднее в октябре.

OpenAI начнёт маркировать тексты ChatGPT и Codex в ЕС
6 октября 2026 г.
OpenAI начнёт маркировать тексты ChatGPT и Codex в ЕС

OpenAI сообщила, что будет добавлять невидимую маркировку в тексты ChatGPT и Codex для пользователей из ЕС. Метка должна помочь выполнять требования AI Act, но компания признаёт: после существенной правки текста её будет труднее обнаружить.