Сегодня 14 января 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → панорама

Intel Labs представила нейросеть для генерации панорамных изображений с 360-градусным обзором

Intel Labs в сотрудничестве с Blockade Labs представили латентную диффузионную ИИ-модель для создания панорамных трёхмерных изображений (LDM3D) с 360-градусным обзором, которая первой в отрасли обеспечивает отображение глубины сцены. LDM3D может произвести революцию в создании реалистичного визуального 3D-контента, приложениях метавселенной и цифровом опыте, найти применение в широком спектре отраслей — от развлечений и игр до архитектуры и дизайна.

 Источник изображения: Intel Labs

Источник изображения: Intel Labs

LDM3D была обучена на наборе данных, созданном из подмножества 10 000 образцов базы данных LAION-400M, которая содержит более 400 миллионов пар изображений и подписей к ним. Для отображения точной относительной глубины каждого пикселя была использована разработанная Intel Labs модель Dense Prediction Transformer (DPT). Набор данных LAION-400M создан, чтобы обеспечить возможность широкомасштабного тестирования модели для широкого круга исследователей и других заинтересованных сообществ.

Модель LDM3D обучалась на суперкомпьютере Intel AI на базе процессоров Intel Xeon и ускорителей Intel Habana Gaudi AI. Полученная модель и конвейер объединяют сгенерированное изображение и карту глубины для создания 360-градусных панорамных представлений.

Чтобы продемонстрировать потенциал LDM3D, исследователи разработали приложение DepthFusion, которое использует стандартные 2D-фотографии RGB и карты глубины для создания интерактивной 360-градусной панорамы. Для превращения текстовых подсказок в 3D-панорамы применяется язык визуального программирования TouchDesigner на основе узлов для интерактивного мультимедийного контента в реальном времени. Модель LDM3D объединяет изображение RGB и его карту глубины, что приводит к экономии памяти и ускорению работы.

Примеры панорамных изображений с 360-градусным обзором

«Технология генеративного ИИ направлена на расширение человеческого творчества и экономию времени. Однако большинство сегодняшних моделей ИИ ограничены созданием 2D-изображений. В отличие от них LDM3D позволяет пользователям генерировать изображение и карту глубины из заданной текстовой подсказки. Это обеспечивает более точную относительную глубину для каждого пикселя по сравнению со стандартными методами постобработки и экономит разработчикам значительное время при разработке сцен», — пояснил Васудев Лал (Vasudev Lal), научный сотрудник Intel Labs.

Это исследование может революционизировать взаимодействие с цифровым контентом, позволяя пользователям отображать текстовые подсказки ранее немыслимыми способами. Изображения и карты глубины, сгенерированные LDM3D, позволяют пользователям превратить текстовое описание безмятежного тропического пляжа, современного небоскрёба или научно-фантастической вселенной в детализированную панораму. Способность создавать карту глубины изображения может мгновенно повысить общий реализм и погружение, позволяя создавать инновационные приложения для различных отраслей, от развлечений и игр до дизайна интерьеров и каталогов недвижимости, а также виртуальных музеев и иммерсивной виртуальной реальности.

Внедрение LDM3D и DepthFusion прокладывает путь к дальнейшему развитию генеративного ИИ и компьютерного зрения. Intel продолжит исследования генеративного ИИ для расширения человеческих возможностей и создания экосистемы разработок в области ИИ с открытым исходным кодом, которая демократизирует доступ к этой технологии. LDM3D предоставляется с открытым исходным кодом через сообщество HuggingFace.


window-new
Soft
Hard
Тренды 🔥
«Если бы у Diablo и Escape from Tarkov родился ребёнок»: разработчики Wolcen: Lords of Mayhem анонсировали загробный боевик Project Pantheon 39 мин.
«Чистый вымысел»: в TikTok прокомментировали слухи о своей продаже Илону Маску 59 мин.
Классическую игру «Змейка» смогли ужать до 56 байт и уместить в QR-код 2 ч.
Google оштрафовали в России на 8 млрд рублей за неуплату штрафа 2 ч.
Китайский аналог TikTok стал лидером по скачиваниям в App Store в США 2 ч.
Бывший художник Bethesda объяснил, почему Starfield получилась не такой кровавой, как Fallout 4 3 ч.
Количество хакерских атак на российские компании выросло в 2,5 раза в 2024 году 6 ч.
Ремастеру культовой стратегии Stronghold покорилась новая вершина продаж — Stronghold: Definitive Edition продолжает радовать создателей 7 ч.
Еврокомиссия пересмотрит все дела против Apple, Meta и Google из-за прихода к власти Трампа 7 ч.
Инсайдер: на Developer_Direct анонсируют новую игру в легендарной серии, которая «должна обрадовать множество фанатов» 7 ч.
Учёные впервые заглянули внутрь нейтронных звёзд, совершив прорыв в их моделировании на суперкомпьютерах 34 мин.
США запретили умные автомобили из Китая и России, и разрешили строить дата-центры для ИИ на федеральных землях 43 мин.
DJI представила компактный складной дрон Flip со встроенной защитой лопастей и ценой $439 60 мин.
JLL: мировой спрос на ЦОД будет расти, несмотря на дефицит доступной энергии 3 ч.
Constellation Energy купит за $26,6 млрд Calpine Corporation и станет крупнейшим розничным поставщиком электричества в США 3 ч.
Россияне теперь покупают меньше смартфонов, но тратят на них больше: Apple лидирует по деньгам, а Xiaomi — по количеству 4 ч.
Asus официально представила недорогой мини-ПК NUC 14 Essential 4 ч.
Прототип сверхзвукового лайнера Boom Supersonic XB-1 впервые вышел на границу сверхзвука 5 ч.
Qualcomm переманила главного архитектора серверных процессоров Intel Xeon 5 ч.
Sapphire намекнула на выпуск видеокарт Radeon RX 9000 Pulse, но выпустит и более интересные модели 5 ч.