當(dāng)前位置:首頁 >  科技 >  IT業(yè)界 >  正文

英特爾研究院發(fā)布全新AI擴(kuò)散模型,可根據(jù)文本提示生成360度全景圖

 2023-06-25 15:17  來源: 互聯(lián)網(wǎng)   我來投稿 撤稿糾錯(cuò)

  域名預(yù)訂/競(jìng)價(jià),好“米”不錯(cuò)過

英特爾研究院宣布與Blockade Labs合作發(fā)布LDM3D(Latent Diffusion Model for 3D)模型,這一全新的擴(kuò)散模型使用生成式AI創(chuàng)建3D視覺內(nèi)容。LDM3D是業(yè)界領(lǐng)先的利用擴(kuò)散過程(diffusion process)生成深度圖(depth map)的模型,進(jìn)而生成逼真的、沉浸式的360度全景圖。LDM3D有望革新內(nèi)容創(chuàng)作、元宇宙應(yīng)用和數(shù)字體驗(yàn),改變包括娛樂、游戲、建筑和設(shè)計(jì)在內(nèi)的許多行業(yè)。

英特爾研究院人工智能和機(jī)器學(xué)習(xí)研究專家Vasudev Lal表示:“生成式AI技術(shù)旨在提高和增強(qiáng)人類創(chuàng)造力,并節(jié)省時(shí)間。然而,目前的大部分生成式AI模型僅限于生成2D圖像,僅有少數(shù)幾種可根據(jù)文本提示生成3D圖像。在使用幾乎相同數(shù)量參數(shù)的情況下,不同于現(xiàn)存的潛在擴(kuò)散模型,LDM3D可以根據(jù)用戶給定的文本提示同時(shí)生成圖像和深度圖。與深度估計(jì)中的標(biāo)準(zhǔn)后處理方法相比,LDM3D能夠?yàn)閳D像中的每個(gè)像素提供更精準(zhǔn)的相對(duì)深度,并為開發(fā)者省去了大量用于場(chǎng)景開發(fā)的時(shí)間。”

封閉的生態(tài)系統(tǒng)限制了規(guī)模。英特爾致力于推動(dòng)AI的真正普及,通過開放的生態(tài)系統(tǒng)讓更多人從這項(xiàng)技術(shù)中受益。計(jì)算機(jī)視覺領(lǐng)域近年來取得了重大進(jìn)展,特別是在生成式AI方面。然而,當(dāng)今許多先進(jìn)的生成式AI模型只能生成2D圖像。與通常只能根據(jù)文本提示生成2D RGB圖像的現(xiàn)有擴(kuò)散模型不同,LDM3D可以根據(jù)用戶給定的文本提示同時(shí)生成圖像和深度圖。與深度估計(jì)(depth estimation)中的標(biāo)準(zhǔn)后處理(post-processing)方法相比,LDM3D在使用與潛在擴(kuò)散模型Stable Diffusion幾乎相同數(shù)量參數(shù)的情況下,能夠?yàn)閳D像中的每個(gè)像素提供更精準(zhǔn)的相對(duì)深度(relative depth)。

這項(xiàng)研究有望改變我們與數(shù)字內(nèi)容的互動(dòng)方式,基于文本提示為用戶提供全新的體驗(yàn)。LDM3D生成的圖像和深度圖能夠?qū)⒅T如寧靜的熱帶海灘、摩天大樓、科幻宇宙等文本描述轉(zhuǎn)化為細(xì)致的360度全景圖。LDM3D捕捉深度信息的能力,可以即時(shí)增強(qiáng)整體真實(shí)感和沉浸感,使各行各業(yè)的創(chuàng)新應(yīng)用成為可能,包括娛樂、游戲、室內(nèi)設(shè)計(jì)、房產(chǎn)銷售 ,以及虛擬博物館與沉浸式VR體驗(yàn)等。

6月20日,在IEEE/CVF計(jì)算機(jī)視覺和模式識(shí)別會(huì)議(CVPR)的3DMV工作坊上,LDM3D模型獲得了“Best Poster Award”

LDM3D是在LAION-400M數(shù)據(jù)集包含一萬個(gè)樣本的子集上訓(xùn)練而成的。LAION-400M是一個(gè)大型圖文數(shù)據(jù)集,包含超過4億個(gè)圖文對(duì)。對(duì)訓(xùn)練語料庫進(jìn)行標(biāo)注時(shí),研究團(tuán)隊(duì)使用了之前由英特爾研究院開發(fā)的稠密深度估計(jì)模型DPT-Large,為圖像中的每個(gè)像素提供了高度準(zhǔn)確的相對(duì)深度。LAION-400M數(shù)據(jù)集是基于研究用途創(chuàng)建而成的,以便廣大研究人員和其它興趣社群能在更大規(guī)模上測(cè)試模型訓(xùn)練。

LDM3D模型在一臺(tái)英特爾AI超級(jí)計(jì)算機(jī)上完成了訓(xùn)練,該超級(jí)計(jì)算機(jī)由英特爾®至強(qiáng)®處理器和英特爾®Habana Gaudi® AI加速器驅(qū)動(dòng)。最終的模型和流程整合了RGB圖像和深度圖,生成360度全景圖,實(shí)現(xiàn)了沉浸式體驗(yàn)。

為了展示LDM3D的潛力,英特爾和Blockade的研究人員開發(fā)了應(yīng)用程序DepthFusion,通過標(biāo)準(zhǔn)的2D RGB圖像和深度圖創(chuàng)建沉浸式、交互式的360度全景體驗(yàn)。DepthFusion利用了TouchDesigner,一種基于節(jié)點(diǎn)的可視化編程語言,用于實(shí)時(shí)互動(dòng)多媒體內(nèi)容,可將文本提示轉(zhuǎn)化為交互式和沉浸式數(shù)字體驗(yàn)。LDM3D是能生成RGB圖像及其深度圖的單一模型,因此能夠節(jié)省內(nèi)存占用和降低延遲。

LDM3D和DepthFusion的發(fā)布,為多視角生成式AI和計(jì)算機(jī)視覺的進(jìn)一步發(fā)展鋪平了道路。英特爾將繼續(xù)探索如何使用生成式AI增強(qiáng)人類能力,并致力于打造一個(gè)強(qiáng)大的開源AI研發(fā)生態(tài)系統(tǒng),讓更多人能夠使用AI技術(shù)。延續(xù)英特爾對(duì)開放AI生態(tài)系統(tǒng)的大力支持,LDM3D正在通過HuggingFace進(jìn)行開源,讓AI研究人員和從業(yè)者能對(duì)這一系統(tǒng)作出進(jìn)一步改進(jìn),并針對(duì)特定應(yīng)用進(jìn)行微調(diào)。

在2023年6月18日至22日舉行的IEEE/CVF計(jì)算機(jī)視覺和模式識(shí)別會(huì)議上,英特爾將發(fā)表這項(xiàng)研究成果。欲了解更多信息,請(qǐng)參考論文《LDM3D: Latent Diffusion Model for 3D》。

申請(qǐng)創(chuàng)業(yè)報(bào)道,分享創(chuàng)業(yè)好點(diǎn)子。點(diǎn)擊此處,共同探討創(chuàng)業(yè)新機(jī)遇!

相關(guān)標(biāo)簽
英特爾

相關(guān)文章

  • 首次部署英特爾Max系列GPU,極光超算將推動(dòng)人工智能實(shí)現(xiàn)突破性進(jìn)展

    阿貢國家實(shí)驗(yàn)室和英特爾于近日宣布,Aurora超級(jí)計(jì)算機(jī)的10,624個(gè)刀片的安裝已經(jīng)完成,該系統(tǒng)將于2023年晚些時(shí)候上線。該機(jī)器使用數(shù)萬個(gè)XeonMax“SapphireRapids”處理器,配備HBM2E內(nèi)存以及數(shù)以萬計(jì)的數(shù)據(jù)中心GPUMax“PonteVecchio”計(jì)算GPU可實(shí)現(xiàn)超過2F

    標(biāo)簽:
    英特爾
  • 英特爾銳炫:驅(qū)動(dòng)持續(xù)進(jìn)步,盡展硬件潛力

    發(fā)布之初,英特爾銳炫A770和A750顯卡就已展現(xiàn)出不錯(cuò)的實(shí)力。幾個(gè)月過去,它們已然成長(zhǎng)為同價(jià)位最好的顯卡之一。AMD和英偉達(dá)微弱的代際改進(jìn),再加上較高的價(jià)格,讓用戶很難在1500至2500元左右價(jià)位找到一款滿意的顯卡,不過英特爾銳炫顯卡悄悄地填補(bǔ)了這一空白。雖然銳炫A770和A750沒有主打旗艦級(jí)

    標(biāo)簽:
    英特爾
  • 英特爾銳炫Pro圖形顯卡發(fā)布新品,集豐富的內(nèi)容創(chuàng)作功能于一身

    英特爾推出兩款全新英特爾銳炫Pro圖形顯卡;搭載英特爾銳炫ProA40圖形顯卡的系統(tǒng)現(xiàn)已出貨。全新發(fā)布:英特爾今日宣布英特爾銳炫?ProA系列專業(yè)級(jí)圖形顯卡新增兩款產(chǎn)品——英特爾銳炫?ProA60和ProA60M。上述兩款產(chǎn)品的性能在現(xiàn)有英特爾銳炫Pro系列的基礎(chǔ)上更進(jìn)一步,為專業(yè)級(jí)工作站用戶精心設(shè)

    標(biāo)簽:
    英特爾
  • 英特爾發(fā)布全新量子芯片Tunnel Falls,硅自選量子比特有望更快實(shí)現(xiàn)量產(chǎn)

    今天,英特爾發(fā)布包含12個(gè)硅自旋量子比特(siliconspinqubit)的全新量子芯片TunnelFalls,繼續(xù)探索量子實(shí)用性,以解決重大難題。TunnelFalls是英特爾迄今為止研發(fā)的最先進(jìn)的硅自旋量子比特芯片,利用了英特爾數(shù)十年來積累的晶體管設(shè)計(jì)和制造能力。在英特爾的晶圓廠里,Tunne

    標(biāo)簽:
    英特爾
  • 英特爾亮相2023開放原子全球開源峰會(huì):秉持全棧軟件開放戰(zhàn)略,助推科技創(chuàng)新

    在數(shù)字時(shí)代的今天,面對(duì)日益復(fù)雜的應(yīng)用場(chǎng)景和業(yè)務(wù)發(fā)展需求,開源已經(jīng)成為推動(dòng)全球科技創(chuàng)新新模式。在《“十四五”軟件和信息技術(shù)服務(wù)業(yè)發(fā)展規(guī)劃》中,明確提出了“建設(shè)2~3個(gè)有國際影響力的開源社區(qū)”的要求,充分證明中國對(duì)開源社區(qū)和開源技術(shù)的重視與支持,快速推動(dòng)著開源技術(shù)和開源社區(qū)的飛速發(fā)展。6月11-13日,

    標(biāo)簽:
    英特爾

熱門排行

信息推薦