【環(huán)球網(wǎng)科技報(bào)道 記者 李文瑤】7月9日消息,歐洲計(jì)算機(jī)視覺頂級(jí)會(huì)議ECCV 2026日前公布結(jié)果,阿里云與上海交通大學(xué)張林峰教授團(tuán)隊(duì)合作的3篇論文被主會(huì)收錄,研究方向均聚焦Diffusion Transformer(DiT)架構(gòu)下的高效推理加速,涵蓋時(shí)序誤差校正、自適應(yīng)特征分解、時(shí)空令牌篩選三條技術(shù)路線。其中在高分辨率圖片生成場(chǎng)景下,可將算力需求縮短近90%,綜合提速最高14.76倍。
ECCV是計(jì)算機(jī)視覺領(lǐng)域公認(rèn)的三大國(guó)際頂級(jí)學(xué)術(shù)會(huì)議之一,目標(biāo)檢測(cè)、圖像分割、視覺Transformer等多項(xiàng)影響行業(yè)格局的核心技術(shù),均首次亮相于該會(huì)議。DiT作為當(dāng)前主流視覺生成模型的通用架構(gòu),廣泛應(yīng)用于文生圖、文生***、圖像編輯等領(lǐng)域,但推理成本高、生成耗時(shí)長(zhǎng)的問題日益突出,被業(yè)界視為AIGC規(guī)模化落地的主要瓶頸之一。。
第一篇論文《Accelerating Diffusion Transformers with Gaussian Process Rectified Feature Cache》聚焦時(shí)序緩存誤差校正。DiT生成一張圖通常要跑幾十上百步去噪,業(yè)界常用"特征緩存"跳步復(fù)用,但預(yù)測(cè)偏差會(huì)隨之滾雪球式放大。團(tuán)隊(duì)發(fā)現(xiàn)緩存殘差在局部嚴(yán)格服從零均值高斯分布,據(jù)此用高斯過程回歸搭建輕量級(jí)校正模塊,可無縫掛載至主流時(shí)序緩存算法之后。與TaylorSeer結(jié)合后,在Qwen-Image上把計(jì)算量再降19.3%的同時(shí),PSNR提升0.9dB,LPIPS從0.65降至0.29,實(shí)現(xiàn)更快且更清晰的生成效果,破解了長(zhǎng)區(qū)間預(yù)測(cè)漂移難題。
第二篇論文《LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching》提出基于可學(xué)習(xí)可逆網(wǎng)絡(luò)的特征緩存框架LinCa,首次系統(tǒng)性發(fā)現(xiàn)擴(kuò)散特征演化的異質(zhì)性同時(shí)存在于跨模型、跨去噪階段、跨特征維度三個(gè)層面。LinCa將原始特征沿通道維度分解為不同"性格"的子分量,對(duì)連續(xù)性強(qiáng)的子分量***用高階預(yù)測(cè)器外推,對(duì)突變強(qiáng)的子分量則直接復(fù)用,單卡GPU訓(xùn)練1小時(shí)即可完成適配。測(cè)試中,F(xiàn)LUX.1-dev實(shí)現(xiàn)5.51倍加速,Qwen-Image達(dá)6.95倍,HunyuanVideo***模型實(shí)現(xiàn)5.50倍加速,畫質(zhì)指標(biāo)全面領(lǐng)先主流方案。
動(dòng)態(tài)分辨率是高分辨率 DiT 推理的核心加速方向之一,但傳統(tǒng)方案在分辨率切換時(shí)會(huì)統(tǒng)一上***樣全部隱式令牌,導(dǎo)致大量背景、低語義區(qū)域產(chǎn)生冗余計(jì)算;現(xiàn)有局部上***樣方法多依賴邊緣、紋理等底層視覺特征,難以匹配文本語義與編輯指令的需求,容易造成關(guān)鍵區(qū)域細(xì)節(jié)缺失。
阿里云和交大合作的第三篇論文《AViTS: Adaptive Spatiotemporal Token Selection for Efficient DiTs with Dynamic Resolution》提出了時(shí)空動(dòng)態(tài)令牌篩選框架AViTS,通過"低分辨率打底—選擇性上***樣—全分辨率精修"三階段生成流程,砍掉背景與低語義區(qū)域的冗余算力。該方法完全在推理階段執(zhí)行,無需重新訓(xùn)練,且與特征緩存、模型蒸餾、量化等加速技術(shù)完全正交。實(shí)驗(yàn)數(shù)據(jù)顯示,AViTS在FLUX模型上最高實(shí)現(xiàn)6.34倍推理加速,編輯場(chǎng)景FLOPs削減近9倍;疊加步驟蒸餾后,綜合提速最高可達(dá)14.76倍。
據(jù)了解,上述3項(xiàng)技術(shù)已完整集成至阿里云自研的WuYingDiT推理加速引擎,并全量落地至無影靈構(gòu)一站式AIGC創(chuàng)研平臺(tái),服務(wù)游戲美術(shù)、電商設(shè)計(jì)、影視制作、新媒體等行業(yè)客戶,原生適配FLUX、Qwen、混元***等主流生成基座,客戶無需改造現(xiàn)有工作流即可一鍵啟用。
阿里云方面表示,未來將持續(xù)在端側(cè)生成式AI前沿技術(shù)方向開展研究,把真實(shí)業(yè)務(wù)場(chǎng)景中的技術(shù)難題與學(xué)術(shù)研究相結(jié)合,持續(xù)迭代WuYingDiT加速引擎,進(jìn)一步降低端側(cè)、邊緣場(chǎng)景高保真生成式AI的應(yīng)用門檻。