在今年的春晚舞臺上,機器仿真蔡明為什么能讓人真假難辨?答案或許就藏在人臉的細微變化中。三維人臉關鍵點檢測,是虛擬人擁有生動表情、識別身份、具身智能等多種應用的關鍵技術環節之一。
然而,傳統方法普遍依賴2D紋理輔助或標準3D數字人臉模型,其性能受限于紋理映射誤差以及數字人臉與真實人臉之間的差異。此外,由于缺乏大規模、高精度、真實采集且準確標注的3D人臉數據庫,直接基于點云的3D人臉關鍵點檢測技術一直面臨數據不足與泛化能力弱的問題。
2月26日,中國科學院深圳先進技術研究院(簡稱“深圳先進院”)集成所機器視覺研究中心研究員宋展團隊,與福建理工大學教授葉于平團隊合作在《IEEE電路與系統匯刊(視頻技術)》發表的最新研究成果,為解決這一難題提供了全新思路。
該研究中,宋展團隊基于自主研制的高精度3D/4D人臉采集設備,經過近三年的規范化數據采集與數據庫構建,構建了大規模的高精度、真實標注的三維人臉數據庫,其中高保真人臉數據的個數近20萬,數據量達到世界領先水平。在此基礎上,宋展團隊聯合葉于平團隊提出了一種面向無序點云的曲率融合圖注意力網絡(CFGAT),實現了從原始 3D 點云直接預測人臉關鍵點坐標的高精度檢測框架,實現了從“千人一面”到“因人而異”的本質性提升,為高保真度虛擬人面部驅動,以及機器人臉部表情高逼真度驅動技術,提供了基礎理論支撐。

團隊構建的高精度3D/4D人臉采集設備。研究團隊供圖
在技術上,合作團隊首先基于幾何驅動的點云采樣策略,從原始三維人臉點云中,提取攜帶曲率信息的簡化點集,保留關鍵幾何結構。隨后,將曲率編碼為顯式幾何先驗融入注意力模塊,使網絡能夠更敏感地捕獲局部形狀變化,并通過圖注意力結構自適應建模點云的局部與全局關系,從而實現對關鍵點位置的直接預測。該框架有效解決了點云無序性帶來的特征表達困難,使模型能夠在真實三維數據上獲得更穩定、更精確的關鍵點定位結果。
一直以來,宋展團隊長期深耕三維重建研究領域,基于自主研發的3D/4D視覺成像系統,構建了多類型高質量數據庫體系,其中包括:高保真多表情3D人臉數據庫;持續采集12年、規模接近20萬的高精度3D人臉方陣數據庫,位列全球同類數據庫前列;以及規范化3D人臉關鍵點數據庫、高精度3D人體數據庫以及高精度動態4D人臉表情數據庫等。其中,“多模態高精度人類生物特征數據集”入選了2025年福建省首批人工智能行業高質量數據集名單。

宋展團隊近年來構建的多類三維數據集的元數據示意。研究團隊供圖
“從真假難辨的虛擬人到未來能讀懂人類情緒、自然交互的機器人,背后都離不開基礎數據的支撐。這一系列數據庫已成為仿人機器人關鍵技術鏈條中的核心支撐,為高逼真度感知、表達建模與行為生成提供基礎數據。未來,這些數據集將進一步服務于數據驅動的大模型仿人機器人體系,以構建更自然、更智能的人機交互能力。”宋展表示。
相關論文信息:https://ieeexplore.ieee.org/document/11414185