演講:多模態數據生命週期:標註、篩選、混合與合成

 講題: 多模態數據生命週期:標註、篩選、混合與合成

·       講者: 黃子恒 (Tzu-Heng Huang)

·       時間與地點: 1月15日(週四)10:45-12:00

·       地點:臺灣大學博理館101教室 


演講內容簡介:

高質量的真人標註數據是機器學習取得重大突破的核心動力 。然而,隨著多模態模型規模的擴大,對此類數據的需求已遠超人工標註的產能,導致成本與效率成為發展瓶頸 。

本次演講將從**以數據為中心的人工智慧(Data-centric AI)**視角出發,探討多模態數據生命週期的四個關鍵階段:標註、篩選、混合與合成 。

1.   自動化標註: The ALCHEmist,這是一個透過程式蒸餾(Program Distillation)實現的新型自動化標註系統,並分享其在大型語言模型(LLM)評測指標中的應用(收錄於 NeurIPS 2024 Spotlight) 。

2.   細粒度篩選: Grad-Mimic,這是一種用於高效預訓練的細粒度數據篩選技術(收錄於 ICML 2025 DataWorld Oral) 。

3.   數據混合: R&B 策略,這是一種旨在優化多模態數據組合並降低開銷的數據混合方法 。

4.   數據合成:提出一個具備**可學習性感知(Learnability-aware)**的數據合成框架 。

總體而言,這些基於**弱監督學習(Weak Supervision)**的數據中心化方法,有望實現更有效的數據篩選、更高效率的生成,並建構出輕量化標註的機器學習系統,以支撐未來大規模多模態模型的擴展 。


講者簡介:

威斯康辛大學麥迪遜分校(University of Wisconsin-Madison)電腦科學系的博士候選人(應屆畢業生),師從 Frederic Sala 教授 。他於 2020 年取得國立政治大學電腦科學系學士學位 。其現階段研究聚焦於多模態模型的以數據為中心之人工智慧(Data-Centric AI),致力於開發能讓模型在較少監督下學習更多知識的方法 。

核心研究領域:

l  在線領域混合(Online Domain Mixing) 

l  模型感知之預訓練數據篩選(Model-aware Pretraining Data Selection) 

l  數據策展集成(Data Curation Ensembles) 

l  具成本效益的自動化標註系統 

研究經歷:

曾在 Apple AIML(專注於大規模 CLIP 預訓練)、Meta GenAI(專注於合成數據生成)以及阿貢國家實驗室(Argonne National Laboratory)實習 。此外,他創辦了 Awan.AI LLC(現已併入 TechTCM),致力於將 AI 代理技術應用於傳統中醫領域 。

獲獎經歷:

研究成果多次發表於 NeurIPS、ICML 及 ICCV 等頂級學術會議,並榮獲 NeurIPS 2024 SpotlightICML 2025 DataWorld Oral 以及 ICCV DataComp 2023 冠軍等獎項 。