Autodata:以代理人扮演資料科學家來生成高品質合成資料

Autodata: An agentic data scientist to create high quality synthetic data

摘要

我們提出 Autodata,一種通用方法,使 AI 代理人 (Agent) 能夠扮演資料科學家 (Data Scientist) 的角色,建構高品質的訓練與評測資料。我們展示如何訓練(元最佳化,Meta-Optimize)這樣一個資料科學家代理人,使其學會生成更強的資料。我們描述了整體的構想形式,以及一個具體可行的實作,稱為 Agentic Self-Instruct。我們在電腦科學研究任務、法律推理任務,以及對數學物件 (Mathematical Object) 的推理任務上進行實驗,在每一種任務中,相較於傳統的合成資料集生成方法都取得了更好的結果。此外,對資料科學家代理人本身進行元最佳化,能帶來更大的效能提升。代理式資料生成 (Agentic Data Creation) 提供了一條途徑,把增加的推論期計算量 (Inference Compute) 轉換成更高品質的模型訓練資料。整體而言,我們相信這個方向有潛力改變我們建構 AI 資料的方式。 圖 1:Autodata 流程。 此框架採用一個自主代理人來模擬資料科學家的角色,反覆地生成資料、進行定性檢視 (Qualitative Inspection) 與定量效能評估 (Quantitative Performance Evaluation)、彙整洞見,並更新資料生成配方 (Recipe)。此代理人本身也可以被訓練,使其更擅長資料科學家的角色,所用的判準與內層迴圈 (Inner Loop) 相同。這個循環過程旨在逐步提升資料品質;圖中描繪的是各種可能實例所共有的通用工作流程。

此論文授權為 arXiv License

非 Creative Commons 授權的論文需登入後方可閱讀翻譯全文

Google 登入後閱讀

原文連結:arXiv