FinEval:一個面向大型語言模型的中文金融領域知識評測基準

FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models

摘要

大型語言模型已在各種自然語言處理任務中展現卓越效能,但它們在金融領域的安全 (security) 能力尚未被探索,而在金融智能體 (financial agent) 這類複雜任務上的表現仍屬未知。本文提出 FinEval,一個設計來評估 LLM 金融領域知識與實務能力的基準。資料集含 8,351 題,分為四個關鍵領域:金融學術知識 (Financial Academic Knowledge)、金融產業知識 (Financial Industry Knowledge)、金融安全知識 (Financial Security Knowledge)、金融智能體 (Financial Agent)。金融學術知識由 4,661 道選擇題組成,橫跨金融、經濟等 34 個學科;金融產業知識含 1,434 題,涵蓋投資研究等實務場景;金融安全知識以 1,640 題評估模型(含應用安全、密碼學等主題);金融智能體以 616 題評估工具使用與複雜推理。FinEval 有多種評估設定,包括 zero-shot、帶思維鏈 (CoT) 的 five-shot,並用客觀與主觀準則評估模型表現。我們的結果顯示,Claude 3.5-Sonnet 在 zero-shot 設定下跨所有金融領域類別達到最高加權平均分 72.9。我們的工作提供一個緊密貼合中文金融領域的全面基準。 圖 1: FinEval 分為四部分:金融學術知識、金融產業知識、金融安全知識、金融智能體。各子資料集的題數標在對應名稱後(圖為雙語旭日圖,內圈為四大類、外圈為各學科與題數)。

此論文授權為 arXiv License

非 Creative Commons 授權的論文需登入後方可閱讀翻譯全文

Google 登入後閱讀

原文連結:arXiv