讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Benchmark 10 篇 × 清除
2308.09975v2 arXiv License

FinEval:一個面向大型語言模型的中文金融領域知識評測基準

FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models

Xin Guo、Haotian Xia、Zhaowei Liu、Hanyang Cao、Zhi Yang 等 17 人(上海財經大學、UC Irvine、復旦大學、平安科技、騰訊優圖、HSBC Lab...

BenchmarkFinancial LLMEvaluationChinese NLPFinancial AgentFinancial Security中文評測
Liang-Hsun Huang 許願
2608.26133v1 CC BY 4.0 Anthropic

Agent Seer:從規格理解合成評測情境

Agent Seer: Synthesizing Scenarios from Specification Understanding

Harish Karumuri、Mahesh Vemula、David Lopes Pegna(Apple)

AI AgentTool UseMCPEvaluationSynthetic DataLLM-as-JudgeBenchmark
Liang-Hsun Huang 許願
2603.24621v2 arXiv License MIT

ARC-AGI-3:前沿代理式智慧的全新挑戰

ARC-AGI-3 A New Challenge for Frontier Agentic Intelligence

ARC Prize Foundation

ARC-AGIAGIBenchmarkAgentReasoning互動式環境評測
Liang-Hsun Huang 許願
2505.15859v1 CC BY 4.0

AutoData:一個用於開放網路資料蒐集的多代理人系統

AutoData: A Multi-Agent System for Open Web Data Collection

Tianyi Ma, Yiyue Qian, Zheyuan Zhang, Zehong Wang, Xiaoye Qian, Feifan Bai, Yifan Ding, Xuwei Luo, S...

Multi-Agent SystemLLM AgentWeb ScrapingData CollectionInformation ExtractionBenchmarkHypergraph
kerg kerg 許願
2601.07206v1 CC BY 4.0 OpenAI

LLMRouterBench:一個大規模基準與用於 LLM 路由的統一框架

LLMRouterBench: A Massive Benchmark and Unified Framework for LLM Routing

Hao Li, Yiqun Zhang, Zhaoyan Guo, Chenxu Wang, Shengji Tang, Qiaosheng Zhang, Yang Chen, Biqing Qi, ...

LLM RoutingBenchmarkLLMModel EnsemblePerformance-Cost開源模型
林伯燊 許願
2606.18699v1 CC BY 4.0

TW-LegalBench:衡量台灣法律理解能力

TW-LegalBench: Measuring Taiwanese Legal Understanding

Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu, Kuan Hsuan Yeh, Zih-Ching Chen, Kuan-Ming Chen, Patrick...

LLMBenchmark法律 NLP繁體中文台灣法律LLM-as-Judge判決預測
鄭子凡 許願
2406.11794v4 CC BY 4.0

DataComp-LM:探索下一代語言模型訓練集

DataComp-LM In search of the next generation of training sets for language models

Jeffrey Li, Alex Fang, et al.

LLMPretraining DataBenchmarkOpen DatasetData CurationCommon Crawl
Thomas Liang 許願
2506.04178v2 CC BY 4.0 Alibaba / Qwen Team

OpenThoughts:推理模型的資料配方

OpenThoughts Data Recipes for Reasoning Models

Etash Guha, et al.

LLMReasoningData RecipeSFTOpen DatasetDistillationBenchmark
Thomas Liang 許願
2604.15597v1 arXiv License

當你委派工作時,LLMs 會污染你的文件

LLMs Corrupt Your Documents When You Delegate

Philippe Laban, Tobias Schnabel, Jennifer Neville

LLMDocument EditingHallucinationAgentBenchmarkLong-Horizon EvaluationDelegated Work
Liang-Hsun Huang 許願
2604.04771v2 arXiv License Alibaba / Qwen Team

MinerU2.5-Pro:推動資料中心文件解析的規模極限

MinerU2.5-Pro Pushing the Limits of Data-Centric Document Parsing at Scale

Bin Wang, Tianyao He, Linke Ouyang, Fan Wu, Zhiyuan Zhao, et al.(上海 AI Lab、北京大學、上海交大、商湯科技)

Document ParsingVLMOCRData-Centric AIBenchmark文件解析
鄭子凡 許願