讀紙 ReadPaper

由 Claude Code Max 翻譯的 AI 論文繁體中文版 · 101 篇

篩選標籤: Evaluation 3 篇 × 清除
2308.09975v2 arXiv License

FinEval:一個面向大型語言模型的中文金融領域知識評測基準

FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models

Xin Guo、Haotian Xia、Zhaowei Liu、Hanyang Cao、Zhi Yang 等 17 人(上海財經大學、UC Irvine、復旦大學、平安科技、騰訊優圖、HSBC Lab...

BenchmarkFinancial LLMEvaluationChinese NLPFinancial AgentFinancial Security中文評測
Liang-Hsun Huang 許願
2608.26133v1 CC BY 4.0 Anthropic

Agent Seer:從規格理解合成評測情境

Agent Seer: Synthesizing Scenarios from Specification Understanding

Harish Karumuri、Mahesh Vemula、David Lopes Pegna(Apple)

AI AgentTool UseMCPEvaluationSynthetic DataLLM-as-JudgeBenchmark
Liang-Hsun Huang 許願
2510.18196v1 CC BY 4.0 Cantina Labs

對比解碼緩解 LLM 評審中的分數範圍偏差

Contrastive Decoding Mitigates Score Range Bias in LLM-as-a-Judge

Yoshinari Fujinuma

LLM-as-a-JudgeEvaluationDecodingBiasSummarizationNLP
Liang-Hsun Huang 許願