HuggingFace Daily Papers(社区热门论文)·· 5 天前AI 评分50
IndicBankBench:评估印度零售银行语言模型助手的安全性与可靠性
IndicBankBench: Evaluating Safety and Reliability of Language Model Assistants in Indian Retail Banking
AI 导读
研究推出 IndicBankBench,一个包含799个案例的印度零售银行基准测试,涵盖五个操作域及能力/拒绝域。该基准在安全、行动与工具使用、响应充分性及建议质量四个阶段进行评估,采用确定性检查结合LLM裁判。对11个模型的测试显示,严格通过率(pass^3)仅为43.7%至58.2%,远低于至少一次成功率的60%-74%,揭示了现有评估可能高估了银行场景下的可靠行为。数据集与评估框架已开源。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org