跳到正文
HuggingFace Daily Papers·· 4 天前AI 评分38

SimuVerity:面向工程级 Simulink 模型生成的智能体基准测试

SimuVerity: Benchmarking Agents for Engineering-Grade Simulink Model Generation

AI 导读

SimuVerity 是一个包含 101 个文本到可执行 Simulink 模型生成任务的基准,覆盖十个工程领域,采用分层评估器先检查产物交付、原生可执行性与工程合格性,再从准确度、输出质量、机制保真度、控制与因果完整性、工况鲁棒性和动态响应六个维度打分。六个智能体系统参与评测,最佳系统总分仅 42.86,表明结构相似度无法代表工程性能,部分高分模型仍存在严重的视觉布局混乱。

来源:HuggingFace Daily Papers · arxiv.org