按该来源的展示范围,站内仅提供摘要。
前往原站阅读(在新标签页打开)Modal 与 CMU 推出 Quail:单张 H100 上每分钟处理超 10 亿 token
AI 导读
Modal 与 CMU Full Stack Data Lab 合作推出查询感知推理层 Quail,在单个 H100 GPU 上对某多表连接查询实现每分钟超 10 亿 token 的处理速度,比同硬件 vLLM 基线快 10 倍以上,Modal 上成本低于每 10 亿 token 6 美分。
Modal 官方工程博客(RSS)
46
AI 编辑部评分,满分 100Modal 与 CMU 推出 Quail:单张 H100 上每分钟处理超 10 亿 token
Modal 与 CMU Full Stack Data Lab 合作推出查询感知推理层 Quail,在单个 H100 GPU 上对某多表连接查询实现每分钟超 10 亿 token 的处理速度,比同硬件 vLLM 基线快 10 倍以上,Modal 上成本低于每 10 亿 token 6 美分。
来源:Modal 官方工程博客(RSS)· modal.com