Modal 与 CMU 推出 Quail:单张 H100 上每分钟处理超 10 亿 token
Modal 官方工程博客(RSS)AIHOT 评分 46/100
摘要
Modal 与 CMU Full Stack Data Lab 合作推出查询感知推理层 Quail,在单个 H100 GPU 上对某多表连接查询实现每分钟超 10 亿 token 的处理速度,比同硬件 vLLM 基线快 10 倍以上,Modal 上成本低于每 10 亿 token 6 美分。
原始标题
Hitting a billion tokens per minute on one GPU by combining a query planner and an inference engine