MLCommons Edge LLM Taskforce宣布,将在MLPerf Inference v6.1轮次中引入全新的Edge Agentic Inference基准。随着coding copilots、机器人控制器、私有本地助手等Agentic LLM越来越多地在设备端运行,如何在真实边缘预算下衡量模型调用工具的准确性与响应速度,正在变得越来越关键。
本轮基准首次采用Qwen3.6-27B模型(2026年4月22日发布),参考实现中以Q4_K_M GGUF量化格式运行在单个边缘加速器上。提交者也可以使用任何符合准确率门槛的允许量化方案。工作负载由两部分组成:用于确定性、无需LLM裁判的准确率门槛的Berkeley Function Calling Leaderboard v4(BFCL v4),以及用于单流性能评测的录制式agentic-coding replay。两者共同刻画了设备端Agent的真实挑战:不断增长的长工具调用对话,必须装入固定上下文窗口,并对单个交互用户保持足够响应。
提交截止日期为2026年7月31日。MLCommons邀请硬件厂商、边缘设备制造商和推理系统专家提交结果,共同提升设备端Agentic推理的评测标准。
为什么需要边缘侧Agentic AI基准
应用AI正在从单轮文本生成转向多轮Agentic工作负载。真实的Agentic会话不是“一次提示、一次回答”,而是一条连续轨迹:每一轮都会把工具输出和模型回复追加到不断增长的对话历史中;模型在短工具调用和较长推理之间切换;每一轮又严格依赖前一轮的结果。
数据中心版MLPerf Agentic benchmark(计划于9月推出)关注的是另一类问题:大规模Mixture-of-Experts模型、累计多轮上下文超过100K tokens的长周期轨迹,以及通过并发扫描得到每GPU的Pareto frontier。边缘侧则恰好相反,本次基准主要针对以下约束:
- 固定内存与功耗预算:单个小型加速器需要同时容纳模型权重、KV cache和激活值。全精度frontier model通常无法放入,因此量化成为必要选择。
- 单个在途请求:边缘推理主要服务一个交互用户,而不是数据中心里成千上万的并发会话。
- 固定served context window:参考实现将served context固定为32K tokens。这不是设备上限,而是受控的基准参数,因此长轨迹可能耗尽上下文窗口,使上下文增长与截断成为可测量的一阶影响。
- 关注单用户延迟而非总吞吐:在单slot边缘设备上,吞吐与延迟基本互为倒数,因此更重要的指标是单轮TTFT、TPOT和端到端turn latency,而不是多流数据中心服务器优化的aggregate QPS或token throughput。
该基准继承了数据中心Agentic规范中的多轮方法论,包括术语、确定性replay、JSONL数据集schema和inline accuracy check,并针对边缘场景做了专门化:边缘模型与量化方案、单流负载模式、以延迟为中心的指标,以及具备统计稳健性的准确率门槛。
模型选择:Qwen3.6-27B与Q4_K_M量化
参考模型为Qwen3.6-27B,通过llama.cpp(commit cfff1fc)以Q4_K_M GGUF量化形式提供服务,GGUF文件来自unsloth/Qwen3.6-27B-GGUF中的Qwen3.6-27B-Q4_K_M.gguf。
MLCommons选择Qwen3.6的原因在于,它是一个开放(Apache 2.0)、具备较强工具调用能力的模型,并带有原生MTP speculative-decoding head。尽管它是27B dense模型,阿里巴巴报告称其在主要代码基准中超过此前397B-MoE旗舰模型,并在SWE-bench Verified上达到77.2%。同时,它具备较好的部署便利性:官方权重发布在Hugging Face和ModelScope,社区GGUF版本也可直接在llama.cpp下运行。
量化是边缘部署的关键选择。Q4_K_M属于4-bit K-quant的“Medium”档:权重以每值4 bit存储,相比BF16带来约4倍内存压缩;attention blocks相比feed-forward blocks保留更高精度;并通过importance-weighted(imatrix)校准保留影响最大的权重。最终,27B模型约需16.5GB VRAM即可运行,而BF16约需54GB,代价是约2%至5%的准确率损失。这正是“能在边缘GPU上运行”和“无法运行”之间的差别。
参考采样参数
| Parameter | Value |
|---|---|
| temperature | 0 |
| top_k | 1(temperature=0时不产生实际影响) |
| top_p | 1.0(temperature=0时不产生实际影响) |
| seed | 42 |
| max_new_tokens | 1024 |
| repetition_penalty | 1 |
| reasoning | off |
| context size | 32768(32K) |
| parallel slots | 1 |
在这一工具调用工作负载中,reasoning被有意关闭,因为它会降低单轮准确率,同时显著增加耗时。MLCommons表示,该基准已经在多个厂商的一系列边缘加速器上完成验证,说明工作负载和方法论具备可移植性。
基准任务:准确率与性能双数据集
该基准使用两个承担不同角色的数据集。
准确率数据集:BFCL v4
Berkeley Function Calling Leaderboard v4(BFCL v4)用于测试模型是否能够正确、确定性地调用函数,且不依赖LLM judge。它覆盖单轮请求,即“一个prompt到一个结构化tool call”,主要分为三类:
- non_live:通过AST match与gold labels比对。
- live:同样通过AST match评测。
- hallucination:二元检查,当可用工具与问题无关时,模型是否能拒绝调用函数。
此外,BFCL v4还包含可选的多轮Agentic对话,并通过进程内Python simulators执行。类别来自公开的gorilla-llm/gorilla-eval-set,会在运行时自动下载。
本轮计分门槛仅使用单轮集合,并按类别采样到稳定的约995个样本点估计:non_live占72%(约712个样本)、live占17%(约171个样本)、hallucination占11%(约112个样本)。同时设置subset_floor为25,因此任何条目数不超过25的子集都会完整纳入。
性能数据集:录制式Agentic Coding Replay
性能数据集来自MLPerf Agentic benchmark的一个子集,包含录制好的多轮agentic coding轨迹。这些任务采用类似SWE-bench的形式,来自真实代码仓库,例如astropy,并以确定性replay方式作为性能工作负载,规模则调整为适合单设备边缘服务。
参考集合包括20段对话、1,007个turn,设计目标是所有轨迹都不会溢出32K-token served context,峰值输入长度约为23.5K tokens。由于没有发生上下文溢出,每个turn都能完成;在并发为1、一次仅处理一个在途请求的情况下,单个边缘设备可以在合理时间内完成一次完整运行,且有效运行要求为零丢弃turn。
该数据集本身也充当ground truth:每条轨迹中录制的工具调用会驱动零成本inline accuracy check,并在延迟测量过程中同步运行。准确性采用executed calls的multiset IOU进行检查,因此正确性与延迟来自同一次执行。
请求与响应示例
单轮function-calling请求会发送到模型兼容OpenAI格式的/v1/chat/completions端点,并携带可用工具schema。例如,用户询问旧金山当前摄氏温度时,请求中可包含如下工具定义:
{
"messages": [
{
"role": "user",
"content": "What is the current temperature in San Francisco, in Celsius?"
}
],
"tools": [
{
"type": "function",
"function": {
"name": "get_current_weather",
"description": "Get the current weather for a given location.",
"parameters": {
"type": "object",
"properties": {
"location": {
"type": "string",
"description": "City and state, e.g. San Francisco, CA"
},
"unit": {
"type": "string",
"enum": ["celsius", "fahrenheit"]
}
},
"required": ["location", "unit"]
}
}
}
]
}模型应返回结构化工具调用:
{
"choices": [
{
"message": {
"role": "assistant",
"tool_calls": [
{
"type": "function",
"function": {
"name": "get_current_weather",
"arguments": "{\"location\": \"San Francisco, CA\", \"unit\": \"celsius\"}"
}
}
]
},
"finish_reason": "tool_calls"
}
]
}BFCL v4的AST checker会将预测调用与gold label逐项对比,包括函数名和每个参数,因此评分具备精确性与可复现性。
意义
这项Edge Agentic Inference基准把评测重点从传统吞吐转向设备端Agent真实体验:在有限内存和功耗下,模型能否在长上下文、多轮工具调用中保持准确,并为单个用户提供可接受的响应延迟。对于希望证明边缘AI推理能力的芯片、设备和系统厂商来说,MLPerf Inference v6.1提供了一个更贴近下一代设备端AI应用的公开衡量框架。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接