测试运行时间 (ms)
测试准确性
基准测试聚焦于客观检查(如正则表达式匹配、精确代币验证),而非生成文本的写作质量。允许 135M 参数规模的模型出现失败,这本身即是测量的一部分。用户需选定一个模型并执行测试;若系统具备数据,将基于最后的 tok/s(每秒生成代币数)进行估算。

以下数据源自浏览器端实时运行,涵盖速度(持续解码与套件墙时间的代币/秒)及准确性(客观测试通过率)。所有数值仅保留在当前设备本地,每个模型均使用最新版本的测试套件进行评估。
精度 (最新的套件)
速度 (平均公/秒)
套房墙 (ms)
在 JavaScript 中写一个基准
编辑器中的代码通过 eval() 执行,随后每一项检查逻辑均应用于模型生成的解码文本上。





