浏览器端LLM基准测试:聚焦客观检查与速度精度

浏览器端LLM基准测试聚焦客观检查与速度精度。该测试通过正则匹配等逻辑验证模型输出,允许小参数模型失败以纳入测量。数据涵盖解码速度及准确率,所有结果仅保留在本地设备。

测试运行时间 (ms)

测试准确性

基准测试聚焦于客观检查(如正则表达式匹配、精确代币验证),而非生成文本的写作质量。允许 135M 参数规模的模型出现失败,这本身即是测量的一部分。用户需选定一个模型并执行测试;若系统具备数据,将基于最后的 tok/s(每秒生成代币数)进行估算。

浏览器端实时运行基准测试

以下数据源自浏览器端实时运行,涵盖速度(持续解码与套件墙时间的代币/秒)及准确性(客观测试通过率)。所有数值仅保留在当前设备本地,每个模型均使用最新版本的测试套件进行评估。

精度 (最新的套件)

速度 (平均公/秒)

套房墙 (ms)

在 JavaScript 中写一个基准

编辑器中的代码通过 eval() 执行,随后每一项检查逻辑均应用于模型生成的解码文本上。

要求更大的 LLM

功能形式

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读