METHODology

測定方法・スコア仕様

Device Benchmark LabはHardware、Web Platform、Measured AI、Sustainedを別系統として扱います。異なる測定品質・revision・時間プロファイルを同じランキングへ混ぜません。

30-SECOND SUMMARY

まず4点だけ。

Hardware Score

CPUとMemoryは固定WebAssembly workload、GPUは固定WebGPU workloadを主系統にします。Canvas、WebGL、IndexedDBなどブラウザ実装差が大きい測定はWeb Platform referenceへ分離します。

CPU

Integer、FP32、FP64、Hash/Mix、Branch、SIMD128、Pack/RLE、GEMMを分離測定します。SingleとMultiを別スコアにし、MultiはSharedArrayBufferとshared WebAssembly.Memoryが成立した場合だけ競技レーンに入れます。

Deadline Multi-Core r2

各workerへ同じ仕事量を押し付けて最遅workerの終了時刻で割る方式は使用しません。同じabsolute measurement windowでworkerごとの反復回数を数え、各workerのthroughputを合算します。P-core/E-coreのような非対称CPUでも遅い1 workerが全体を代表しないようにします。

Scaling Curve

1T、2T、4T、8T、16T、Maxを可能な範囲で測定し、1Tからの伸びとmax-thread efficiencyを保存します。worker間CVとfastest/slowest spreadも診断値として保持します。

Memory & Cache Cliff

Read、Write、Copy bandwidthとdependent pointer chase latencyを測ります。working setを変え、遅延が跳ねた地点をCache Cliffとして示します。ブラウザだけでは断定できないL2/L3容量を捏造しません。

GPU

ALU、VRAM bandwidth、Texture sampling、Raster、Fill-rateの5系統です。初回warm-upとpipeline compileを本計測から外します。timestamp-query対応時はGPU timestampを優先します。GPU比較品質は A=WebGPU+GPU timestamp、B=WebGPU+wall-clock、C=比較不能/参考値とし、CPUのSIMDやMulti-Core成立条件とは独立させます。

Measured AI Compute

ExperimentalではWebGPUの固定256×256 matrix multiplyをFP32、shader-f16対応時はFP16でも測定します。Hardware Scoreには未混入です。3サンプルの中央値整合、elapsed sanity、GPU timing lane、workload revisionをserver側でも検査し、「AI PC」などの名称から性能を推定する値と実測workloadを同じ数字にしません。

9s Bench / Standard / Deep

時間プロファイルは独立レーンです。9s Benchは公開・共有の入口、Standardは通常診断、Deep / Diagnosticはより長い測定窓です。profile revisionとpresetをrun tokenにも結びつけ、別profileとして集計します。

Score & Calibration

Public Betaではprovisional-2026-09-r4を暫定Calibrationとして使用します。Public Betaの実機データを検証後に再評価します。raw metricを保存してからserver側で再計算します。scoring revisionとcalibration revisionは独立管理し、壊れた/不一致のcalibrationはfail-closedです。将来のcalibration変更でもrawから再評価できる設計です。

Percentile

指標ごとに比較契約を変えます。Overall/同機種/同classはprofile + CPU lane + GPU laneが一致した結果だけ、Same CPUはprofile + WASM variant + Multi-Core成立条件が一致したCPU Scoreだけ、Same GPUはprofile + GPU timing gradeが一致したGPU Scoreだけでpercentileを計算します。母集団数も結果APIで返します。

Validation Gate

run token、revision、raw sanity、sample median、sample timing、Confidence、stability、software GPU、重複、rate limit、cohort外れ値をserver側で検査します。Verified Runは「端末型番を暗号学的に証明した」という意味ではなく、この検証ゲートを通った測定を意味します。

Outlier & Aggregation

ランキングは一発の最高値ではなく同一canonical hardwareの中央値を中心にします。投稿時と集計時にmedian/MADとratio sanityを使い、異常値を隔離します。

Sustained Signature

Peak、Sustained、Floor、Decay、Slope、Recoveryと圧縮traceを保存できます。短時間のburst性能と長時間維持性能を別物として表示します。バッテリー寿命ベンチは現時点では行いません。

Hardware Detection

WebGPU adapter info、WebGL renderer、UA Client Hints、UA、hardwareConcurrency、内蔵端末DBをbest-effortで照合します。取得不能なCPU型番やiPhone世代を推測で埋めません。reported/inferred/user-suppliedとconfidence/sourceを分離します。

Privacy

ランキング投稿時は端末/CPU/GPU名、OS・ブラウザ系統、論理コア数、メモリ概算、画面情報、対応API、raw metricを検証用に保存します。投稿時にはローカルで生成したランダムなinstallation IDをrate-limit/replay用識別子の導出にだけ使用し、raw ID自体はbenchmark historyへ保存しません。raw IP、raw User-Agent、nonce、network identifierもbenchmark historyへ永続保存しません。rate-limit/replay用識別子はweb root外のprivate guard-stateで最大24時間保持し、公開結果projectionにはClient Hints、画面情報、anti-cheat内部情報を含めません。

Limitations

WASM JIT/AOT、WGSL compiler、OS scheduler、GPU driver、power policy、温度、バックグラウンド負荷などの影響は残ります。ブラウザから物理CPU/GPUを直接占有するnative benchmarkではありません。同一端末を比較するときは、同じブラウザ・近い電源状態・近い温度条件での再測定を推奨します。そのためConfidenceとcomparabilityを結果の一部として必ず扱います。

REVISION CONTRACT

同じ数字でもrevisionが違えば別競技

schema / scoring / calibration / workload manifest / WASM core / Multi-Core / memory hierarchy / GPU / sustained / measured AI / comparability / hardware detection / device DB / benchmark profileを独立version管理します。互換性が確認されないrevisionをランキングへ混ぜません。