#CPU2026
In this paper is presented the first comprehensive characterization of SPEC CPU2026 across nine platforms spanning recent Intel, AMD, Ampere, and Nvidia processors.

arxiv.org/pdf/2605.03713
May 6, 2026 at 3:50 AM
SPEC CPU 2026 Released. Both GCC and LLVM included as benchmarks.
www.spec.org/cpu2026/docs...
Overview - CPU 2026
www.spec.org
May 6, 2026 at 12:33 AM
Hello you fine Internet folks,

Today's article is on the new SPEC CPU 2026 benchmark, which is the newest set of CPU benchmarks from SPEC, and we compare the 2026 suite to the 2017 suite.

Hope y'all enjoy!

chipsandcheese.com/p/evaluating...
Evaluating SPEC CPU2026
SPEC’s CPU benchmark suite has been a long established industry standard, and is almost impossible to miss when reading through various publications.
chipsandcheese.com
May 23, 2026 at 8:48 AM
Graph workloads are hard on processors: irregular memory access, data-dependent parallelism. That's exactly why they belong in a CPU benchmark. Thrilled that my 854.graph500 made it into SPEC CPU 2026 — the yardstick the next decade of chips will be measured by. www.spec.org/cpu2026/
@NJIT #HPC
SPEC CPU 2026
The SPEC CPU 2026 benchmark package contains SPEC's next-generation, industry-standardized, CPU intensive suites for measuring and comparing compute intensive performance, stressing a system's…
www.spec.org
July 21, 2026 at 4:28 PM
Doa'a Al-Otoom, Mahesh Madhav: Adaptation Fidelity of SPEC CPU2026 https://arxiv.org/abs/2608.27710 https://arxiv.org/pdf/2608.27710 https://arxiv.org/html/2608.27710
August 31, 2026 at 6:43 AM
Spec CPU2026 Impact — Discover how Spec CPU2026 affects AI model performance and optimization

Read more →

#SpecCPU2026 #AIOptimization #CPUBenchmarking
Spec CPU2026 Impact
Discover how Spec CPU2026 affects AI model performance and optimization
airanked.dev
May 23, 2026 at 8:00 PM
Ruihao Li, Andrew Jacob, Neeraja J. Yadwadkar, Lizy K. John: SPEC CPU2026: Characterization, Representativeness, and Cross-Suite Comparison https://arxiv.org/abs/2605.03713 https://arxiv.org/pdf/2605.03713 https://arxiv.org/html/2605.03713
May 6, 2026 at 6:38 AM
Intel Panther Lake “Core Ultra Series 3” – Chuẩn bị khu ấy đảo CES 2026!

🌿 Intel Panther Lake “Core Ultra Series 3” – Thế hệ CPU laptop mạnh mẽ chuẩn bị ra mắt tại CES 2026! 💖👉🍀 #Intel #PantherLake #CoreUltra3 #CES2026 #CPU2026 #Laptop2026 #Tinhte #CôngNghệ 1️⃣ Bước tiến mới sau Lunar Lake 

Intel…
Intel Panther Lake “Core Ultra Series 3” – Chuẩn bị khu ấy đảo CES 2026!
🌿 Intel Panther Lake “Core Ultra Series 3” – Thế hệ CPU laptop mạnh mẽ chuẩn bị ra mắt tại CES 2026! 💖👉🍀 #Intel #PantherLake #CoreUltra3 #CES2026 #CPU2026 #Laptop2026 #Tinhte #CôngNghệ 1️⃣ Bước tiến mới sau Lunar Lake 

Intel đang chuẩn bị tung ra thế hệ vi xử lý Panther Lake “Core Ultra Series 3”, kế nhiệm dòng Lunar Lake, hứa hẹn sẽ là cú nhảy vọt lớn về hiệu năng lẫn khả năng đồ họa tích hợp.
tintuchay74.wordpress.com
November 8, 2025 at 11:33 AM
May 23, 2026 at 5:48 PM
Intel Panther Lake “Core Ultra Series 3” – Chuẩn bị khu ấy đảo CES 2026!

🌿 Intel Panther Lake “Core Ultra Series 3” – Thế hệ CPU laptop mạnh mẽ chuẩn bị ra mắt tại CES 2026! 💖👉🍀 #Intel #PantherLake #CoreUltra3 #CES2026 #CPU2026 #Laptop2026 #Tinhte #CôngNghệ 1️⃣ Bước tiến mới sau Lunar Lake 

Intel…
Intel Panther Lake “Core Ultra Series 3” – Chuẩn bị khu ấy đảo CES 2026!
🌿 Intel Panther Lake “Core Ultra Series 3” – Thế hệ CPU laptop mạnh mẽ chuẩn bị ra mắt tại CES 2026! 💖👉🍀 #Intel #PantherLake #CoreUltra3 #CES2026 #CPU2026 #Laptop2026 #Tinhte #CôngNghệ 1️⃣ Bước tiến mới sau Lunar Lake 

Intel đang chuẩn bị tung ra thế hệ vi xử lý Panther Lake “Core Ultra Series 3”, kế nhiệm dòng Lunar Lake, hứa hẹn sẽ là cú nhảy vọt lớn về hiệu năng lẫn khả năng đồ họa tích hợp. Theo rò rỉ mới nhất, mẫu cao cấp X9 388H có thể đạt xung tối đa tới 5,1 GHz, mức ấn tượng cho CPU laptop chỉ 25W TDP.
maychu3.wordpress.com
November 8, 2025 at 11:33 AM
(2026-05)SPEC CPU2026を読む(1. 次世代CPUベンチマークは何を測ろうとしているのか) - FPGA開発日記
https://msyksphinz.hatenablog.com/entry/2026/05/11/043000
SPEC CPU2026を読む(1. 次世代CPUベンチマークは何を測ろうとしているのか)
CPUの性能評価でよく出てくるベンチマークとして、SPEC CPUがある。 CPUを作っている会社の資料や、サーバ向けCPUの性能比較、コンパイラ最適化の評価、アーキテクチャ研究の論文などを見ていると、SPEC CPUのスコアがよく使われている。個人的にも、CPU性能を議論するときに「とりあえずSPECを見よう」という場面は多い。 そのSPEC CPUの次世代版である **SPEC CPU2026** についての論文が出ていたので、内容を読んでまとめていく。今回は第1回として、まず全体像を整理する。 対象にするのは、添付した論文 **“SPEC CPU: the next generation”** である。 arxiv.org ## SPEC CPU2026とは何か SPEC CPU2026は、CPU性能を測定するための新しいベンチマークスイートである。 SPEC CPUは昔から存在しており、CPU89、CPU92、CPU95、CPU2000、CPU2006、CPU2017と続いてきた。今回のCPU2026は、その次の世代という位置づけになる。 論文の冒頭では、David Pattersonの > benchmarks shape a field という考え方が引用されている。つまり、良いベンチマークは単に性能を測るだけではなく、その分野の研究開発の方向性そのものに影響を与える、という話である。 これはCPU業界ではかなり重要な話である。なぜなら、CPU設計者もコンパイラ開発者も、何らかの指標を見ながら改善を行うからである。もしベンチマークが現実のアプリケーションと乖離していれば、そのベンチマークに最適化しても、実際のユーザにはあまり意味がない。逆に、ベンチマークが実際の重要なワークロードをうまく反映していれば、そのベンチマークを改善することが実際のシステム性能改善につながりやすい。 SPEC CPU2026は、この「何を測るべきか」を現代のCPUに合わせて再設計したものだと言える。 ## なぜ今もCPUベンチマークなのか 最近はAIアクセラレータ、GPU、NPU、専用ASICなどの話題が多い。特に機械学習の文脈では、CPU単体の性能よりも、GPUクラスタやAIアクセラレータの性能の方が注目されることが多い。 しかし、論文では、汎用CPUの性能は依然として重要である、という立場を取っている。これはその通りで、実際のシステムではCPUが完全に不要になるわけではない。 OS、コンパイラ、データベース、スクリプト処理、圧縮、シミュレーション、ネットワーク処理、ビルド処理、制御系の処理など、CPUが担う仕事は依然として多い。また、AIアクセラレータを使う場合でも、その周辺処理やデータ供給、システム全体の制御はCPUが担当することが多い。 そのため、CPUの性能を公正かつ再現可能な形で測定するベンチマークは引き続き必要になる。SPEC CPU2026は、そうした汎用CPUの性能を測るための次世代ベンチマークとして提案されている。 ## SPEC CPUが測るもの、測らないもの SPEC CPU2026の対象は、ネイティブにコンパイルされるプログラムである。具体的には、C、C++、Fortranで書かれたコードが対象になる。 一方で、Java、Python、Juliaのような管理ランタイムやJITコンパイルを含む言語は対象外である。現代の実アプリケーションではPythonやJavaは非常に重要である。しかし、SPEC CPUではそれらを直接対象にはしない。理由としては、JITコンパイルやランタイムの影響により、実行ごとのばらつきや移植性の問題が大きくなり、SPECが重視する再現性と衝突するためである。 ここでSPEC CPUがかなり重視しているのは、以下のような性質である。 * 同じ仕事量を実行すること * 実行結果が正しいこと * 異なるCPU、OS、コンパイラでも再現可能であること * 何を測ったのかが説明可能であること つまり、SPEC CPUは単に「速く動けばよい」というベンチマークではない。**速く、かつ正しく、再現可能に動くこと** を測るためのベンチマークである。 このあたりは、単発の性能測定スクリプトやマイクロベンチマークとはかなり違うところだと思う。 ## CPU2017から何が変わったのか 論文では、CPU2026での主要な変更点がまとめられている。ここでは大きなものをいくつか見ていく。 ### ベンチマーク数が増えた CPU2026では、ベンチマークの数が増えている。CPU2017では43個だったが、CPU2026では52個になっている。 これは単に数を増やしたというより、ワークロードの多様性を増やすための変更である。ベンチマークの数が少ないと、特定のワークロードに対する最適化の影響が大きくなりすぎる。また、同じような性質のプログラムばかりだと、CPUの一部の性質しか測れない。 CPU2026では、より多様なアプリケーションドメイン、より多様なマイクロアーキテクチャ上の振る舞いを含めることを狙っている。 ### 現代的なアプリケーションが増えた CPU2026には、コンパイラ、インタプリタ、データベース、圧縮、ネットワークシミュレータ、FPGA配置配線、コンピュータアーキテクチャシミュレータ、分子動力学、気象・海洋モデル、脳シミュレーション、ニューラル機械翻訳など、かなり幅広いアプリケーションが含まれている。 例えば整数系では、gcc、llvm、sqlite、cpython、gem5、zstdなどが含まれる。浮動小数点系では、cactus、namd、roms、fotonik3d、marian、nestなどが含まれる。 この一覧を見ると、昔ながらの小さなカーネルベンチマークというよりも、かなり大きな実アプリケーションを持ってきていることが分かる。 ### マルチスレッド整数ベンチマークが増えた CPU2026の大きな変更点の一つが、マルチスレッドの整数ベンチマークが増えたことである。 CPU2017では、SPECspeed側の整数ベンチマークにマルチスレッドのものが少なかった。現代のCPUはコア数が増えており、サーバ向けでは数十コアから百コア級のCPUも珍しくない。そのため、単一スレッド性能だけではなく、並列実行時の性能を測ることも重要になっている。 CPU2026では、OpenMP、C++の`std::thread`、Fortranの`DO CONCURRENT`、さらにタスクベースのプロセス生成を使うベンチマークも含まれている。 特に面白いのは、`821.gcc`や`823.llvm`のようなコンパイラ系ベンチマークである。これらは、`make -j N`のように多数のコンパイラプロセスを起動する実際のビルド処理に近い形を模倣している。 これはかなり現実的なワークロードである。CPUを買い替えたとき、ソフトウェア開発者がまず体感しやすい性能の一つはビルド時間である。そこをベンチマークに含めるのは自然である。 ### メモリフットプリントが大きくなった CPU2026では、SPECspeedのlarge multi-threaded benchmark suiteのメモリフットプリントが、CPU2017の16GBから64GBに増えている。 これは現代のシステムのメモリ容量を反映した変更である。最近のサーバでは数百GBからTB級のメモリを搭載することも普通なので、16GB程度では現代的な大規模ワークロードとしては少し小さくなってきた、ということだろう。 一方で、SPECrateのスループットベンチマークでは、1コピーあたりのフットプリントは2GBのままとされている。 このあたりは、単一ジョブを高速化するSPECspeedと、複数コピーを走らせるSPECrateで、負荷のかけ方が違うためだと思われる。 ### 言語標準が更新された CPU2026では、使用する言語標準も更新されている。 * C99 → C18 * C++03 → C++17 * Fortran 2003 → Fortran 2018 ベンチマークは長期間使われる。SPEC CPU2000やCPU2006のような古いベンチマークでも、研究や組み込み向けの評価では長く使われることがある。そのため、将来のコンパイラでもビルドできるように、標準準拠であることが重要になる。 CPU2026では、C++17などの比較的新しい標準に合わせつつ、移植性や長期保守性もかなり意識している。 ## 新しい実行方式:Rolling Round-Robin Rate CPU2026で特に新しい要素として、**Rolling Round-Robin Rate** 、略して **RRR** という実行方式が導入されている。 従来のSPECrateでは、同じベンチマークを複数コピー同時に実行する。例えば、ある圧縮ベンチマークを48コピー走らせる、というような形である。これは同種の負荷を多数実行する homogeneous な負荷である。 しかし、現代のサーバやクラウド環境では、同じプログラムだけが全コアで動いているとは限らない。むしろ、複数のVMやコンテナ、サービス、バッチ処理が混在して動いていることが多い。つまり、heterogeneous な負荷である。 RRRは、このような状況を意識した実行方式である。 大まかには、各コアが複数のベンチマークを順番に実行する。ただし、全コアが同じベンチマークから始めるのではなく、開始位置をずらす。これにより、ある時刻には複数種類のベンチマークが同時に走ることになる。 これによって、キャッシュ、メモリ帯域、分岐予測、フロントエンド、バックエンド、OSスケジューリングなどの干渉を含んだ性能評価ができる可能性がある。 ただし、RRRはまだ exhibition、つまり正式なスコアリング方法として完全に確立されたものではない。論文でも、性能指標や公平性指標については今後の議論が必要であるという位置づけになっている。 SPEC CPUが単に「新しいベンチマークを追加しました」というだけでなく、**多コア・マルチテナント時代の新しい測り方自体を提案している** からである。 ## SPEC CPU2026は「テープメジャー」である 論文中では、SPEC CPUを「tape measure」、つまり巻尺・メジャーに例えている点である。 SPEC CPUは、何を測るべきかを一方的に決めるものではない。むしろ、ユーザがCPU、コンパイラ、OS、設定、スレッド数、最適化オプションなどを変えながら、性能を測るための道具である。 もちろん、公式スコアを提出する場合にはルールがある。しかし、SPEC CPUの利用者の多くは、公式スコア提出ではなく、社内評価や研究開発、コンパイラ改善、アーキテクチャ検討などのために使っている。 この視点は重要である。 ベンチマークというと、どうしても「ランキングのための数字」という印象がある。しかし、実際にはベンチマークスイートは、性能解析のための実験基盤でもある。CPU2026では、raw outputに分散、標準偏差、四分位、最小・最大・平均コピー時間などの統計情報も追加されている。これは、単に最終スコアを見るだけではなく、ばらつきやスケーリングの様子を解析するための機能である。
msyksphinz.hatenablog.com
May 11, 2026 at 8:26 AM
Evaluating Spec CPU2026
Discussion | hackernews | Author: zdw
Evaluating Spec CPU2026
SPEC’s CPU benchmark suite has been a long established industry standard, and is almost impossible to miss when reading through various publications.
chipsandcheese.com
May 23, 2026 at 5:52 PM
Feed: "Chips and Cheese"
By: Chester Lam on Saturday, May 23, 2026
Evaluating SPEC CPU2026
SPEC’s CPU benchmark suite has been a long established industry standard, and is almost impossible to miss when reading through various publications.
chipsandcheese.com
May 24, 2026 at 11:30 AM
May 23, 2026 at 6:03 PM
Dive into the evaluation of SPEC CPU2026! Explore its benchmarks, performance metrics, and how it shapes the future of computing. Your insights on this evolving standard are crucial. Join the conversation and share your thoughts! #SPEC2026 #Tech…

https://chipsandcheese.com/p/evaluating-spec-cpu2026
June 25, 2026 at 5:24 PM
はてなブログを更新しました。 SPEC CPU2026を読む(5. 長く使えるベンチマークにするための移植性と検証)
https://msyksphinz.hatenablog.com/entry/2026/05/15/040000
SPEC CPU2026を読む(5. 長く使えるベンチマークにするための移植性と検証)
今回は、SPEC CPU2026を長期間利用できるベンチマークスイートにするための取り組みを見る。論文では、 Longevity and Portability の章で、標準準拠、未定義動作の除去、エンディアン対応、Windows対応、I/O削減、メモリ安全性検証について説明している。 長寿命化と移植性 SPEC CPUのベンチマークスイートは、リリース後も長期間使われる。 そのため、CPU2026では、将来のコンパイラやOSでもビルド・実行できるように、ISO標準への準拠と移植性が重視されている。 CPU2026で採用された言語標準は以下である。 C18 C++17 Fortran 2018 論文では、古いスイートであるSPEC CPU2000が、リリースから長い期間を経ても利用されている例を挙げ、標準準拠がベンチマークの長寿命化に重要であると説明している。 標準準拠とコードハードニング CPU2026では、単にコンパイルできるだけではなく、警告が少なく、標準に沿ったコードにするための作業が行われている。 論文では、 -Wpedantic で警告が出ないようにすること、曖昧な挙動を取り除くこと、将来の標準準拠コンパイラでもビルドできるようにすることが目標として挙げられている。 主な作業は以下である。 undefined behaviorの除去 unspecified behaviorの除去 implementation-defined behaviorへの依存削減 型の不一致の修正 符号付き・符号なし比較の修正 非標準拡張の削除 未定義動作の除去 未定義動作や実装依存の挙動は、異なるコンパイラやプラットフォームで結果の違いや実行失敗を引き起こす可能性がある。 CPU2026では、コンパイラ警告による静的解析と、sanitizerによる動的解析を組み合わせて、問題を修正している。 論文では、以下のような例が挙げられている。 危険なポインタ変換 データオーバーフロー 未初期化メンバ変数 segmentation faultにつながる不具合 オブジェクト初期化順序に関する問題 C++17への近代化 CPU2026では、古いC++コードをC++17に合わせるための修正も行われている。 論文で挙げられている例は以下である。 std::bind2nd をlambdaに置き換え
msyksphinz.hatenablog.com
May 17, 2026 at 7:27 PM
はてなブログを更新しました。 SPEC CPU2026を読む(6. Rolling Round-Robin Rateによるヘテロジニアス負荷評価)
https://msyksphinz.hatenablog.com/entry/2026/05/16/040000
SPEC CPU2026を読む(6. Rolling Round-Robin Rateによるヘテロジニアス負荷評価)
今回は、SPEC CPU2026で導入された Rolling Round-Robin Rate 、略して RRR を整理する。論文では、RRRはヘテロジニアスなmultiprogrammed workloadを評価するための新しい実行方式として説明されている。 従来のSPECrate SPEC CPUの従来のmulti-copy benchmarkであるSPECrateは、同じベンチマークを複数コピー同時に実行する。 たとえば、あるベンチマークを48コピー実行する場合、48個の同一ワークロードが同時に走る。この方式は、homogeneous loadを用いたスループット評価である。 この手法はSPEC CPU92以来使われてきたが、現代のサーバ環境では、必ずしも同一ワークロードだけが多数同時に走るわけではない。クラウドやデータセンターでは、複数のVM、サービス、ジョブが同時に実行されることが多い。 RRRの目的 RRRは、heterogeneous multiprogrammed workloadを標準化された方法で実行するために導入された。 論文では、従来の研究では、benchmark mixtureやscheduling policyが研究ごとに独自に作られることが多く、結果の比較が難しいと説明している。 RRRは、この問題に対して、SPEC CPU2026のintrateおよびfprate suiteを使い、決定的で再現可能なスケジュールを提供する。 RRRの実行方法 RRRでは、N個のベンチマークからなるスイートを、M個のコア上で実行する。 基本的な方法は以下である。 各コアは、N個すべてのベンチマークを順番に実行する ベンチマークの順序は事前に固定される 各コアは開始位置をずらして実行を開始する すべてのコアが、すべてのベンチマークを一度ずつ実行する たとえば、Core 0がBenchmark Aから開始する場合、Core 1はBenchmark Bから開始し、Core 2はBenchmark Cから開始する、というようにローテーションする。 この方式により、各時点で異なる種類のベンチマークが同時に実行される。 sample imbalanceの回避 RRRでは、すべてのベンチマークがすべてのコアで実行される。 そのため、各ベンチマークはシステム全体で同じ
msyksphinz.hatenablog.com
May 17, 2026 at 7:26 PM
はてなブログを更新しました。 SPEC CPU2026を読む(4. 採用されなかったワークロードから見る選定方針)
https://msyksphinz.hatenablog.com/entry/2026/05/15/040000
SPEC CPU2026を読む(4. 採用されなかったワークロードから見る選定方針)
今回は、候補に上がりながら採用されなかったワークロードを整理する。論文では、除外された候補について具体例を挙げながら、SPEC CPU2026の選定方針を説明している。 除外の主な理由 SPEC CPU2026では、候補アプリケーションを以下の観点で評価している。 決定性を確保できるか 移植性を確保できるか 実アプリケーションとしての代表性を保てるか 既存候補とドメインや性能特性が重複しないか コードベースが保守可能か I/Oが多すぎないか 実行時間が少数の関数に偏りすぎないか 特定アーキテクチャに有利な偏りがないか SPEC CPUでは、異なるCPU、OS、コンパイラ上で、同じ仕事量を実行し、正しい結果を返すことが求められる。その条件を満たせない候補は、重要なアプリケーションであっても採用されない。 決定性 SPEC CPUの基本要件の一つは、決定的に実行できることである。 探索アルゴリズム、線形ソルバ、制約解法、勾配降下法などでは、わずかな数値差や実行順序の違いにより、解に到達する経路や反復回数が変わる場合がある。 この場合、システムごとに実行する仕事量が変わるため、CPU性能の公平な比較が難しくなる。そのため、決定的な実行を保証できない候補は除外される。 代表性 SPEC CPUでは、移植性のためにhand-written assemblyやcompiler intrinsicsを取り除く。しかし、アプリケーションによっては、実運用での性能特性がこうしたアーキテクチャ固有最適化に強く依存している。 その場合、固有最適化を取り除くと、元のアプリケーションとは異なる性能特性になる。論文ではこれを development divergence として説明している。 移植性を確保した結果、実アプリケーションとしての代表性が失われる場合、その候補は採用されない。 LLM・Transformer系ワークロード llama.cpp や whisper.cpp のようなCPU inference engineも検討された。これらは重要な領域であり、評価の深い段階まで進んだとされている。 しかし、intrinsicsを除いたportable C++ code pathに限定すると、実運用の性能特性から乖離した。論文では、これらの候補が非典型的にcompute-boundになり、
msyksphinz.hatenablog.com
May 14, 2026 at 7:32 PM
はてなブログを更新しました。 SPEC CPU2026を読む(3. 実アプリをベンチマークに変換する)
https://msyksphinz.hatenablog.com/entry/2026/05/13/040000
SPEC CPU2026を読む(3. 実アプリをベンチマークに変換する)
前回は、SPEC CPU2026に含まれるベンチマーク一覧を見た。 gcc 、 llvm 、 sqlite 、 cpython 、 gem5 、 zstd 、 cactus 、 roms 、 namd 、 marian など、かなり現代的な実アプリケーションが含まれていることが分かった。 ただし、ここで一つ注意が必要である。 SPEC CPU2026に含まれるプログラムは、単に「実アプリケーションをそのまま持ってきて実行している」わけではない。実アプリケーションをベースにしつつ、それをSPEC CPUのベンチマークとして成立するように、かなり手を入れている。今回はその部分を見る。 つまり、SPEC CPU2026では、実アプリケーションをどのようにして「測定対象」として成立させているのか、という話である。 実アプリケーションを使うだけではベンチマークにならない SPEC CPUは、実際に使われているアプリケーションを重視している。 論文でも、SPEC CPU suiteの開発は、実際にユーザベースを持つproduction softwareを優先する、という考え方に基づいていると説明されている。マイクロベンチマークは特定のCPU機能を調べるには有用だが、SPEC CPUでは、実際の計算ワークロードを代表するアプリケーションを選ぶ方向に寄せている。 マイクロベンチマークであれば、例えば「L1キャッシュのレイテンシを測る」「分岐予測の性能を見る」「SIMD命令のスループットを見る」といった目的には向いている。しかし、それだけでは、実際のアプリケーション性能を代表できるとは限らない。 そのためSPEC CPUでは、実アプリケーションをベースにする。 しかし、ここで問題が出る。 実アプリケーションは、ベンチマークのために作られているわけではない。 実アプリケーションには、環境依存、I/O、乱数、時刻取得、OS依存の処理、デバッグ用コード、プラットフォーム固有最適化などが普通に入っている。また、入力データや実行条件によって実行経路が変わることもある。 これは実用ソフトウェアとしては自然だが、ベンチマークとしては困る。 ベンチマークで重要なのは、異なるCPU、異なるOS、異なるコンパイラで、同じ仕事を実行し、正しい結果を出し、その実行時間を比較できることである。つまり、測ってい
msyksphinz.hatenablog.com
May 12, 2026 at 7:33 PM
はてなブログを更新しました。 SPEC CPU2026を読む(1. 次世代CPUベンチマークは何を測ろうとしているのか)
https://msyksphinz.hatenablog.com/entry/2026/05/11/043000
SPEC CPU2026を読む(1. 次世代CPUベンチマークは何を測ろうとしているのか)
CPUの性能評価でよく出てくるベンチマークとして、SPEC CPUがある。 CPUを作っている会社の資料や、サーバ向けCPUの性能比較、コンパイラ最適化の評価、アーキテクチャ研究の論文などを見ていると、SPEC CPUのスコアがよく使われている。個人的にも、CPU性能を議論するときに「とりあえずSPECを見よう」という場面は多い。 そのSPEC CPUの次世代版である SPEC CPU2026 についての論文が出ていたので、内容を読んでまとめていく。今回は第1回として、まず全体像を整理する。 対象にするのは、添付した論文 “SPEC CPU: the next generation” である。 arxiv.org SPEC CPU2026とは何か SPEC CPU2026は、CPU性能を測定するための新しいベンチマークスイートである。 SPEC CPUは昔から存在しており、CPU89、CPU92、CPU95、CPU2000、CPU2006、CPU2017と続いてきた。今回のCPU2026は、その次の世代という位置づけになる。 論文の冒頭では、David Pattersonの benchmarks shape a field という考え方が引用されている。つまり、良いベンチマークは単に性能を測るだけではなく、その分野の研究開発の方向性そのものに影響を与える、という話である。 これはCPU業界ではかなり重要な話である。なぜなら、CPU設計者もコンパイラ開発者も、何らかの指標を見ながら改善を行うからである。もしベンチマークが現実のアプリケーションと乖離していれば、そのベンチマークに最適化しても、実際のユーザにはあまり意味がない。逆に、ベンチマークが実際の重要なワークロードをうまく反映していれば、そのベンチマークを改善することが実際のシステム性能改善につながりやすい。 SPEC CPU2026は、この「何を測るべきか」を現代のCPUに合わせて再設計したものだと言える。 なぜ今もCPUベンチマークなのか 最近はAIアクセラレータ、GPU、NPU、専用ASICなどの話題が多い。特に機械学習の文脈では、CPU単体の性能よりも、GPUクラスタやAIアクセラレータの性能の方が注目されることが多い。 しかし、論文では、汎用CPUの性能は依然として重要である、という立場を取っている。これ
msyksphinz.hatenablog.com
May 11, 2026 at 7:33 PM
はてなブログを更新しました。 SPEC CPU2026を読む(2. ベンチマーク一覧から見る現代CPUワークロード)
https://msyksphinz.hatenablog.com/entry/2026/05/12/040000
SPEC CPU2026を読む(2. ベンチマーク一覧から見る現代CPUワークロード)
前回は、SPEC CPU2026の全体像を見た。 SPEC CPU2026は、単にCPU2017のベンチマークを入れ替えたものではなく、現代のCPU、コンパイラ、ソフトウェアスタック、サーバ環境を反映するために、かなり大きく作り直されている。 今回はSPEC CPU2026に含まれるベンチマーク一覧を眺めていく。対象は、論文中の Table I: The SPEC CPU®2026 Benchmarks である。 SPEC CPUのベンチマーク一覧を見るときは、単に「どのアプリケーションが入ったか」を見るだけでは少しもったいない。むしろ、そこから SPECspeedとSPECrateは何が違うのか IntegerとFloating Pointはどう分けられているのか どのようなアプリケーションドメインが重視されているのか どのワークロードが現代CPUにとって重要になっているのか を読み取るのが面白い。 SPEC CPU2026のベンチマーク数 SPEC CPU2026には、合計で52個のベンチマークが含まれている。 CPU2017では43個だったので、数としては増えている。論文では、この増加は単なる水増しではなく、マイクロアーキテクチャ上の振る舞いやアプリケーションドメインの多様性を広げるためのものだと説明されている。 ベンチマーク数が増えることには、もちろん実行時間や解析量が増えるというデメリットがある。しかし、ベンチマークが少なすぎると、特定のプログラムにだけ効く最適化が全体スコアに与える影響が大きくなりすぎる。また、似たような性質のワークロードばかりだと、CPUの一部の性能しか評価できない。 SPEC CPU2026では、より多くのアプリケーションを含めることで、CPUやコンパイラに対して、より一般的な最適化を促す方向にしているように見える。 ベンチマークは「解かれる」対象でもあるので、数を増やし、性質を多様化し、特定ベンチマーク専用の最適化が効きにくいようにする、という発想である。 SPECrateとSPECspeed SPEC CPUを見るとき、まず押さえる必要があるのが SPECrate と SPECspeed の違いである。 ざっくり言うと、 SPECrate はスループットを見る SPECspeed は単一ジョブをどれだけ速く終わらせるかを見る とい
msyksphinz.hatenablog.com
May 11, 2026 at 7:33 PM
Evaluating Spec CPU2026
comments · posted on 2026.05.23 at 12:13:22 (c=0, p=3)
May 23, 2026 at 5:49 PM
May 23, 2026 at 6:00 PM