https://gigazine.net/news/20250220-bluesky-timeline-develop/
https://gigazine.net/news/20250220-bluesky-timeline-develop/
https://gigazine.net/news/20260410-dram-latency-tailslayer/
https://gigazine.net/news/20260410-dram-latency-tailslayer/
■「10万人以上をフォロワーしているユーザーがタイムライン全体を実際に読むことはない」
■「すべての投稿を時系列順に処理するのではなく、一部を損失させて処理する」
gigazine.net/news/2025022...
■「10万人以上をフォロワーしているユーザーがタイムライン全体を実際に読むことはない」
■「すべての投稿を時系列順に処理するのではなく、一部を損失させて処理する」
gigazine.net/news/2025022...
60年前から存在するメモリの欠陥を克服し、レイテンシーを削減する新たな手法「Tailslayer」が登場 - GIGAZINE
gigazine.net/news/2026041...
60年前から存在するメモリの欠陥を克服し、レイテンシーを削減する新たな手法「Tailslayer」が登場 - GIGAZINE
gigazine.net/news/2026041...
gigazine.net/news/2025022...
gigazine.net/news/2025022...
Bluesky開発チームがタイムラインのレイテンシを96%削減した方法
- Blueskyのタイムライン高速化
- 負荷増大で異常ユーザーに影響
- 対策として記事投稿情報整理
Bluesky開発チームがタイムラインのレイテンシを96%削減した方法
- Blueskyのタイムライン高速化
- 負荷増大で異常ユーザーに影響
- 対策として記事投稿情報整理
SageMakerでPrefix-awareルーティングを解説。
#LLM #AWS #SageMaker #推論最適化 #レイテンシ削減
SageMakerでPrefix-awareルーティングを解説。
#LLM #AWS #SageMaker #推論最適化 #レイテンシ削減
https://gigazine.net/news/20250220-bluesky-timeline-develop/
https://gigazine.net/news/20250220-bluesky-timeline-develop/
https://gigazine.net/news/20260410-dram-latency-tailslayer/
https://gigazine.net/news/20260410-dram-latency-tailslayer/
gigazine.net/news/2025022...
gigazine.net/news/2025022...
ヘルシンキ大学とケンブリッジ大学の研究者は、非同期I/Oとストレージの分離を利用してSQLiteを高速化する方法について論文を発表しました。彼らは、RustでSQLiteを書き直し、io_uringを使用して並行性を向上させ、レイテンシを削減することを提案しています。この論文では、サーバーレスコンピューティングの利点、データベースのレイテンシの課題、およびSQLiteの書き直しであるLimboのベンチマーク結果について議論しています。LimboのコードはオープンソースでGitHubで利用可能です。
ヘルシンキ大学とケンブリッジ大学の研究者は、非同期I/Oとストレージの分離を利用してSQLiteを高速化する方法について論文を発表しました。彼らは、RustでSQLiteを書き直し、io_uringを使用して並行性を向上させ、レイテンシを削減することを提案しています。この論文では、サーバーレスコンピューティングの利点、データベースのレイテンシの課題、およびSQLiteの書き直しであるLimboのベンチマーク結果について議論しています。LimboのコードはオープンソースでGitHubで利用可能です。
pc.watch.impress.co.jp/docs/news/16...
>AI推論やHPCアプリケーション向けに設計された製品で、既存のRDIMMと同じ信頼性/可用性/保守性、および機能とインターフェイスの互換性を維持。DDR5の物理的および電気的標準を採用しながら、実装8,800MT/sの転送速度により、既存の6,400MT/sのRDIMMと比較して帯域幅が39%向上。一方でレイテンシも40%削減できるという。
言葉の意味はよく分からんがとにかくすごい見た目だw
pc.watch.impress.co.jp/docs/news/16...
>AI推論やHPCアプリケーション向けに設計された製品で、既存のRDIMMと同じ信頼性/可用性/保守性、および機能とインターフェイスの互換性を維持。DDR5の物理的および電気的標準を採用しながら、実装8,800MT/sの転送速度により、既存の6,400MT/sのRDIMMと比較して帯域幅が39%向上。一方でレイテンシも40%削減できるという。
言葉の意味はよく分からんがとにかくすごい見た目だw
DRAMからの読み出しがリフレッシュサイクルに当たると遅くなる(と言ってもマイクロ秒単位)ので、並列読み出しでそれを隠蔽しようという話。こんな大富豪なアプローチがフィットするのはどんなユースケースだと思ったら、HFTとかではテールレイテンシ削減のために有効かもという
DRAMからの読み出しがリフレッシュサイクルに当たると遅くなる(と言ってもマイクロ秒単位)ので、並列読み出しでそれを隠蔽しようという話。こんな大富豪なアプローチがフィットするのはどんなユースケースだと思ったら、HFTとかではテールレイテンシ削減のために有効かもという
AMDの新特許が示す次世代X3Dの姿
/ AMD・Ryzen・X3D・3D V-Cache・特許・CPU・ゲーミングPC・半導体👇
note.com/joho_no_toda...
AMDが新たな特許を出願しました。
L3だけでなくL2キャッシュまで3D積層化する「Balanced Latency Stacked Cache」。
レイテンシは14サイクルから12サイクルへ。
次世代Ryzen X3Dの設計思想が、特許文書から見えてきます。
#AMD #Ryzen #3DVCache #CPU #自作PC
AMD's new patent: L2 cache stacking
新しい Amazon Bedrock AgentCore Runtime が利用可能に!!
Amazon Bedrock AgentCore RuntimeのプラットフォームバージョンV2が一般提供されました。
AIエージェントの新規セッション起動時に発生するコールドスタートのレイテンシー削減とコスト最適化が主な目的です。
V1ではセッションごとに初期化処理が必要でしたが、V2ではプラットフォーム側の起動プロセスが改善されており、より低遅延で効率的なエージェント運用が可能になります。
新しい Amazon Bedrock AgentCore Runtime が利用可能に!!
Amazon Bedrock AgentCore RuntimeのプラットフォームバージョンV2が一般提供されました。
AIエージェントの新規セッション起動時に発生するコールドスタートのレイテンシー削減とコスト最適化が主な目的です。
V1ではセッションごとに初期化処理が必要でしたが、V2ではプラットフォーム側の起動プロセスが改善されており、より低遅延で効率的なエージェント運用が可能になります。
最大82%ものファーストトークン・レイテンシ削減を実現するこの機能は、Amazon EKS上でKubernetesネイティブなGPUルーティングを行うアドオンなんだが、これは従来のモデル運用を一変させるのか?
https://aws.amazon.com/blogs/machine-learning/introducing-amazon-sagemaker-hyperpod-inference-gateway/
最大82%ものファーストトークン・レイテンシ削減を実現するこの機能は、Amazon EKS上でKubernetesネイティブなGPUルーティングを行うアドオンなんだが、これは従来のモデル運用を一変させるのか?
https://aws.amazon.com/blogs/machine-learning/introducing-amazon-sagemaker-hyperpod-inference-gateway/
研究者は、PostgreSQL のクエリ最適化が依然として難しく、特に結合順序の決定はNP-hardに近い課題だと指摘します。そこで、小規模なオープンウェイト言語モデルを用い、SFTとエージェント強化学習で pg_hint_plan を活用してデフォルト計画を超えるクエリプランを生成できるかを検証し、4Bモデルで最大約44.7%のレイテンシ削減を達成したと報告しています。実験はJOBとCEBベンチマークを用いて、プラン生成の検証・評価を行うエージェントハーネスを構築し、複数の計画案を実行して実測時間を比較する形で進められました。
研究者は、PostgreSQL のクエリ最適化が依然として難しく、特に結合順序の決定はNP-hardに近い課題だと指摘します。そこで、小規模なオープンウェイト言語モデルを用い、SFTとエージェント強化学習で pg_hint_plan を活用してデフォルト計画を超えるクエリプランを生成できるかを検証し、4Bモデルで最大約44.7%のレイテンシ削減を達成したと報告しています。実験はJOBとCEBベンチマークを用いて、プラン生成の検証・評価を行うエージェントハーネスを構築し、複数の計画案を実行して実測時間を比較する形で進められました。
#量子古典 #低遅延 #ニュース
https://forest.watch.impress.co.jp/docs/news/2139301.html
生成AIの進化は常に「速度」と「精度」のトレードオフだったが、今回のアップデートでクリエイター側の作業フローそのものが変わっていくのか。
https://forest.watch.impress.co.jp/docs/news/2139301.html
生成AIの進化は常に「速度」と「精度」のトレードオフだったが、今回のアップデートでクリエイター側の作業フローそのものが変わっていくのか。
ツール連携の標準規格(MCP)の普及や、AI同士の通信を前提にしたWeb基盤(Agentic Web)の整備が加速中。ハード面でも大手各社が推論特化チップの投資を強化してて、実運用でのコストとレイテンシ削減が激化してる!
ツール連携の標準規格(MCP)の普及や、AI同士の通信を前提にしたWeb基盤(Agentic Web)の整備が加速中。ハード面でも大手各社が推論特化チップの投資を強化してて、実運用でのコストとレイテンシ削減が激化してる!
・ルネサスが発表したインターフェース半導体は、メモリと演算チップの間でデータ転送速度を高める役割を持つ。
・最新のDRAM製品に対応し、前世代より25%も転送速度が向上した点が注目に値する。
・AI処理においてはデータの搬送ボトルネックが課題となることが多く、ここでの改善はシステム全体のレイテンシ削減に直結する。
■2027年下期の量産計画
・量産開始を2027年下期に設定したのは、当時のデータセンター需要拡大期や次世代メモリーの普及タイミングに合わせたものだ。
・ルネサスが発表したインターフェース半導体は、メモリと演算チップの間でデータ転送速度を高める役割を持つ。
・最新のDRAM製品に対応し、前世代より25%も転送速度が向上した点が注目に値する。
・AI処理においてはデータの搬送ボトルネックが課題となることが多く、ここでの改善はシステム全体のレイテンシ削減に直結する。
■2027年下期の量産計画
・量産開始を2027年下期に設定したのは、当時のデータセンター需要拡大期や次世代メモリーの普及タイミングに合わせたものだ。