https://gigazine.net/news/20251212-gemini-deep-research/
https://gigazine.net/news/20251212-gemini-deep-research/
Googleが「Gemini Deep Research エージェント」をリリース&ベンチマーク「DeepSearchQA」オープンソース化
Googleが「Gemini Deep Research エージェント」をリリース&ベンチマーク「DeepSearchQA」オープンソース化
This benchmark focuses on complex web research tasks and tests agent comprehensiveness.
Check the leaderboard: www.kaggle.com/benchmarks/g...
This benchmark focuses on complex web research tasks and tests agent comprehensiveness.
Check the leaderboard: www.kaggle.com/benchmarks/g...
Google Releases Gemini 3 Powered Deep Research Agent to Developers via API
#ArtificialIntelligence #GenerativeAI #Google #GoogleAI #AgenticAI #DeepResearch #Gemini3 #DevTools #API #TechNews #Winbuzzer #LLM #MachineLearning #DeepSearchQA #OpenSource
Google Releases Gemini 3 Powered Deep Research Agent to Developers via API
#ArtificialIntelligence #GenerativeAI #Google #GoogleAI #AgenticAI #DeepResearch #Gemini3 #DevTools #API #TechNews #Winbuzzer #LLM #MachineLearning #DeepSearchQA #OpenSource
https://gigazine.net/news/20251212-gemini-deep-research/
https://gigazine.net/news/20251212-gemini-deep-research/
Built on Gemini 3.1 Pro. Max hits 93.3% on DeepSearchQA.
Caveats: API only, 60-min limit, MCP quality depends on the server, benchmarks ≠ real research.
Built on Gemini 3.1 Pro. Max hits 93.3% on DeepSearchQA.
Caveats: API only, 60-min limit, MCP quality depends on the server, benchmarks ≠ real research.
- 제미나이 3 프로 기반으로 반복적으로 조사를 계획하고 쿼리를 생성하며 지식 격차를 식별함
- HLE 에서 46.4%, DeepSearchQA 벤치마크에서 66.1% 달성
오늘 보니 제미나이 공웹 빠른 모드로 하니 딥리서치 생기더군요. (원래 있었던 것 같긴합니다만)
Build with Gemini Deep Research
blog.google/technology/d...
- 제미나이 3 프로 기반으로 반복적으로 조사를 계획하고 쿼리를 생성하며 지식 격차를 식별함
- HLE 에서 46.4%, DeepSearchQA 벤치마크에서 66.1% 달성
오늘 보니 제미나이 공웹 빠른 모드로 하니 딥리서치 생기더군요. (원래 있었던 것 같긴합니다만)
Build with Gemini Deep Research
blog.google/technology/d...
1. 性能全面领先
•基准测试:在博士级考试Humanity’s Last Exam(54.0%)、Agent检索DeepSearchQA(92.5%)、软件工程SWE-Bench Pro(58.6%)等评测中超越GPT-5.4、Gemini 3.1 Pro等主流模型。
•短板:多语言编程(SWE-bench)、复杂工具调度(Toolathlon)及视觉任务(MathVision)仍小幅落后顶尖模型
1. 性能全面领先
•基准测试:在博士级考试Humanity’s Last Exam(54.0%)、Agent检索DeepSearchQA(92.5%)、软件工程SWE-Bench Pro(58.6%)等评测中超越GPT-5.4、Gemini 3.1 Pro等主流模型。
•短板:多语言编程(SWE-bench)、复杂工具调度(Toolathlon)及视觉任务(MathVision)仍小幅落后顶尖模型
Main Link | Techmeme Permalink
Main Link | Techmeme Permalink
By: Shubham Sawarkar on Thursday, April 23, 2026
By: Shubham Sawarkar on Thursday, April 23, 2026
🔗 aidailypost.com/news/gemini-...
🔗 aidailypost.com/news/gemini-...
@google:
We're also open-sourcing DeepSearchQA, a new benchmark to evaluate agents on complex search tasks. Learn more about these updates on the Keyword Blog ↓ https://blog.google/...
@google:
We're also open-sourcing DeepSearchQA, a new benchmark to evaluate agents on complex search tasks. Learn more about these updates on the Keyword Blog ↓ https://blog.google/...
📊 80.2% on SWE-Bench Verified, 54.0% on HLE-Full with tools (beats GPT-5.4), 92.5 F1 on DeepSearchQA #coding #MachineLearning
📊 80.2% on SWE-Bench Verified, 54.0% on HLE-Full with tools (beats GPT-5.4), 92.5 F1 on DeepSearchQA #coding #MachineLearning