PDB-Single-Hard: 5,751 single-line-bug programs [1-4 bugs]
PDB-Multi: 256 programs w/ contiguous bug blocks [1-3 bugs]
🤗 huggingface.co/Precise-Debu...
PDB-Single-Hard: 5,751 single-line-bug programs [1-4 bugs]
PDB-Multi: 256 programs w/ contiguous bug blocks [1-3 bugs]
🤗 huggingface.co/Precise-Debu...
BigCodeBench: Python
CanAiCode: Python, javascript
Aider benchmark: C++, Go, Java, JavaScript, Python, Rust
BigCodeBench: Python
CanAiCode: Python, javascript
Aider benchmark: C++, Go, Java, JavaScript, Python, Rust
It also transferred zero-shot to unseen tasks (AIME, BigCodeBench, MT-Bench, GPQA) without any retraining.
It also transferred zero-shot to unseen tasks (AIME, BigCodeBench, MT-Bench, GPQA) without any retraining.
news.hada.io/topic?id=28814
- Over-Editing은 널리 퍼져 있고 측정 가능한 문제로 나타남
- 명시적 프롬프트만으로도 충실한 편집으로 상당 부분 유도 가능함
Coding Models Are Doing Too Much | wh
nrehiew.github.io/blog/minimal...
news.hada.io/topic?id=28814
- Over-Editing은 널리 퍼져 있고 측정 가능한 문제로 나타남
- 명시적 프롬프트만으로도 충실한 편집으로 상당 부분 유도 가능함
Coding Models Are Doing Too Much | wh
nrehiew.github.io/blog/minimal...
news.hada.io/topic?id=28814
- Over-Editing은 널리 퍼져 있고 측정 가능한 문제로 나타남
- 명시적 프롬프트만으로도 충실한 편집으로 상당 부분 유도 가능함
Coding Models Are Doing Too Much | wh
nrehiew.github.io/blog/minimal...
news.hada.io/topic?id=28814
- Over-Editing은 널리 퍼져 있고 측정 가능한 문제로 나타남
- 명시적 프롬프트만으로도 충실한 편집으로 상당 부분 유도 가능함
Coding Models Are Doing Too Much | wh
nrehiew.github.io/blog/minimal...
Origin | Interest | Match
Origin | Interest | Match
#AI #GenAI #GenerativeAI #IntelligenzaArtificiale #LLM
#AI #GenAI #GenerativeAI #IntelligenzaArtificiale #LLM
- **최소 수정** 만으로 해결되는 버그에서도 함수 전체 재작성, 보조 로직 추가, 시그니처 변경까지 일어나며 **거대한 diff** 가 생기기 쉬움
- 기존 구조를 유지하는 **brown-field 작업** 에서는 테스트 통과만으로 충분하지 않고, 얼마나 적게 바꿨는지도 함께 봐야 검토 가능성과 변경 안전성이 유지됨
- 프로그램적으로…
- **최소 수정** 만으로 해결되는 버그에서도 함수 전체 재작성, 보조 로직 추가, 시그니처 변경까지 일어나며 **거대한 diff** 가 생기기 쉬움
- 기존 구조를 유지하는 **brown-field 작업** 에서는 테스트 통과만으로 충분하지 않고, 얼마나 적게 바꿨는지도 함께 봐야 검토 가능성과 변경 안전성이 유지됨
- 프로그램적으로…
https://awesomeagents.ai/leaderboards/code-completion-llm-leaderboard/
#Leaderboards #CodeCompletion #Humaneval
https://awesomeagents.ai/leaderboards/code-completion-llm-leaderboard/
#Leaderboards #CodeCompletion #Humaneval
https://awesomeagents.ai/leaderboards/code-completion-llm-leaderboard/
#Leaderboards #CodeCompletion #Humaneval
https://awesomeagents.ai/leaderboards/code-completion-llm-leaderboard/
#Leaderboards #CodeCompletion #Humaneval
(論文読み)BigCodeBench: 多様な関数呼び出しと複雑な指示を用いたコード生成のベンチマーキング
(論文読み)BigCodeBench: 多様な関数呼び出しと複雑な指示を用いたコード生成のベンチマーキング
THUDM/codegeex4-all-9b
THUDM/codegeex4-all-9bリポジトリは、THUDMが公開した90億パラメータの多言語コード生成モデルです。
ソフトウェア開発の様々な場面で、コード補完や生成、コードインタプリタ、ウェブ検索、関数呼び出し、リポジトリレベルのコードQ&Aなどに対応可能です。
BigCodeBenchやNaturalCodeBenchなどのベンチマークで高い性能を示しており、100億パラメータ未満のコード生成モデルでは最も強力なモデルとして知られています。
THUDM/codegeex4-all-9b
THUDM/codegeex4-all-9bリポジトリは、THUDMが公開した90億パラメータの多言語コード生成モデルです。
ソフトウェア開発の様々な場面で、コード補完や生成、コードインタプリタ、ウェブ検索、関数呼び出し、リポジトリレベルのコードQ&Aなどに対応可能です。
BigCodeBenchやNaturalCodeBenchなどのベンチマークで高い性能を示しており、100億パラメータ未満のコード生成モデルでは最も強力なモデルとして知られています。
MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
www.arxiv.org/abs/2601.03192
RAGの弱点を受動的なところだと見て、RAGに保存する情報に意図や結果、強化学習における行動価値のようなものを追加する。記憶の検索も類似度と価値を半分ずつ混ぜてランキングづけする。
ベンチマークとしてはHLE, BigCodeBench, ALFWorld, Lifelong Agent Benchが使われている
MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
www.arxiv.org/abs/2601.03192
RAGの弱点を受動的なところだと見て、RAGに保存する情報に意図や結果、強化学習における行動価値のようなものを追加する。記憶の検索も類似度と価値を半分ずつ混ぜてランキングづけする。
ベンチマークとしてはHLE, BigCodeBench, ALFWorld, Lifelong Agent Benchが使われている
IterPref enhances code generation in large language models by mimicking human iterative debugging. It identifies error-prone areas and uses Direct Preference Optimization for precise error correction, boosting performance on BigCodeBench.
IterPref enhances code generation in large language models by mimicking human iterative debugging. It identifies error-prone areas and uses Direct Preference Optimization for precise error correction, boosting performance on BigCodeBench.
Gemini-Exp-1206 just achieved the top rank on BigCodeBench-Hard.
- 37.8% on Complete
- 28.4% on Instruct
BigCodeBench-Hard is a subset of more challenging and user-facing tasks.
Gemini-Exp-1206 just achieved the top rank on BigCodeBench-Hard.
- 37.8% on Complete
- 28.4% on Instruct
BigCodeBench-Hard is a subset of more challenging and user-facing tasks.