AIコーディングエージェントにとってハーネスはどれほど重要なのか?

AIコーディングエージェントは同じAIモデルを使っていても、モデルを動かすハーネスによって費用や性能が変わる可能性があります。カリフォルニア大学バークレー校とAIランキングサイト「Arena」の共同研究チームは、7つのモデルと3つのハーネスを組み合わせた21通りを2種類のベンチマークで比較しました。その結果、タスクの成功率は大きく変わらない一方、費用には最大5倍の差が生じ、モデル本来の提供元とは異なるハーネスが最適な場合もあることがわかりました。続きを読む...

GIGAZINE 2026年09月17日 14:00

この記事のキーワード

グラフで繋がりを見る

同じキーワードの記事

共有しているキーワードが多い順

GPT-6 AstraがAIコーディング性能でトップ級の67点、圧倒的なトークン効率を示すもFable 5.1には届かず

GIGAZINE 09/07 11:00
AI・人工知能 AIコーディング AIモデル ベンチマーク

JetBrains、AIコーディングエージェント「Junie Local」発表。27BモデルをMac上で完全ローカル実行

はてなテクノロジー 08/26 16:29
AI・人工知能 AIコーディングエージェント AIコーディング AIモデル

テオ氏:アップルのファイルシステムは遅すぎる——AIコーディングを全てLinuxに移行し、ストレージを3分の1に削減 — BigGo ファイナンス

はてなテクノロジー 08/21 22:01
AI・人工知能 AIコーディング ベンチマーク AIコーディングエージェント

Googleが音声会話AI「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」をリリース、リアルタイムで会話しながらコーディング可能

GIGAZINE 09/16 04:22
AI・人工知能 AIモデル ベンチマーク

Sakana AIが複数モデルの使い分けでGPT-6 Astra超えを達成する「Fugu Ultra v2」をリリース&コスパに優れた「Fugu Max」も登場

GIGAZINE 09/14 03:52
AI・人工知能 AIモデル ベンチマーク

「DeepSeek-V4.1-Flash」が登場、複数テストでClaude Opus 5やGPT-5.6 Solを超える性能のオープンモデル

GIGAZINE 09/11 02:32
AI・人工知能 AIモデル ベンチマーク

小型かつ高性能で日本語応答も可能な中国製AIモデル「MiniCPM5-2B」が登場、2BモデルなのにGemma 4 12Bと同等のベンチマークスコア

GIGAZINE 09/08 01:47
AI・人工知能 ベンチマーク AIモデル

コスト削減のためにAIエージェントの出力を短くすると逆にコストがかさむ事例をGitHubが公開、うまくコスト効率を向上するにはどうすればいいのか

GIGAZINE 09/06 22:00
AI・人工知能 AIコーディングエージェント AIコーディング

Metaも新AIモデル「Muse Spark 1.3」 1カ月で大幅強化し「Fable 5に匹敵」

Impress Watch 09/03 03:03
AI・人工知能 AIモデル ベンチマーク

Metaが「Muse Spark 1.3」を発表、ついにAnthropicやOpenAIの最先端モデルに追いつく性能を達成

GIGAZINE 09/03 02:14
AI・人工知能 AIモデル ベンチマーク

JetBrains、Mac上で動作するコーディングエージェント「Junie Local」提供開始。Claude Sonnet 4.5と同等の能力、RTX5909対応も開発中

Publickey 08/30 15:07
AI・人工知能 AIコーディングエージェント AIコーディング

AIに同じミスを繰り返させない「ハーネスエンジニアリング」とは?

GIGAZINE 08/28 14:10
AI・人工知能 AIコーディングエージェント AIコーディング

「100万行コード移行は4年がかり」はもう昔話 Claude Codeで「2週間」に縮める6ステップ/ベストプラクティス

はてなテクノロジー 08/25 04:40
AI・人工知能 AIコーディングエージェント AIコーディング

各種AIのiPhoneでの動作性能を測定した結果がArtificial Analysisによって公開される、コンテキスト長や応答時間を制限して実環境に近い性能を測定

GIGAZINE 08/25 02:26
AI・人工知能 AIモデル ベンチマーク

NVIDIAのAIエージェント「AVO」がARC-AGI-3で100%を達成、同じベースモデルの別条件での評価は約30%で「実行基盤(ハーネス)」の重要性が示される

GIGAZINE 08/24 23:00
AI・人工知能 ベンチマーク AIモデル

プロ開発者の90%がAIコーディングエージェントを週1回以上利用、Claude CodeのシェアがGitHub Copilotを逆転して約2倍差の1位

GIGAZINE 08/24 01:52
AI・人工知能 AIコーディングエージェント AIコーディング

オープンモデルの「Gemma 4 31B」がタスクによっては「Claude Sonnet 5」と同じ品質を40分の1のコストで実現可能

GIGAZINE 08/23 13:05
AI・人工知能 AIモデル ベンチマーク

Claude Code/Codexに中~大規模開発を任せるためのタスク管理 - Qiita

はてなテクノロジー 08/22 01:46
AI・人工知能 AIコーディングエージェント AIコーディング

AIモデル「Ornith-1.5」が登場、Claude Opus 4.8級の大型モデルからスマホ動作可能な軽量モデルまで網羅したオープンモデル

GIGAZINE 08/20 01:57
AI・人工知能 AIモデル ベンチマーク

AIエージェントに「安全なコマンド」を許可しただけで任意コード実行、Dockerが解説するコマンド承認の落とし穴

GIGAZINE 08/19 07:15
AI・人工知能 AIコーディングエージェント AIコーディング
GIGAZINEで元記事を読む