Amazon Bedrock 経由で利用可能な LLM の日本語ベンチマーク性能評価
出典: Zenn (Claude topic)
Hiroba による自動要約
Amazon Bedrock 経由で利用できる複数の LLM を llm-jp-eval という日本語ベンチマークツールで評価した結果をまとめた記事。自然言語推論、質問応答、読解、常識推論など 8 カテゴリで日本語性能を測定し、モデル選定時の判断材料を提供。安価な LLM を使うアプリケーション構築時に特に有用な情報。
出典・元記事
Zenn (Claude topic) の記事を Hiroba が自動要約しました。元記事を読む
読んで良かったら、シェアしてみてください。
同じタグの記事が他に 4068 件あります。
関連する記事
同じタグの記事


LLM のトークン効率化で気をつけたいことまとめ
ZennClaude Code や API を使う際のトークン効率化について、最新モデルの採用、プロンプト見直し、キャッシュの活用、マルチエージェント構成の検討など基本から実践的なポイントをまとめた記事。キャッシュが effort やモデル変更で切れることや有効期限に注意すべき点を解説。

Claude API の Extended Thinking 実装ガイド — budget_tokens、tool use、temperature の 3 つのハマりどころ
QiitaClaude API の Extended Thinking 機能を Python で実装する際の実装手順と 3 つのよくあるエラーを解説。budget_tokens は 1024 以上かつ max_tokens 未満、tool use 併用時は thinking ブロックを会話履歴に含める、temperature 等の指定は不可という制約がある。
