AWS生成AIの料金完全ガイド|Amazon BedrockとAmazon Qのコスト計算と最適化
アマゾンウェブサービス(AWS)の生成AIサービスは、利用するサービスやモデル、入出力量などによって料金が変わります。Amazon Bedrockではモデルや推論方式、Amazon Q BusinessやAmazon Q Developerではそれぞれの課金方式に沿って費用を算出します。
そのため、料金表の単価だけを見ても、実際にどの程度の費用がかかるのか判断しにくい場合があります。
本記事では、Amazon Bedrock、Amazon Q Business、Amazon Q Developerの料金体系、用途別のコストシミュレーション、モデル選定、コスト最適化、モデル料金以外に発生する費用を解説します。
※本記事は2026年8月時点のAWS公式情報をもとに作成しています。料金や提供内容は変更される場合があるため、最新情報はAWS公式ページをご確認ください。
AWS生成AIはサービスごとに料金の決まり方が異なる
AWSの生成AIサービスは、サービスごとに課金方式が異なります。Amazon Bedrockはモデルや入出力量、Amazon Q Businessはユーザー数やインデックス容量、Amazon Q Developerは利用プランなどが料金を左右します。
料金を試算する際は、各サービスの課金対象を確認したうえで、利用人数や処理量などの条件を設定します。
■関連記事:AWS生成AI開発の始め方と選び方|サービス比較・料金・事例でわかる導入ガイド
Amazon Bedrockはモデル・入出力量・推論方式で料金が変わる
テキスト生成モデルでは、入力・出力トークンにそれぞれ単価が設定されています。利用するモデルに加え、オンデマンドやバッチなどの推論方式によっても料金は異なります。
Amazon Q Businessはユーザー数やインデックス容量によって料金が変わる
料金を見積もる際は、利用人数とプランに加え、社内文書などを格納・検索するインデックスの容量を確認します。
Amazon Q DeveloperはFree/Proで料金が異なる
Free Tierには月ごとの利用上限があり、Pro Tierでは利用上限の拡大や管理機能などが提供されます。
料金が増えやすい4つのパターン
Amazon Bedrockでは、特に次の要因で料金が増えやすくなります。
- 入力トークンが多い
- 再実行・リトライが多い
- 出力トークンが多い
- 高単価モデルを固定利用している
AWS生成AIサービスの料金体系を整理する
Amazon BedrockとAmazon Qの具体的な料金体系を確認します。あわせて、PoCや本番運用で発生する周辺AWSサービスの費用も整理します。
Amazon Bedrockの料金
Amazon Bedrockは、Anthropic、Amazon、Meta、Mistral AIなど、複数のプロバイダーが提供する基盤モデルを利用できるサービスです。料金は、利用するモデルやモダリティ、リージョンなどによって異なります。テキスト生成モデルでは、主に入力トークンと出力トークンにそれぞれ単価が設定されます。
Standard、Flex、Priority、Reservedなどのサービス階層があり、利用できる階層はモデルによって異なります。
リアルタイム性が不要な大量処理では、バッチ推論も選択できます。対応する基盤モデルでは、オンデマンド推論より50%低い料金が設定されています。レポート生成や大量文書の要約など、即時応答が不要な処理に向いています。
対応モデルではプロンプトキャッシュも利用できます。長いシステムプロンプトや共通コンテキストを繰り返し使う場合、キャッシュから読み込んだ入力トークンには通常より低い料金が適用されます。キャッシュへの書き込み料金も含めて試算します。
※モデルや料金体系は随時更新されるため、具体的な単価はAWS公式の料金ページで確認してください。
Amazon Q Businessの料金
Amazon Q Businessは、社内データをもとに質問への回答や情報検索、コンテンツ生成などを行う企業向けAIアシスタントです。
料金は主に「ユーザーサブスクリプション」と「インデックス容量」で決まります。ユーザーサブスクリプションには以下の2種類があります。
| プラン | 料金 | 主な用途 |
|---|---|---|
| Amazon Q Business Lite | 3USD/ユーザー/月 | 社内情報への質問や権限を反映した回答など |
| Amazon Q Business Pro | 20USD/ユーザー/月 | Liteの機能に加え、コンテンツ生成やAmazon Q Appsなどを利用 |
※最新の料金はAmazon Q Businessの料金(AWS公式)で確認できます。
社内文書などを検索対象にする場合は、インデックス料金も発生します。Starter Indexは1ユニットあたり0.140USD/時間、Enterprise Indexは0.264USD/時間で、1ユニットには最大20,000文書または200MBの抽出テキストが含まれます。
見積もりでは、利用人数に加え、Lite/Proの内訳と検索対象となる文書量を確認します。
Amazon Q Developerの料金
Amazon Q Developerは、コード生成やコードの説明、AWSに関する質問への回答など、開発者向けの生成AI支援サービスです。
| プラン | 料金 | 概要 |
|---|---|---|
| Free Tier | 無料 | 月ごとの利用上限あり |
| Pro Tier | 19USD/ユーザー/月 | Free Tierより高い利用上限や管理機能などを提供 |
※最新の料金や利用上限はAmazon Q Developerの料金(AWS公式)で確認できます。
Free Tierでは、月50回のエージェントチャットインタラクションなどを利用できます。Pro Tierでは利用上限が拡大され、AWS IAM Identity Centerを利用した管理機能なども利用できます。
2026年5月15日以降、新規Free Tierアカウントと新規Proサブスクリプションの作成は停止されています。IDEプラグインと有料サブスクリプションは2027年4月30日にサポート終了予定で、AWSはKiroへの移行を案内しています。既存のProサブスクリプションでは、引き続きユーザーを追加できます。
無料枠・PoCで利用する場合の注意点
AWSでは、新規顧客向けの無料利用枠として最大200USDのクレジットが用意されており、Amazon Bedrockも対象です。
PoCでは利用者数や処理件数、検索対象データを限定できるため、費用も小さくなります。本番では利用量が増えるほか、監視、ログ保管、セキュリティ、データ更新などの運用費用も加わります。
PoCの利用実績をもとに、本番時の利用量と周辺費用まで含めて試算します。
モデル料金以外に発生するAWSサービスの費用
RAGを構成する場合は、モデルの推論料金に加えて、次の費用が発生します。
- 埋め込み生成:文書をベクトル化するためのモデル利用料
- ベクトルデータベース:Amazon OpenSearch Serviceなどの検索基盤
- ストレージ:Amazon S3などへの文書や生成結果の保存
- ログ・監視:Amazon CloudWatchなどによるログ保存や利用状況の監視
- データ処理:AWS Lambdaなどを使った前処理やデータ連携
- ネットワーク:構成によって発生するデータ転送や通信関連の費用
- 評価・セキュリティ:生成結果の評価、アクセス制御、ガードレールなど
こうした費用は、利用量や保存期間、構成によって積み上がります。AWS生成AIの費用は、モデル利用料と周辺AWSサービスを合わせた総額で見積もります。
用途別の料金シミュレーション
生成AIの料金は、利用人数や実行回数、入出力量によって変わります。ここでは代表的な4つの用途について、一定の条件を置いて月額料金を試算します。
※実際の料金は、利用リージョン、モデル、データ量、周辺AWSサービスの構成などによって異なります。
① 社内Q&Aアシスタント(Amazon Q Business)
社内マニュアルや議事録、FAQなどを対象に、従業員からの質問へ回答するケースです。
Amazon Q Business Proは1ユーザーあたり月額20USD、Enterprise Indexは1ユニットあたり0.264USD/時間です。1ユニットには最大20,000文書または200MBの抽出テキストが含まれます。
以下の条件で試算します。
- Amazon Q Business Pro:20ユーザー
- Enterprise Index:1ユニット
- 1か月:730時間
ユーザー料金:20ユーザー × 20USD = 400USD/月
インデックス料金:0.264USD × 730時間 = 約192.72USD/月
合計すると、月額の目安は約592.72USDです。
検索対象の文書量が増えてインデックスを追加すれば、その分だけ料金も増えます。対象部門や検索対象データを限定して始め、利用状況を見ながら範囲を広げる方法もあります。
※Amazon Q Businessを利用している既存顧客を想定した試算です。
② RAG検索・FAQ自動回答(Amazon Bedrock)
問い合わせや顧客対応の一部を、RAG(検索拡張生成)で自動化するケースです。
ここでは回答生成部分を、次の条件で試算します。
- モデル:Claude Haiku 4.5
- 日本国内クロスリージョン推論
- 月間問い合わせ:10,000件
- 1回あたり入力:2,000トークン
- 1回あたり出力:500トークン
Claude Haiku 4.5の日本国内クロスリージョン推論は、100万入力トークンあたり1.1USD、100万出力トークンあたり5.5USDです。
月間の入力は2,000万トークンとなるため、
20 × 1.1USD = 22USD
出力は500万トークンとなるため、
5 × 5.5USD = 27.5USD
モデル推論料金は月額約49.5USDです。
この金額には、埋め込みモデル、ベクトルデータベース、ストレージ、検索処理、ログ・監視などの料金は含まれていません。RAGでは、これらの周辺費用も加えて見積もります。
■関連記事:RAGとは|生成AIをビジネスに活用するための仕組みと導入メリットを解説
③ 自動レポート生成・要約業務(Amazon Bedrock+バッチ処理)
議事録、日報、KPIレポートなどをまとめて生成するケースです。即時応答が不要であれば、バッチ推論を利用できます。
以下の条件で試算します。
- モデル:Claude Sonnet 4.5
- 日本国内クロスリージョン推論
- 月間レポート生成数:1,000件
- 1件あたり入力:10,000トークン
- 1件あたり出力:2,000トークン
Claude Sonnet 4.5の日本国内クロスリージョン推論は、オンデマンドの場合、100万入力トークンあたり3.3USD、100万出力トークンあたり16.5USDです。
オンデマンドで処理した場合は、
- 入力:1,000万トークン × 3.3USD = 33USD
- 出力:200万トークン × 16.5USD = 33USD
月額約66USDです。
対応するバッチ推論ではオンデマンドより50%低い料金が適用されるため、同じ条件ならモデル推論料金は月額約33USDとなります。
大量の文書要約や定期レポートなどは、即時性の要否を確認したうえでバッチ処理へ振り分けると、コストを抑えられます。
④ 開発者支援・コード生成(Amazon Q Developer)
コード生成、コード説明、リファクタリングなどに利用するケースです。
Amazon Q Developer Proは1ユーザーあたり月額19USDです。既存のPro契約で開発者10名が利用する場合、
10ユーザー × 19USD = 190USD/月
となります。
Amazon Bedrockとは異なり、トークン量ではなく利用する開発者数が月額料金に影響します。
※既存のAmazon Q Developer Proサブスクリプションを利用しているケースで試算しています。
※ここで示した金額は試算です。実際の料金は利用量や構成によって変わるため、PoCで得た実績値をもとに本番時の費用を見積もります。
モデル別の料金・特徴と選定フロー
Amazon Bedrockでは、用途や求める精度に応じて複数の基盤モデルを選択できます。2026年8月時点では、Amazon Nova 2、Anthropic Claude、Meta Llama 4、Mistral AIなどのモデルが提供されています。Amazon Nova 2 Lite、Claude Sonnet 5、Llama 4 Scout/Maverick、Mistral Large 3はいずれもAmazon Bedrockで利用できます。
主要モデルの料金と特徴を比較する
| モデル | 特徴 | 向いている用途 | 選定ポイント |
|---|---|---|---|
| Claude Sonnet 5 | 推論、コーディング、複雑な指示への対応に強い | 複雑な分析、エージェント、開発支援 | 高い精度が必要な処理で検討 |
| Amazon Nova 2 Lite | コスト効率を重視したマルチモーダルモデル | 文書処理、カスタマーサポート、定型的な自動化 | 処理量が多い用途で検討 |
| Llama 4 Scout/Maverick | テキストと画像に対応するマルチモーダルモデル | Q&A、要約、画像を含む処理 | 必要なコンテキスト長や用途に応じて選択 |
| Mistral Large 3 | コーディング、推論、多言語処理に対応 | 業務アプリ、コード生成、多言語処理 | 精度と料金のバランスを比較 |
モデル料金は、リージョンやサービス階層によって異なります。例えば、Mistral Large 3は東京リージョンで100万入力トークンあたり0.61USD、100万出力トークンあたり1.82USDです。
Claude Sonnet 5は2026年8月31日まで100万入力トークンあたり2USD、出力10USDのプロモーション料金が適用され、9月1日以降は入力3USD、出力15USDの標準料金となります。
モデルや料金は随時更新されるため、利用時にはAWS公式の料金ページで最新情報を確認してください。
高精度モデルを固定するとコストが増えやすい理由
すべての処理で高性能モデルが必要とは限りません。次のような比較的単純な処理では、低コストのモデルでも必要な精度を満たせる場合があります。
- 定型文の生成
- 文書の分類
- 短い文章の要約
- 情報の抽出
- FAQへの回答
複雑な分析や長文生成、コーディングでは、高性能モデルを使うことで再実行や人による修正を減らせる場合があります。モデル単価だけでなく、必要な品質を得るまでの実行回数も含めて比較します。
用途・精度・料金からモデルを切り替える
モデルは1つに固定せず、次の流れで用途ごとに選定します。
- 処理内容を分類する
要約、分類、Q&A、分析、コード生成など、用途を整理します。 - 低コストのモデルから検証する
実際の業務データを使い、必要な品質を満たせるか確認します。 - 精度が不足する処理を高性能モデルへ切り替える
高性能モデルの利用を、難易度の高い処理に絞ります。 - 料金と精度を継続的に比較する
モデルの追加や料金変更に合わせて構成を見直します。
AWS生成AIの料金を最適化する方法
AWS生成AIの料金は、モデル選定だけでなく、入力データの量や処理方法、RAGの構成、キャッシュの利用によっても変わります。導入後は利用状況を確認し、コストが増えている箇所から見直します。
以下の削減率は、サーバーワークスの支援・検証で得られた目安です。実際の効果は、利用量やモデル、システム構成によって異なります。
キャッシュを活用する
同じ質問や共通するコンテキストを繰り返し処理する場合は、キャッシュを活用します。
FAQ型の用途では、生成済みの回答や検索結果をAmazon S3、Amazon DynamoDBなどに保存して再利用する方法があります。こうした構成により、サーバーワークスの支援・検証では推論コストを10〜40%削減できたケースがあります。
Amazon Bedrockのプロンプトキャッシュでは、長いシステムプロンプトや共通コンテキストを再利用できます。AWSでは、対応するワークロードで入力トークンのコストを最大90%削減できるとしています。キャッシュへの書き込みにも料金が発生するため、繰り返し使う部分を対象にします。
参考:Amazon Bedrock prompt caching
プロンプトを圧縮する
入力トークンを減らす方法として、プロンプトから不要な情報を取り除きます。
- 不要な前置きや重複した指示を削る
- チャット履歴を必要な範囲に絞る
- 長文データを事前に要約する
- 必要な情報だけを抽出してモデルへ渡す
プロンプトの構造化や不要情報の削除によって、入力トークンを20〜60%削減できたケースがあります。
ただし、入力を削りすぎると回答精度が下がり、再実行が増える場合があります。回答品質と再実行率もあわせて確認します。
RAGの検索範囲を最適化する
RAGでは、検索対象を広げすぎると、ベクトル検索やモデルへ渡すコンテキストが増えます。部署、業務カテゴリ、期間などのメタデータで検索対象を絞ると、不要な検索結果や入力トークンを減らせます。
サーバーワークスの支援・検証では、以下の改善例があります。
- 検索対象を絞り、推論+検索コストを10〜30%削減
- 埋め込みを全件更新から差分更新へ変更し、更新コストを半分以下に削減
検索範囲やデータ更新方法まで含めてRAGの構成を見直します。
バッチ処理を活用する
レポート生成、大量文書の要約、データ分類など、即時応答が不要な処理はバッチ化を検討できます。
Amazon Bedrockでは、対応する基盤モデルのバッチ推論をオンデマンド推論より50%低い料金で利用できます。
日次・週次のバッチへ処理をまとめることで、実行回数が1/10〜1/50になったケースもあります。非同期化によって、タイムアウトによる再実行や多重送信を減らせる場合もあります。
なお、APIの呼び出し回数だけで料金が決まるわけではありません。入出力トークン量も含めて効果を確認します。
利用状況をモニタリングする
生成AIのコストは、実際の利用状況をもとに見直します。
Amazon Bedrockでは、入力・出力トークンに加え、プロンプトキャッシュの読み取り・書き込みなども個別に課金されます。AWS Cost and Usage Report(CUR)やAmazon CloudWatchなどを使い、次の指標を確認します。
- 入力・出力トークン量
- リクエスト数
- 再実行率
- モデル別の利用量
- キャッシュ利用状況
- 用途・部門ごとのコスト
モデル変更やプロンプト改善、キャッシュ導入の前後を比較すると、施策ごとの効果を確認できます。継続的な見直しによって、5〜20%の改善につながったケースがあります。
参考:Amazon Bedrock Cost and Usage Report data
AWS生成AIの料金が想定以上に増えるケースと対策
本番運用では、PoCでは見えにくかった利用パターンや周辺コストが加わり、事前の見積もりとの差が出ることがあります。
入出力量を少なく見積もっている
チャット履歴を毎回送信する、RAGで複数の文書をコンテキストとして渡す、長文レポートを生成するといった使い方では、1回あたりの入力・出力トークン数が増えます。
対策
- 実際の業務データで平均・最大トークン数を確認する
- チャット履歴やRAGの取得件数に上限を設ける
- 最大出力トークン数を用途ごとに設定する
- 平均値だけでなく、利用量が多いケースも含めて試算する
再実行・リトライを考慮していない
エラーによるリトライ、回答の再生成、ユーザーによる再実行が発生すると、想定よりリクエスト数が増えます。外部サービスとの連携失敗やタイムアウトによる自動リトライにも注意が必要です。
対策
- リトライ回数に上限を設ける
- 同一リクエストの重複実行を防ぐ
- エラー率や再実行率をモニタリングする
- 料金試算に一定の再実行分を含める
高性能モデルを常用している
文書分類や定型的な要約など、比較的単純な処理まで高性能モデルで実行すると、処理量の増加に伴ってコストも膨らみます。
一方、低価格モデルへ切り替えて再実行や人による修正が増えれば、総コストが下がらない場合もあります。
対策
- 用途ごとに必要な精度を定義する
- 単純な処理では低コストモデルを検証する
- 高性能モデルの利用を複雑な処理に絞る
- 再実行や修正まで含めてコストを比較する
PoCと本番運用の費用差を考慮していない
PoCでは利用者数や処理件数、対象データを限定するため、本番より費用を抑えられます。本番移行後は利用量が増えるほか、RAGのデータ更新、ログ保存、監視、セキュリティ、ネットワークなどの費用も加わります。
対策
- PoCで実際のトークン量や利用回数を取得する
- 本番時の利用者数・処理件数へ換算する
- モデル料金以外のAWSサービス費用を含める
- 本番開始後も実績値をもとに見積もりを更新する
AWS生成AIの料金に関するFAQ
Q. AWS生成AIの料金を最短で試算する方法は?
利用するサービスと想定利用量を決め、AWS公式の料金表をもとに概算します。
Amazon Bedrockならモデルと入出力トークン数、Amazon Q Businessならユーザー数とインデックス容量など、サービスごとに課金対象が異なります。PoCを実施した場合は、実際の利用量を本番時の人数や処理件数に換算して見積もります。
Q. Amazon BedrockとAmazon Qはどう使い分ける?
Amazon Bedrockは、独自の生成AIアプリケーションやRAG、エージェントなどを構築する場合に適しています。
Amazon Qは業務別のAIアシスタントとして提供されており、Amazon Q Businessは社内情報の検索やQ&A、Amazon Q Developerは開発業務の支援に利用されます。
自社で生成AIの仕組みを構築するならAmazon Bedrock、特定業務向けのAIアシスタントを利用するならAmazon Qという違いがあります。
Q. モデルによる料金差はどの程度影響する?
処理量が増えるほど、モデルごとの単価差が月額料金に反映されます。
ただし、低価格モデルへ切り替えて再実行や人による修正が増えれば、総コストが下がらない場合もあります。料金だけでなく、実際の業務データで必要な精度を満たせるか確認します。
Q. 小規模利用で料金を抑えるには?
まず利用者や対象業務を限定し、必要な精度を満たせる低コストモデルから検証します。
Amazon Bedrockでは、入力・出力トークンを抑えるほか、即時性が不要な処理をバッチ推論へ振り分ける方法もあります。PoCで実際の利用量を確認してから、本番時の構成や予算を決めます。
まとめ
AWSの生成AIサービスは、利用するサービスやモデルによって料金の決まり方が異なります。Amazon Bedrockではモデルや入出力量、推論方式、Amazon Qでは利用人数やプランなどをもとに費用を見積もります。
料金を試算する際は、モデル利用料だけでなく、RAGやログ・監視などの周辺AWSサービスも含めます。PoCで得た利用実績をもとに、本番時の利用人数や処理量へ置き換えて見積もると、実態に近い予算を立てられます。
コストを抑えるには、用途に応じたモデル選定、プロンプトやRAGの最適化、キャッシュ、バッチ処理、利用状況のモニタリングを組み合わせます。


