1 / 17

Amazon Bedrock

企业级生成式 AI 网关:模型、调用与成本优化

从 Agentic AI 五层架构看 Bedrock 的定位与实践

AWS 解决方案架构师分享 · 2026 年 7 月

今日分享议程

1
Agentic AI 五层架构
理解 AI 技术栈的思考框架,Bedrock 的定位
2
Bedrock 主要模型
重点:Anthropic Claude 与 OpenAI GPT 系列
3
三种调用方式 + Demo
Converse / InvokeModel / OpenAI 兼容 API,SDK 与 curl 示例
4
模型 ID 前缀的含义
us. / eu. / apac. / global. —— 跨区域推理与数据主权
5
Prompt 缓存
支持模型、工作机制与三大收益
6
定价与定价级别
按需 / Batch / Priority / Flex / Reserved,成本优化组合拳
7
再往上走
安全合规 / Guardrails / Knowledge Bases / AgentCore

1️⃣ Agentic AI 五层技术栈 × 亚马逊云科技产品对应关系

Agentic AI 五层技术栈与亚马逊云科技产品对应关系
💡 讲法:从底层往上过一遍 → 落到 L2 模型层(Amazon Bedrock)与 L4 平台层(AgentCore)——不要绑定单一模型;模型是通用品,你的数据不是。

2️⃣ Bedrock 主要模型:一个 API,10+ 厂商

10+ 模型厂商 一个 API 统一接入 一套安全合规体系

🧠 Anthropic Claude 今日重点

  • Fable 5(Mythos 级新旗舰)· Opus 4.8 · Sonnet 5 · Sonnet 4.6 · Haiku 4.5
  • Agent / 编码场景事实标准,Claude Code、Kiro 背后模型

⚡ OpenAI GPT 今日重点

  • GPT-5.6 Sol / Terra / Luna(前沿模型登陆 Bedrock)
  • gpt-oss 120B / 20B 开放权重,可微调(RFT)

🌏 其他模型(一句话带过)

Amazon Nova、Meta Llama、Mistral、xAI Grok,以及 DeepSeek、Qwen、GLM、Kimi、MiniMax 等中国系模型——覆盖超低成本到多模态各类需求,按需选用。

💡 为什么重要:市场变化快,Bedrock 让你"换模型只改一个 model-id",不锁定任何单一厂商。
Bedrock 支持的基础模型(官方文档)

2️⃣ Anthropic Claude 系列

模型定位适用场景
Claude Fable 5 🆕 2026-06Mythos 级新旗舰,高于 Opus 一档跨多日自主 Agent:分阶段规划、委派子 Agent、自我验证
Claude Opus 4.8旗舰,最强推理复杂 Agent 任务、深度分析、高难度编码
Claude Sonnet 5 促销中新一代主力质量/成本最佳平衡,日常生产负载首选
Claude Sonnet 4.6上一代主力,成熟稳定已验证的生产工作负载
Claude Haiku 4.5最快最便宜分类、路由、摘要等高频轻量任务

📏 Fable 5 上下文

1M token 窗口 + 128K 输出,可整库分析代码

🏆 Agent 编码

独立测试 SWE-Bench Pro 约 80%,领先同档

💾 缓存

全系支持 Prompt 缓存,独有 1 小时 TTL

🎯 通过 Bedrock 使用 Claude:AWS 与 Anthropic 同步首发 + AWS 合规/数据驻留/企业级支持。
AWS What's New: Claude Fable 5 Fable 5 模型卡 Claude in Amazon Bedrock

2️⃣ OpenAI GPT 系列 前沿模型已登陆 Bedrock

模型定位说明
GPT-5.6 Sol旗舰最强能力档
GPT-5.6 Terra中档主力价格为 Sol 的一半,均衡之选
GPT-5.6 Luna轻量档高性价比、低延迟
gpt-oss 120B / 20B开放权重可微调(RFT),支持 Batch / Flex 层级

🏢 In-Region 部署

GPT-5.6 部署在 us-east-1 / us-east-2 / us-west-2,价格与 OpenAI 数据驻留档持平——不出 AWS 就能用 OpenAI 前沿模型

💾 30 分钟缓存

GPT-5.6 支持 30 分钟缓存窗口(介于 Claude 5min 和 1h 两档之间),读 0.1× 价格

🎯 账单、安全、网络全部走 AWS 体系——一个合同、一套 IAM、一个 VPC 私网入口同时用 Claude 和 GPT。
Bedrock 定价页 · OpenAI 分栏 支持的模型列表

3️⃣ 调用方式:核心端点与 3 条数据面路径

端点用途API
bedrock控制面列模型、管理访问、预置吞吐
bedrock-runtime数据面(AWS 原生)Converse / ConverseStream / InvokeModel
bedrock-mantle数据面(三方 SDK 兼容)OpenAI Chat Completions / Responses + Anthropic Messages

✅ Converse API

推荐默认。统一格式,一套代码切换全部文本模型,支持工具调用/流式/多模态

⚠️ InvokeModel

各厂商原生格式(Anthropic ≠ Llama ≠ Nova),仅在需要厂商私有功能时使用

🔗 mantle 兼容范围

Chat Completions:GPT 全系 + DeepSeek / Qwen / GLM / Kimi 等多数对话模型
Responses:GPT-5.6 系为主
Anthropic Messages:仅 Claude 全系(Anthropic SDK / Claude Code 可直连)

⚠️ 实战提醒:务必显式设置 maxTokens——不设则按模型上限预留配额,并发能力可差 43 倍,是 ThrottlingException 最常见根因。
Bedrock 支持的 API 各模型 API 兼容性矩阵(逐模型勾选表) 端点文档

3️⃣ Demo:Converse API(AWS 原生)

🐍 Python (boto3)

import boto3

brt = boto3.client("bedrock-runtime",
                   region_name="us-east-1")

resp = brt.converse(
    modelId="global.anthropic.claude-fable-5",
    system=[{"text": "你是资深云架构师"}],
    messages=[{"role": "user",
        "content": [{"text": "用一句话介绍 Bedrock"}]}],
    inferenceConfig={"maxTokens": 512},  # 必须显式设置!
)
print(resp["output"]["message"]
          ["content"][0]["text"])
print(resp["usage"])  # token 用量与缓存指标

💻 AWS CLI

aws bedrock-runtime converse \
  --model-id global.anthropic.claude-fable-5 \
  --messages '[{"role":"user","content":
      [{"text":"用一句话介绍 Bedrock"}]}]' \
  --inference-config '{"maxTokens":512}' \
  --region us-east-1

💡 切换模型只改 model-id:换成 gpt-5.6-terradeepseek.v3-2,代码一行不动

⚠️ CLI 不支持流式,流式请用 SDK 的 converse_stream()

🎯 一套代码,全部模型——这就是"为模型灵活切换而构建"的具体实现。
Converse API 代码示例(官方) boto3 converse 参考

3️⃣ Demo:OpenAI / Anthropic SDK 零改造迁移

🐍 OpenAI SDK(只改两行)

from openai import OpenAI

client = OpenAI(
    base_url="https://bedrock-mantle"
             ".us-east-1.amazonaws.com/v1",
    api_key="$BEDROCK_API_KEY",  # Bedrock API Key
)
resp = client.chat.completions.create(
    model="gpt-5.6-terra",
    max_tokens=512,
    messages=[{"role": "user",
               "content": "介绍一下 Bedrock"}],
)
print(resp.choices[0].message.content)

🌐 curl

curl https://bedrock-mantle.us-east-1\
.amazonaws.com/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $BEDROCK_API_KEY" \
  -d '{
    "model": "gpt-5.6-terra",
    "max_tokens": 512,
    "messages": [
      {"role":"user","content":"介绍一下 Bedrock"}
    ]
  }'

✅ OpenAI 生态(LangChain、LlamaIndex、网关)改 base_url + key 即接入

Anthropic SDK 同理:Messages API(/v1/messages)原生格式直连 Claude,Claude Code 等工具无缝对接

🎯 迁移成本趋近于零:OpenAI SDK → Bedrock,享受 AWS 的安全、合规与统一账单。
Bedrock OpenAI 兼容 API 文档 Bedrock API Keys

3️⃣ 调用 Bedrock 的鉴权方式

方式形态有效期适用场景
IAM 临时凭证(Role / STS)生产首选SigV4 签名,SDK 自动小时级,自动轮换EC2 / Lambda / EKS 后端服务:无长期密钥、最小权限、CloudTrail 全审计
IAM 长期 AK/SKSigV4 签名长期(需人工轮换)传统集成、本地 profile;新项目不推荐长期密钥
API Key(短期)Bearer token≤12 小时(随会话)本地开发、快速调试;权限继承生成者身份
API Key(长期)Bearer token(后台自动创建专属 IAM 用户)自定义过期时间探索试用;官方不建议用于生产
# API Key 方式:SDK 自动识别环境变量
export AWS_BEARER_TOKEN_BEDROCK=your-api-key
# curl 则用 -H "Authorization: Bearer $KEY"

# SigV4 方式:boto3 自动签名
# 凭证链:环境变量 → ~/.aws/credentials → IAM Role

⚠️ 怎么选

  • 生产后端 → IAM Role 临时凭证(SigV4)
  • OpenAI / Anthropic SDK 生态(mantle) → API Key:三方 SDK 不会做 SigV4 签名,Bearer 是唯一选择
  • 双向流式 API(Nova Sonic 语音)不支持 API Key,必须 SigV4
  • 长期 Key 务必设过期时间,可用 IAM 条件键强制(如限 90 天内)
🎯 一句话:生产用 IAM Role,三方 SDK 迁移用 API Key,两者权限都落在 IAM 上、都可审计。
Bedrock API Keys 文档 IAM 凭证与 Bedrock API Keys 发布公告

4️⃣ 模型 ID 前缀:4 种格式

格式示例含义
基础 IDanthropic.claude-sonnet-4-6单区域按需,仅限该区域有 in-region 部署的模型
地理前缀us. / eu. / apac. + 基础 ID跨区域推理 Profile:地理边界内多区域路由,数据不出边界
全球前缀global.anthropic.claude-fable-5路由到任意商业区域,最大吞吐与可用性
ARNarn:aws:bedrock:…:inference-profile/…应用推理 Profile(打 tag 做成本分摊)/ 预置吞吐
地理前缀 us. / eu. / apac. 数据主权 / 合规优先 global. 前缀 最高可用性 / 吞吐优先 Application Profile ARN 成本追踪 / 分摊优先 ← 合规敏感 追求吞吐 →

⚠️ 很多新模型只能通过推理 Profile 调用——直接用基础 ID 会报 on-demand throughput isn't supported。用 aws bedrock list-inference-profiles 查询。

🎯 前缀选择本质是数据主权决策;跨区域推理按来源区域计价,不额外收费。
支持的推理 Profile(官方) 跨区域推理文档

5️⃣ Prompt 缓存:机制与 Demo

💾 两种缓存机制不一样!

Claude(显式)GPT-5.6(显式断点)
触发手动插 cachePoint 标记prompt_cache_breakpoint 断点;默认 implicit 模式自动在最新消息加一个断点
TTL5 分钟默认 / 1 小时可选30 分钟(默认,prompt_cache_options.ttl
门槛/上限1024–4096 tok(按模型)/ 4 个检查点1024 tok / 4 个断点
观察指标cacheRead/WriteInputTokenscached_tokens / cache_write_tokens

⚠️ 仅 GPT-5.5 及更早是全自动缓存(≥1024 tok 前缀、写入免费);GPT-5.6 起改为显式断点、写入 1.25×。GPT 缓存走 Responses API(bedrock-mantle)。

好的缓存对象:system prompt、few-shot、工具定义、长文档

⚠️ 两家都要求前缀逐字节一致——时间戳、会话 ID 放到动态部分/标记之后,否则缓存碎片化

🐍 Claude 显式缓存示例(Converse API)

resp = brt.converse(
    modelId="us.anthropic.claude-sonnet-4-6",
    system=[
        {"text": LONG_SYSTEM_PROMPT},  # >2048 tok
        {"cachePoint": {"type": "default"}},
    ],
    messages=[{"role": "user",
        "content": [{"text": user_question}]}],
    inferenceConfig={"maxTokens": 1024},
)
u = resp["usage"]
# 首次: cacheWriteInputTokens > 0
# 后续: cacheReadInputTokens > 0 (命中!)
print(u["cacheReadInputTokens"],
      u["cacheWriteInputTokens"])
🎯 Agent 多轮对话是最大受益场景——每轮都携带全部历史与工具定义。
Prompt 缓存官方文档 官方代码示例

5️⃣ Prompt 缓存:三大收益

成本 ↓ 90% 延迟 ↓ 最高 85% 缓存读不占 TPM 配额

💰 价格乘数(相对标准输入价)

缓存读 0.1×(省 90%) 标准输入 写入 5m/30m 1.25× 写入 1h

写入计价:Claude 5 分钟写 1.25×、1 小时写 2×;GPT-5.6 30 分钟写 1.25×(无 1h 档)。示例($/百万 tok):Sonnet 4.6 写 $3.75(5m) / $6.00(1h)、读 $0.30;GPT-5.6 Terra 写 $3.44(30m)、读 $0.28。

⚖️ 回本条件(TTL 窗口内请求数 → 节省)

窗口内请求数输入成本节省
1(仅写入)−25%(更贵!)
232%
567%
1078%

💡 算例:10K token system prompt 的 Agent,每轮输入成本从 $0.03 → $0.003(Sonnet 4.6),高频调用月成本差一个数量级

🎯 TTL 窗口内 ≥2 次请求才回本;单次任务不要开缓存。
Prompt 缓存文档 缓存定价(Bedrock 定价页)

6️⃣ 定价:Anthropic 与 OpenAI(US East,$/百万 token)

🧠 Anthropic

模型输入输出缓存读
Fable 5$10.00$50.00~$1.00*
Opus 4.8$5.00$25.00$0.50
Sonnet 5 促销$2.00$10.00
Sonnet 4.6$3.00$15.00$0.30
Haiku 4.5$1.00$5.00$0.10

促销价至 2026-08-31,之后 $3/$15。*Fable 5 缓存价按标准乘数推算,以定价页为准。EU 区 Fable 5 为 $11/$55。

⚡ OpenAI

模型输入输出缓存读
GPT-5.6 Sol$5.50$33.00$0.55
GPT-5.6 Terra$2.75$16.50$0.28
GPT-5.6 Luna$1.10$6.60$0.11
gpt-oss 120B~$0.15~$0.60

💡 为什么和 OpenAI 官网价"对不上":Bedrock 当前为 In-Region 区域内推理,对标 OpenAI 的 Data Residency(数据驻留)档——两者价格完全一致;Bedrock global 跨区推理上线后,价格将与 OpenAI 标准档一致。

🌏 其他模型一句话:DeepSeek / Qwen / GLM / Kimi / MiniMax 输入价普遍在 $0.1–$1 区间,追求极致成本时选用

💡 对比话术:Sonnet 5 促销 $2/$10 vs GPT-5.6 Terra $2.75/$16.5;轻量档 Haiku 4.5 vs Luna 基本持平。价格随时变动,请以官方定价页为准。
aws.amazon.com/bedrock/pricing(权威来源)

6️⃣ 定价级别与成本优化组合拳

级别价格适用场景
Standard(默认)基准价大多数场景,按需付费
Priority+75%客户端低延迟敏感应用,优先处理
Flex−50%非实时任务(评估、摘要),高峰可能排队
Batch−50%离线批量异步处理
Reserved1/3 个月承诺关键业务,99.5% 可用性目标,专用容量
预置吞吐按小时/模型单元高稳定大流量
模型选型
Haiku 替代 Sonnet
省 66%
Prompt 缓存
输入 −90%
Batch / Flex
−50%
智能路由
再省 30%
💡 Intelligent Prompt Routing($1/千次请求)自动把简单请求路由到小模型,不损失质量再省最多 30%。
Bedrock 服务层级 批量推理文档 定价页

7️⃣ 再往上走:从模型到生产级 Agent

🔒 安全与隐私承诺

  • 数据不用于训练任何模型、不与模型厂商共享
  • 地理前缀保证数据驻留 · PrivateLink 私网接入 · KMS 加密 · CloudTrail 审计

🛡️ Guardrails

  • 内容过滤 / 拒答主题 / PII 脱敏 / 上下文接地检查(防幻觉)
  • $0.15/千文本单元起,跨模型统一生效

📚 Knowledge Bases(托管 RAG)

  • $5/GB/月存储 + $1/千次检索,解析/向量化/重排免费
  • 几分钟搭好 RAG,对应五层架构 L3

🤖 AgentCore(L4 平台)

  • Runtime / Gateway(MCP) / Memory / Identity / Observability / Evaluation
  • PoC 到生产的分水岭,支撑成百上千 Agent
🎯 叙事主线:五层架构建立全局观 → Bedrock 多模型入口 → 调用与稳定性 → 缓存与成本 → KB/Guardrails/AgentCore 规模化。
Bedrock 安全文档 Guardrails Knowledge Bases AgentCore

Q & A

谢谢!欢迎交流讨论

一个 API · 全部前沿模型 企业级安全合规 全链路成本可控

定价与模型信息以 aws.amazon.com/bedrock/pricing 为准(2026-07 数据)