128K 长上下文
窗口 131072 token,单次输出上限 8192 token。
长文档可以整篇贴进来,不必先切碎再猜哪一段重要。
Capabilities
一个可以整篇文档丢进去、看图说话、也能自己决定调用工具的对话模型。 所有能力都在同一个模型上,不存在「切模型」这一步。
窗口 131072 token,单次输出上限 8192 token。
长文档可以整篇贴进来,不必先切碎再猜哪一段重要。
直接传图片,截图、手写、表格、UI 稿都能读。图片与文字在同一个上下文里推理, 不需要另开一个 OCR 步骤。
模型可以自己决定调用工具。在 /v1/* 上,服务端
只回传它决定的 tool_calls,执行由调用方完成。
同一个模型,按任务难度给多少「想」的预算:
微调时留下的语言习惯:聊到兴起会自己喊「冰冰冰」。网页端在你开启音效后, 每次出现都会响一声。
同一套密钥、同一个模型,同时暴露 /v1/chat/completions 与
/v1/messages。现成的 SDK 与客户端改一个 base_url 就能接。
Sample
思考过程单独折叠,不混进正文。下面这段是静态示例, 展开的那一块在网页端就是真实的样子。
你敢冰我?
我就冰你。冰冰冰。
API
基址 https://api.bingbingbing.top。两套协议共享同一把密钥:
先用主密钥换一把 10 分钟有效的临时 key,再拿它调
/v1/chat/completions 或 /v1/messages。
完整参数、错误码与冷启动说明都在
文档站。
Authorization: Bearer <key>reasoning_effort: low | medium | highreasoning_content,不混在正文里curl https://api.bingbingbing.top/v1/chat/completions \
-H "Authorization: Bearer $BING_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bingbingbing-v1",
"messages": [
{"role": "user", "content": "用一句话解释 128K 上下文意味着什么"}
],
"reasoning_effort": "medium",
"max_tokens": 512
}'
from openai import OpenAI
client = OpenAI(
base_url="https://api.bingbingbing.top/v1",
api_key="<临时 key 或长期 key>",
)
resp = client.chat.completions.create(
model="bingbingbing-v1",
messages=[{"role": "user", "content": "你敢冰我?"}],
extra_body={"reasoning_effort": "high"}, # 三档之一
)
print(resp.choices[0].message.content)
x-api-key: <key>anthropic-version: 2023-06-01thinking 内容块返回curl https://api.bingbingbing.top/v1/messages \
-H "x-api-key: $BING_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "bingbingbing-v1",
"max_tokens": 512,
"thinking": {"type": "enabled", "budget_tokens": 1024},
"messages": [
{"role": "user", "content": "你敢冰我?"}
]
}'
import anthropic
client = anthropic.Anthropic(
base_url="https://api.bingbingbing.top",
api_key="<临时 key 或长期 key>",
)
msg = client.messages.create(
model="bingbingbing-v1",
max_tokens=512,
thinking={"type": "enabled", "budget_tokens": 1024},
messages=[{"role": "user", "content": "你敢冰我?"}],
)
for block in msg.content:
print(block.type, getattr(block, "text", ""))
Start
打开 chat.bingbingbing.top 就能用,不需要注册,也不需要在浏览器里填密钥。
用主密钥申请一把 10 分钟有效的临时 key,再把 base_url 指到
https://api.bingbingbing.top。
实例空闲会缩容到零,第一个请求可能要等 1–3 分钟冷启动。 网页端会显示「服务器正在启动 bingbingbing-v1 模型…」。
reused: true,
不重复签发;有效期 10 分钟,过期后重新申请即可。
429。
需要更高并发请用长期 key(服务端的 BING_API_KEYS)。
/v1/* 只回传模型决定的 tool_calls,
由调用方执行后把结果作为 role: tool 消息发回去。
reasoning_content 字段,
Anthropic 协议走 thinking 内容块,正文始终只有答案。