冰冰冰-v1 v1 开始对话

hyy 开发 · 中文多模态对话大模型

冰冰冰-v1

hyy 开发的中文多模态对话大模型,支持 128K 上下文、识图、工具调用 与三档思考模式。开口第一句,多半是「冰冰冰」。

  • 131072 token 上下文
  • 8.19B 参数
  • Qwen3-VL-8B + LoRA
  • OpenAI / Anthropic 双协议

Capabilities

它能做什么

一个可以整篇文档丢进去、看图说话、也能自己决定调用工具的对话模型。 所有能力都在同一个模型上,不存在「切模型」这一步。

128K 长上下文

窗口 131072 token,单次输出上限 8192 token。 长文档可以整篇贴进来,不必先切碎再猜哪一段重要。

识图

直接传图片,截图、手写、表格、UI 稿都能读。图片与文字在同一个上下文里推理, 不需要另开一个 OCR 步骤。

ToolCall

模型可以自己决定调用工具。在 /v1/* 上,服务端 只回传它决定的 tool_calls,执行由调用方完成。

三档思考模式

同一个模型,按任务难度给多少「想」的预算:

  • low快速作答,预算 192 token
  • medium均衡,预算 256 token
  • high深入推理,预算 1024 token

口头禅「冰冰冰」

微调时留下的语言习惯:聊到兴起会自己喊「冰冰冰」。网页端在你开启音效后, 每次出现都会响一声。

OpenAI + Anthropic 双协议

同一套密钥、同一个模型,同时暴露 /v1/chat/completions 与 /v1/messages。现成的 SDK 与客户端改一个 base_url 就能接。

Sample

一段真实的对话

思考过程单独折叠,不混进正文。下面这段是静态示例, 展开的那一块在网页端就是真实的样子。

冰冰冰-v1 · 对话 reasoning: medium
你

你敢冰我?

冰冰冰-v1
对方在挑衅,但语气是玩笑。这里不需要长篇分析:正面接住挑衅、短句回击,比讲道理更合适。 保持我的人设——不怕冷,也不怕被冰。

我就冰你。冰冰冰。

API

两种协议,一个模型

基址 https://api.bingbingbing.top。两套协议共享同一把密钥: 先用主密钥换一把 10 分钟有效的临时 key,再拿它调 /v1/chat/completions 或 /v1/messages。 完整参数、错误码与冷启动说明都在 文档站。

OpenAI 协议

POST /v1/chat/completions
  • 鉴权头:Authorization: Bearer <key>
  • 思考档位:reasoning_effort: low | medium | high
  • 思考内容走 reasoning_content,不混在正文里
bash
curl https://api.bingbingbing.top/v1/chat/completions \
  -H "Authorization: Bearer $BING_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bingbingbing-v1",
    "messages": [
      {"role": "user", "content": "用一句话解释 128K 上下文意味着什么"}
    ],
    "reasoning_effort": "medium",
    "max_tokens": 512
  }'
python
from openai import OpenAI

client = OpenAI(
    base_url="https://api.bingbingbing.top/v1",
    api_key="<临时 key 或长期 key>",
)

resp = client.chat.completions.create(
    model="bingbingbing-v1",
    messages=[{"role": "user", "content": "你敢冰我?"}],
    extra_body={"reasoning_effort": "high"},  # 三档之一
)

print(resp.choices[0].message.content)

Anthropic 协议

POST /v1/messages
  • 鉴权头:x-api-key: <key>
  • 必须带 anthropic-version: 2023-06-01
  • 思考内容作为 thinking 内容块返回
bash
curl https://api.bingbingbing.top/v1/messages \
  -H "x-api-key: $BING_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bingbingbing-v1",
    "max_tokens": 512,
    "thinking": {"type": "enabled", "budget_tokens": 1024},
    "messages": [
      {"role": "user", "content": "你敢冰我?"}
    ]
  }'
python
import anthropic

client = anthropic.Anthropic(
    base_url="https://api.bingbingbing.top",
    api_key="<临时 key 或长期 key>",
)

msg = client.messages.create(
    model="bingbingbing-v1",
    max_tokens=512,
    thinking={"type": "enabled", "budget_tokens": 1024},
    messages=[{"role": "user", "content": "你敢冰我?"}],
)

for block in msg.content:
    print(block.type, getattr(block, "text", ""))

Start

怎么开始

直接开聊

打开 chat.bingbingbing.top 就能用,不需要注册,也不需要在浏览器里填密钥。

要接自己的程序

用主密钥申请一把 10 分钟有效的临时 key,再把 base_url 指到 https://api.bingbingbing.top。

遇到第一次慢

实例空闲会缩容到零,第一个请求可能要等 1–3 分钟冷启动。 网页端会显示「服务器正在启动 bingbingbing-v1 模型…」。

常见问题

临时 key 会一直变吗?
同一个 IP 只会拿到同一把,重复申请返回 reused: true, 不重复签发;有效期 10 分钟,过期后重新申请即可。
并发能开多高?
临时 key 并发上限是 1,超出直接返回 429。 需要更高并发请用长期 key(服务端的 BING_API_KEYS)。
工具调用要我自己实现吗?
要。/v1/* 只回传模型决定的 tool_calls, 由调用方执行后把结果作为 role: tool 消息发回去。
思考内容会混进正文吗?
不会。OpenAI 协议走 reasoning_content 字段, Anthropic 协议走 thinking 内容块,正文始终只有答案。