AI 模型
Space Bunny LLM 指南:功能、API 接入与评估方法
了解 Space Bunny LLM 的已核实模型信息、长上下文与多模态能力,掌握 API 示例、实用提示词和评估方法,并查看预览访问状态及本站接口限制。

Space Bunny LLM 通常指 Space Bunny Alpha 推理模型,以及提供该模型访问能力的服务。公开介绍的能力包括百万 token 上下文窗口、文本与视觉输入、可调推理级别,以及文本输出。真正值得判断的是:这些能力能否改善某项具体任务,例如审查代码变更、从文档中查找证据,或解读一张截图。
本文介绍模型的基本情况,区分公开宣传的模型能力与网站接入层的限制,并提供一套可以重复执行的评估流程。SpaceBunny.app 提供在线体验、API 访问及配套文档。下文中的提示词和评估表属于建议方法,并非我们实际运行基准测试后得到的结果。
访问状态核查于 2026 年 10 月 3 日: OpenRouter 公告称,其 Space Bunny Alpha 预览路由计划于 2026 年 10 月 5 日结束服务。该公告并不能证明所有 Space Bunny 访问服务都会在同一天关闭。接入前,请确认你选用的具体路由。OpenRouter 模型页面。
目录
- 什么是 Space Bunny LLM?
- 模型能力与访问限制
- 如何有效使用长上下文
- 如何选择推理级别
- 如何处理图片与视频
- Space Bunny API 实用示例
- 便于审查的编程工作流
- 建立小型评估表
- 价格与有效答案的实际成本
- 如何应对预览服务变化
- 常见问题
什么是 Space Bunny LLM?
LLM 是大语言模型的缩写,它根据你提供的指令和上下文生成回答。在这一基本交互方式之上,Space Bunny 还支持视觉输入和可配置的推理级别。它可以返回解释、代码和 JSON 文本;能够接收图片,并不意味着能够生成图片。
了解它时,建议区分三个层次:
- 模型: Space Bunny Alpha,一款开发方未公开身份的预览模型。
- 访问服务: 负责身份验证、计费和请求处理的网站或 API 服务商。
- 路由: 应用实际调用的具体端点和模型标识符。
这些区分有助于避免常见误解。一家服务商提供免费使用,并不代表另一个网站也免费。模型具备某项能力,也不代表每个接口都开放了该能力。在线体验页面上显示的名称,可能与 API 要求的模型标识符不同。
本文核查的模型页面尚未披露底层开发方。因此,没有依据将它归属于某家特定实验室、编造参数规模,或称其为开放权重模型。应当根据文档描述的行为,以及你自己的任务结果,判断所选服务是否适用。
模型能力与访问限制
Space Bunny LLM 介绍页面 列出了以下能力。在依赖这些能力之前,请先核实右侧对应的实际接入条件。
| 公开介绍的能力 | 实际使用时的含义 |
|---|---|
| 1,000,000 token 上下文 | 这是模型容量;访问层可能只接受小得多的请求 |
| 最多 524,288 个补全 token | 这是公开标注的模型上限,不代表推荐输出长度,也不代表所有渠道均可使用 |
| 文本、图片和视频输入 | 可以分析多种形式的证据;支持的格式取决于具体路由 |
| 文本输出 | 回答可以包含说明文字、代码或 JSON |
| 五档推理级别 | low、medium、high、xhigh、max;需要结合自己的任务衡量取舍 |
| JSON 响应 | 仍需解析并校验实际字段与字段值 |
| 工具调用 | 需要接口开放工具能力,并由应用验证工具执行 |

一个具体的接入差异: 本文检查的网站适配层将请求限制为 96 KiB、最多 24 条消息,以及每条消息最多 24,000 个字符。其输出设置上限为 16,384 token,并且不会转发 tools 或 tool_choice。这些是当前代码仓库中的实现限制,并非对底层模型的独立测量结果,也不代表已确认线上部署的具体版本。
在规划代码仓库审查时,这种差异非常关键。不要因为模型页面写着百万 token,就假定可以把整个仓库粘贴进这个网站端点。先确认实际使用的接口,再根据它接受的输入设计任务。
如何有效使用长上下文
当一个判断依赖多个来源之间的关系时,长上下文很有价值:例如一项需求、对应实现、隐藏在政策条款中的例外,以及后续修订。目标是保留相关信息之间的联系,而非一味增加提示词长度。
准备一份证据材料,附上简短的任务说明和固定的来源标签。例如,将需求节选标记为 REQ-01、实现片段标记为 CODE-02、事故时间线标记为 LOG-03。如果日期和版本会影响答案,也要一并提供。排除生成文件、重复的模板内容及无关历史记录。
然后提出一个范围明确的问题:
Compare REQ-01 with CODE-02 using LOG-03 as context.
Find the three most consequential mismatches.
For each, give the source label, exact supporting excerpt,
likely impact, and one check that could disprove the finding.
If the supplied material is insufficient, identify what is missing.
Do not infer implementation details from filenames alone.

这种格式可以降低核验成本。你不必仅凭行文是否流畅来判断答案是否可信,而是可以检查引用的段落,并验证其中的结论。评估时,加入一个根据现有材料无法回答的问题;有用的回答应当指出信息缺口,而不是编造证据。
面对更大的资料集合,可以先让模型建立索引,或在模型之外筛选相关段落。只有尚未解决的问题确实需要更多材料时,再扩充证据。在路由的限制范围内,为指令和回答保留足够空间。上下文容量是单次请求的工作空间,并不等于无关会话之间的持久记忆。
如何选择推理级别
对于直接的信息提取、简短解释和常规起草任务,可以从 low 开始。当任务涉及相互制约的条件、多步骤诊断或复杂设计决策时,再提高推理级别。应将其视为一次实验,而非自动提升质量的开关。
在两个级别下使用相同的提示词和证据,例如比较 low 与 high。保持输出限制及其他控制项一致,比较正确发现、缺乏依据的判断、总耗时和用量。回答更长不一定更好,提高推理级别也无法弥补证据缺失。

对于事故复盘,应在发起两次请求之前定义成功标准:识别可能的故障路径、引用相关日志条目,并提出一个可撤销的诊断步骤。优先选择能够稳定满足这些要求、成本最低的推理级别。
不要拿简短的低推理级别提示词,与经过大幅修改的高推理级别提示词比较。这样同时改变了两个变量,会使结果难以解释。记录每次使用的确切设置,避免依赖可能随时变化的服务商默认值。
如何处理图片与视频
当问题的一部分可以直接看见时,视觉输入会有所帮助,例如布局缺陷、架构图、图表或产品演示。提供媒体内容时,应同时说明审查目的,以及审查者需要遵循的约束。
下面是一段实用的截图审查提示词:
Review this checkout screenshot for obstacles to completing payment.
List at most five observations. For each, describe the visible region,
the potential user problem, and how a human should verify it.
Separate visible evidence from assumptions about behavior.
Do not claim keyboard or screen-reader testing from an image.
对于视频,可以要求模型提供带时间戳的观察结果,并由你亲自检查关键画面。如果小字号文字影响判断,请补充文字转录或放大图。确认所选路由可以读取媒体 URL,并支持相应格式;泛泛的“支持视频”说明,并不能确定编解码器、时长或文件大小限制。
本文检查的网站适配层要求将文本放在 content 中,并在消息层级提供一个包含 type 和 url 的 media 对象。适配层会将这个对象转换为上游服务所需的格式。不要假定其他接口接受的任意多模态内容数组,都可以原样用于这里。验证接入时,请使用可以公开分享的示例媒体。
Space Bunny API 实用示例
Space Bunny API 文档 介绍了身份验证和请求控制项。创建网站 API Key,将其保存在服务端环境中,并确保账户有可用积分。
以下请求使用的字段,已根据 2026 年 10 月 3 日的文档和网站代码仓库进行核对。这是接入示例,并非一次真实推理调用的结果:
curl -N --max-time 120 https://spacebunny.app/api/v1/chat/completions \
-H "Authorization: Bearer $SPACE_BUNNY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stealth/space-bunny-alpha",
"messages": [{
"role": "user",
"content": "Return a JSON object with a summary and three checks for reviewing an API change."
}],
"reasoning": { "effort": "low" },
"max_completion_tokens": 2048,
"response_format": { "type": "json_object" }
}'
这个适配层应使用 max_completion_tokens;当前实现不读取 max_tokens。路由会在内部选择 stealth/space-bunny-alpha,因此传入其他 model 值不会切换模型。
使用 SDK 之前,还需要检查响应协议。当前适配层通常输出自定义的服务器发送事件,事件类型为 delta 和 done。curl -N 会在不缓冲的情况下显示流式内容。JSON 模式描述的是模型生成的答案,而不是整个 HTTP 响应。需要先组装答案文本,再进行解析与校验;流式传输错误应当单独处理。
端点名称看起来像常见的聊天接口,并不能证明它与 SDK 完全兼容。在连接更大工作流之前,先用小型请求验证身份验证失败、积分不足、超时和响应格式异常等情况。
请求失败时,先判断问题发生在哪一层,再考虑修改提示词。收到 401 时应检查网站 API Key;402 表示积分不足;413 表示需要缩小请求。上游拒绝请求或返回无效响应时,可能表现为 502。这些状态码描述的是不同问题,不应全部触发相同的重试策略。
对于流式响应,收到第一段文本并不能证明请求已成功完成。将尚未完成的文本与已通过验收的答案分开处理,并检查最后的完成事件或错误事件。记录请求标识符、耗时和错误类别,避免记录凭据或不必要的提示词内容。在限定的重试预算内处理临时故障,但不要反复发送体积超限的请求。落实这些基本的接入细节,能够让失败原因更容易解释,也能避免将一个演示功能变成不可靠的依赖。
便于审查的编程工作流
对于编程任务,可以要求 Space Bunny 先确认故障路径,再提出补丁。提供最小且有用的文件集合:入口、相关实现、接口,以及现有测试或可复现示例。
Task: investigate the duplicate notification described below.
First identify the execution path and supporting file references.
Then propose the smallest change that addresses the cause.
Preserve public interfaces and avoid unrelated refactoring.
List a reproduction check and any remaining uncertainty.
If a needed file is absent, request it before inventing its contents.

将解释与仓库内容逐一核对,检查建议的代码差异,并执行与变更相关的检查。不要接受虚构的依赖、无关重写,或缺少实际测试记录却声称测试通过的回答。有帮助的答案应当减少不确定性,并留下可以审查的修改。
如果后续使用的访问路由开放工具调用,请先从只读工具开始。验证工具名称、参数、权限和返回结果。在工作流有要求的情况下,例如发送消息或修改生产记录时,应取得明确批准。模型支持工具调用本身并不赋予执行权限,而且这个网站适配层目前没有开放完整的工具调用循环。
建立小型评估表
先在 Space Bunny 在线体验中使用你能够判断对错的示例。首次评估不需要数百条提示词:选择 8 至 12 个有代表性的任务,涵盖常规情况、信息缺失情况,以及证据相互冲突的情况。
在查看答案之前,先定义预期行为。对于政策问题,记录能够确定答案的原文段落。对于代码变更,记录复现方式和必须达到的行为。对于 JSON 提取,定义必需字段、允许的值,以及某个值缺失时应该返回什么。

| 评估维度 | 需要记录的内容 | 验收标准示例 |
|---|---|---|
| 正确性 | 预期答案与实际结果的比较 | 满足所要求的行为 |
| 证据依据 | 引用的证据是否存在,是否支持结论 | 每项关键发现都能追溯到来源 |
| 输出约定 | JSON 解析与字段校验结果 | 必需字段及其值类型通过校验 |
| 运行表现 | 完成时间、失败和重试情况 | 符合该工作流的超时要求 |
| 审查成本 | 人工修正次数及核验时间 | 总投入少于现有流程 |
这些是建议采用的标准,并非已经测得的 Space Bunny 评分。请根据自己的应用选择阈值,而不是照搬一个任意设定的通用通过率。
对困难案例进行重复评估,并保留失败记录。为每项结果保存提示词版本、路由、模型标识符、推理级别和输出上限。与其他模型比较时,使用相同的证据与验收标准。将不支持的请求和错误答案分开记录:过大的请求体被拒绝,反映的是接入限制,而非推理准确率。
对于信息提取,加入一个不存在的字段值,并要求返回 null,而不是猜测。对于截图,加入一项无法仅凭画面确定的观察要求。对于编程,加入一个看似相关但实际无关的文件。这些案例有助于判断系统是否遵循证据和约束,而不仅仅是生成听起来可信的文字。
是否采用模型,应根据具体任务来决定。用于内部起草的助手,即使每次回答都需要编辑,仍然可能有价值。而会更新客户记录的工作流,则需要严格得多的输出约定和授权边界。不要将这些不同场景混在一起,计算出一个看似漂亮的总分。
例如,假设一个答案提取了所有要求的字段,却编造了缺失的账户标识符。提取结果看起来基本完整,但对于更新记录的工作流,它仍应无法通过验收。相反,返回 null 并指出缺少哪个来源的答案,在实际操作中可能才是正确结果。请在审阅结果之前,先决定你期望哪一种行为。
完成第一轮评估后,从三种后续行动中选择一种:将其用于范围明确的任务;修改接入方式后,使用相同案例重新评估;或继续使用现有流程。保留做出这一决定的理由,以便后续预览版本更新时,仍可按照相同标准评估。
价格与有效答案的实际成本
当前 OpenRouter 预览页面显示模型使用免费,而 SpaceBunny.app 有自己的积分体系和商业条款。请查看 Space Bunny 价格页面,确认你实际使用的服务如何收费。不要将一家服务商的价格承诺套用到另一家。
应当跟踪一个通过验收的答案所需的成本,而非仅关注单次请求价格。将重试、废弃回答和人工审查一并计入。如果一个答案需要花十分钟修正,那么名义上便宜的调用也可能很贵。同样,如果增加推理投入能够减少得到正确结果所需的总工作量,这种投入就可能值得。
如何应对预览服务变化
OpenRouter 已公告的 10 月 5 日路由退役安排,使备用方案成为需要立即考虑的问题。Kilo 的模型页面同样标注了 10 月 5 日退役。这两项说明都不能证明另一家独立网站在此之后会提供什么服务。Kilo 模型页面。
将服务 URL、凭据和模型配置与应用逻辑分开保存。保留若干有代表性的提示词和预期输出,并在正式依赖替代路由之前对其进行测试。切换时,重新检查输入格式、输出解析方式和隐私条款。
对于 OpenRouter 的 stealth 路由,模型页面说明服务提供方可能保留提示词和补全内容,但不会将其用于训练。这个区别很重要:“不用于训练”并不等于“从不存储”。提交机密资料之前,请阅读你选择的访问服务的条款。
归档评估记录时,保留对应日期。即使某个预览服务下线,这些记录仍然能够说明,下一个模型需要复现哪些行为。
常见问题
Space Bunny LLM 和 Space Bunny Alpha 是一回事吗?
这个关键词通常指 Space Bunny Alpha,但网站、模型和 API 路由属于不同层次。请检查具体标识符和服务商,而不是只看显示名称。
Space Bunny 能生成图片或视频吗?
本文核查的规格描述了图片和视频输入,以及文本输出。这些信息并不能证明它支持图片或视频生成。
通过网站可以使用完整的百万 token 上下文吗?
不要直接这样假定。本文检查的网站实现设有更小的请求限制。在设计大文档工作流之前,请确认已部署路由的实际限制。
格式合法的 JSON 一定正确吗?
不一定。能够解析,并不代表字段值正确,也不代表符合业务规则。在使用结果之前,需要校验必需字段、类型、取值范围和证据。
本文是基于实测的模型质量评测吗?
不是。本文是一份核对过来源的使用指南和评估方法,不声称提供亲自运行的基准测试分数,也不声称已验证它优于其他模型。
从一个你清楚正确结果的小任务开始。保留证据,检查答案,并记录为了让答案真正可用所付出的精力。与单纯阅读功能列表相比,这样更有助于你可靠地判断 Space Bunny LLM 是否适合自己的需求。