为什么“GPT 图像 API”是文本模型的误称
当开发者搜索 GPT 图像 API 时,他们通常期望服务返回图像文件。然而,大多数以此命名的服务实际上是旨在编写提示词的基于文本的 LLM。这些模型接收概念并输出描述性文本,然后将其输入到 DALL·E、Midjourney 或 Stable Diffusion 等图像生成器中。
这种区别很重要,因为文本模型不处理像素,而是处理语言。使用专用的文本 API 进行提示词工程,可以让你更精细地控制风格、构图和光照描述,而不受图像模型原生提示词语法的限制。文本 API 充当了人类意图与图像生成器需求之间的翻译器。
对于需要高容量的管道,文本 API 比通过多模态模型发送每个请求更便宜、更快。你可以独立于渲染成本迭代提示词文本。这种关注点分离允许你优化文本生成的创造力和准确性,同时将繁重的图像渲染工作留给专门的图形引擎。
LLM 在图像生成管道中的作用
LLM 在许多现代图像管道中充当创意引擎。它们接收简单的用户想法,并将其扩展为包含风格提示、相机角度、光照条件和艺术参考的详细提示词。这个过程称为提示词工程,对于从图像生成器获得一致结果至关重要。
- 提示词扩展: 将“一只猫”扩展为“一只逼真的虎斑猫坐在窗台上,黄金时刻的光线,85mm 镜头,浅景深。”
- 风格迁移: 将特定的艺术风格(如“油画”、“赛博朋克”或“水彩”)应用到提示词文本中。
- 参数格式化: 将自然语言请求转换为 Stable Diffusion 或 Midjourney 所需的特定语法,例如添加权重参数或负向提示词。
通过使用 LLM,你可以标准化提示词的质量。不再依赖手动编写提示词,你可以自动化该过程,确保每个图像请求都有详细、结构良好的提示词。这减少了试错的需求,并提高了最终图像生成的成功率。
用于成人或创意内容的无审查模型
标准 LLM 通常由于内容过滤器而拒绝为成人、争议性或小众主题生成提示词。对于在特定流派工作的创作者来说,这可能是一个主要限制。无审查 LLM 模型不应用这些过滤器,允许你生成合法成人内容、奇幻暴力或非传统艺术风格的提示词,而不会被打断。
这些模型经过调整,可在合法用途下不会拒绝回答。它们不是 GPT、Claude、Gemini、Grok 或 DeepSeek。它们是托管在专用 GPU 服务器上的开放权重模型,专为创意自由而设计。唯一始终适用的硬性限制是禁止涉及未成年人的性内容。
使用无审查 API 确保你的管道可以处理你选择的任何创意方向。无论你是为情色艺术、黑暗奇幻还是实验性设计生成提示词,该模型都会生成文本,而不会基于主观内容策略进行阻止。这对于内容多样性至关重要的商业管道尤其有价值。
提示词生成与直接图像生成
直接图像生成 API(如 DALL·E 或 Midjourney)在一个服务中结合了文本到文本和文本到图像的过程。虽然方便,但它们通常根据图像输出大小和分辨率收费,这对于高容量使用来说可能很昂贵。此外,这些服务可能有更严格的内容过滤器,限制你的创意选择。
相比之下,提示词生成 API 专注于文本。这允许你只为文本 token 付费,这比图像生成 token 便宜得多。然后,你可以将生成的提示词发送给你喜欢的任何图像生成器,从而根据成本或质量灵活切换引擎。
这种方法还将创意写作与渲染解耦。如果你想为单个图像测试多个提示词变体,你可以使用文本 API 快速且廉价地完成。只有在你拥有最佳提示词时,你才支付图像生成的费用。这种优化降低了总体成本并提高了实验速度。
将文本 API 与图像生成器集成
将文本 API 与图像生成器集成涉及一个简单的工作流程:LLM 生成提示词,图像 API 对其进行渲染。这可以使用脚本或无代码工具进行自动化。文本 API 使用标准的兼容 OpenAI 格式,使其易于与现有 SDK 集成。
要集成,你需要将 base URL 设置为你的文本 API 提供商,并使用适当的 API 密钥。模型 ID 通常为“uncensored”。你可以使用流式输出(SSE)进行实时提示词生成,或使用标准响应进行批处理。支持函数调用,允许你将输出结构化为 JSON,以便你的图像生成器更容易解析。
以下是你可能构建请求的方式:
from openai import OpenAI
client = OpenAI(base_url="https://api.imagegenapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)关键是将文本 API 视为提示词优化器。你可以添加系统指令来指导 LLM 遵循你的特定图像生成器所需的风格或格式。例如,你可以指示它使用 Midjourney 语法或 Stable Diffusion 参数。这确保输出准备好立即使用,无需进一步编辑。
处理长提示词的上下文窗口
上下文窗口决定了 LLM 可以在单个请求中处理多少信息。我们的 API 提供 100,000-token 上下文窗口,足以满足大多数提示词工程任务。这允许你在提示词中提供详细的背景信息、风格指南或多个示例。
更大的上下文窗口对于复杂项目很有用,在这些项目中,你希望 LLM 在整个生成过程中记住特定的约束或风格。例如,你可以提供角色描述列表,并要求 LLM 生成在不同场景中保持一致的提示词。
如果你的用例需要更多的上下文,你可以将请求拆分为多个调用或使用摘要步骤。然而,对于大多数图像生成管道,100k token 足以处理详细提示词、负向提示词和风格参考,而不会触及限制。
面向高吞吐量流水线的高效扩展
扩展图像流水线需要一个高性价比的文本 API。我们的定价非常直接:输入 token 每 100 万 token $0.25,输出 token 每 100 万 token $1.00。没有月费或订阅,预付额度永不失效。这种按量付费模式非常适合需求波动的各类项目。
你可以使用加密货币(USDT 或 USDC)以最低 $10 充值你的账户。大额充值可获得额外额度:$50 充值获得 +5%,$100 充值获得 +10%。这使得高容量使用更加实惠。
相比之下,标准 LLM 通常按 token 收取更高的费率。通过使用无审查的专用文本 API,你可以显著降低文本生成成本。这允许你将更多预算分配给图像生成,这通常是管道中更昂贵的部分。
隐私:保护你的提示词私密性
当使用 LLM 进行创意工作时,隐私很重要。我们的 API 不会使用你的提示词进行训练。你的数据保持私密,你可以生成内容而不用担心它被用于改进其他模型。这对于提示词风格或内容可能是专有内容的商业项目至关重要。
注册非常简单:你只需要电子邮件和密码。获取试用额度无需电话号码或信用卡,额度为 $0.50,有效期 7 天。注册完成后,你可以立即生成 API 密钥。
每个账户有一个 API 密钥,可以随时重新生成。如果密钥泄露,你可以立即撤销它。这确保你的管道保持安全,并且只有授权请求会被处理。每个密钥每分钟 300 次请求的限制也有助于防止滥用并确保稳定的性能。