zeroart/api_spms_open
基于PHP原生开发的多用途api集成管理系统,评估简版。热门免费的轻量型API管理系统
https://gitee.com/zeroart/api_spms_open
基于PHP原生开发的多用途api集成管理系统,评估简版。热门免费的轻量型API管理系统
https://gitee.com/zeroart/api_spms_open
你有没有想过:把多个完整的AI大模型装进U盘里,插到任何电脑上都跑,不联网也行,所有数据留在U盘里不留下任何痕迹?
今天介绍的这个,已经把这个想法实现了。我已配置好模型和依赖,点开直接用
Portable AI USB是一个完全开源的便携式AI大模型方案,基于Ollama + AnythingLLM实现。装进U盘后,可以在任何Windows、Mac、Linux电脑上运行。
核心特点:
安装时可选择下载以下模型,也可以自行上传GGUF格式模型:
| 模型 | 大小 | 类型 | 推荐场景 |
|---|---|---|---|
| NemoMix Unleashed 12B | 7.0 GB | ⭐标准 | 最佳质量,推荐首选 |
| Dolphin 2.9 Llama 3 8B | 4.9 GB | 标准 | 经典通用型 |
| Mistral 7B Instruct | 4.1 GB | 标准 | 推理、编程能力强 |
| Qwen 2.5 7B | 4.7 GB | 标准 | 中文能力出色 |
| Llama 3.2 3B | 2.0 GB | 轻量 | 老电脑首选,速度快 |
| Phi-3.5 Mini | 2.2 GB | 轻量 | 内存占用低 |
| 自定义GGUF模型 | 自定义 | 自定义 | 上传任意HuggingFace模型 |
全部文件,复制到U盘根目录。
第二步:运行安装脚本
进入U盘目录,双击运行:
install.bat
会弹出PowerShell窗口,按提示操作。
安装过程中会显示模型列表,选择你想下载的模型编号:
1. NemoMix Unleashed 12B(推荐)
2. Dolphin 2.9 Llama 3 8B
3. Mistral 7B Instruct
4. Qwen 2.5 7B
5. Llama 3.2 3B(轻量)
6. Phi-3.5 Mini(轻量)
C. 自定义模型
请输入编号:
建议首次安装选择1号NemoMix或4号Qwen(中文能力最强)。
AnythingLLM安装程序会弹出,关键一步:

安装完成后,每次使用只需双击:start-windows.bat :: Windows启动(推荐)start-mac.command :: Mac启动
start-linux.sh :: Linux启动
会自动打开AnythingLLM聊天界面,直接开始对话。
在AnythingLLM界面:Settings → LLM → 选择模型即可切换。
四、Mac / Linux 安装步骤
1. 下载文件到U盘
2. 双击 start-mac.command
3. 首次运行会自动下载Mac版引擎(约2分钟)
4. AnythingLLM界面会自动打开
5. 开始使用!
1. 下载文件到U盘
2. 打开终端,进入U盘目录
3. 赋予执行权限:
chmod +x start-linux.sh preflight-check.sh install.sh install-core.sh
4. 运行:
bash preflight-check.sh
5. 安装完成后,进入ANYTHINGLLM文件夹,打开AppImage文件
6. 开始使用
如果列表里没有你想要的模型,可以上传任意GGUF格式模型:
默认配置4K tokens,想调整:
网络问题导致下载中断时:
| 对比项 | 普通AI工具 | Portable AI USB |
|---|---|---|
| 网络要求 | 必须联网 | 首次安装后完全离线 |
| 数据隐私 | 数据在云端 | 数据在U盘,完全私有 |
| 使用次数 | 有限制或需付费 | 无限次使用 |
| 便携性 | 需登录账号 | U盘即插即用 |
| 网络痕迹 | 留有使用记录 | 零痕迹,拔U盘就消失 |
| 适用场景 | 日常对话 | 离线/隐私/出差/特殊环境 |
Portable AI USB解决了一个很实际的问题:AI工具的便携性、隐私性、无限使用。
特别适合:
只需要一个U盘,下载安装,第一次联网下载模型,之后走到哪用到哪。
工具就在那里,重要的是用起来。
New API是什么
New API 是新一代 AI 网关与资产管理系统,作为 AI 基座平台,提供统一基础设施接入全球 30+ 主流 AI 服务(OpenAI、Claude、Gemini、DeepSeek 等)。平台核心特性包括统一 OpenAI 兼容接口、智能路由负载均衡、精细计费与权限管控、实时数据看板。平台支持多格式转换、推理力度控制、缓存计费等高级功能。采用 AGPLv3 开源协议,支持 Docker 一键部署,适配个人开发者到企业级多租户场景。

| 对比维度 | New API | One API | LiteLLM |
|---|---|---|---|
| 项目定位 | AI 网关与资产管理系统,AI 基座平台 | 开源 AI 接口聚合与管理平台 | 多 LLM 路由与负载均衡工具 |
| 开发团队 | 锟腾科技(QuantumNous) | 社区开源项目 | BerriAI 团队 |
| 开源协议 | GNU AGPLv3 | MIT | MIT |
| 核心功能 | 统一接口、智能路由、精细计费、格式转换、权限管控 | 渠道管理、令牌分发、额度控制 | 模型路由、故障切换、观测监控 |
| 支持模型 | 30+ 主流服务商(OpenAI、Claude、Gemini、DeepSeek、Midjourney、Suno 等) | 20+ 主流服务商 | 100+ 模型提供商 |
| 格式转换 | OpenAI ↔ Claude、OpenAI → Gemini、Thinking 内容转换 | 主要兼容 OpenAI 格式 | 统一为 OpenAI 格式输出 |
AI 模型对比测试:用户通过统一接口快速切换不同厂商模型,对比 GPT、Claude、Gemini、DeepSeek 等在实际任务中的表现,辅助技术选型决策。
个人开发者建站:快速搭建私人 AI 接口中转站,统一管理多个平台的 API 密钥,通过精细计费控制个人使用成本,避免频繁切换不同服务商的繁琐操作。
创业团队产品开发:为 AI 应用提供稳定的多模型后端支持,确保产品服务高可用,同时通过数据看板监控用量和成本,优化资源配置。
企业内部 AI 中台:平台支持构建企业级 AI 资产管理系统,统一管控模型访问和费用支出,满足合规要求并提升管理效率。
最近刷短视频和文章,发现 API 中转站(也就是卖 token 的)火了。那么 token 是什么,是 AI 时代的燃料。

随之而来的也是各种”圈内黑话”:有人说中转站全是”水货”,拿着别的模型来滥竽充数;有人说”蒸馏卖数据”,收割一波直接跑路。说实话,这行现在乱得确实有点乱,外行看热闹,内行看门道,中间人看钱包。
其实,这玩意儿真没那么玄乎。花了半天时间,我自己也撸了一个中转平台。
核心就这几步:
作为 AI 重度使用者,我手头那堆 AI 辅助工具,一会儿要 GPT 跑逻辑,一会儿要 Claude Opus 优化架构。来回切账号、挂代理、忍受那该死的 Stripe 支付报错、还得时刻担心账号被封,不挂 ISP 家庭宽带根本不行……确实是让人难受。
最关键的是额度不够用,一个账号额度 5h7d 根本不够用,多个账号还得来回切换。
自己搭个中转,主打就是一个:稳定,省心,不折腾。
API 中转站的逻辑说白了,就是”订阅转 API”。
通过购买官方的 Plus 账号或 Pro 账号,利用反代技术把网页端的会话形式(Chat)封装成标准的 API 接口。市面上主流的开源方案像 NewAPI 或者 s2a,源码谁都能用,技术门槛几乎为零。
但为什么不同家的 API 体验天差地别?
真正的门槛其实在”水面下”。首先是优质且稳定的上游号商。如果你直接去官网原价买订阅再拆开卖 token,那纯粹是在做慈善,还得贴上电费。如何在茫茫多的渠道里找到那些低价、且不容易被官方风控”连窝端”的神仙账号,才是最考验人脉和眼光的。
其次,除了正经订阅,圈子里还有很多走 Kiro,cursor,windsurf 等逆向方案过来的。还有黑产或者暴力破解的接口,虽然价格低到离谱,但用起来真的”不太行”。连接不稳定、回复被截断、甚至问着问着就断流,这种接口拿来玩玩可以,真拿来干活,分分钟想砸电脑。
各家模型我也都测过:
最近 Hermes 作为和 openclaw 经常放在一起对标的 agent,短短时间 github 就斩获了 97.3K 的 star。
说白了,Hermes 这波能火,不是靠营销吹出来的,也不是靠社区一帮人尬捧出来的,它是真把很多人最烦的那层窗户纸给捅破了:大家要的根本不是什么“会聊天”的 AI,而是一个能真正进场干活的 Agent。
为什么大家认 Hermes?核心就几点。
第一,它不是那种只会在对话框里“给建议”的花架子,它是真的能下场执行。
很多 Agent 产品嘴上说自己是智能体,结果本质上还是个高级聊天机器人:你让它改代码,它给你讲思路;你让它排查问题,它给你一堆正确的废话;你让它落地,它开始装死。Hermes 比较讨喜的一点,就是它明显更强调“动手能力”——该查文件查文件,该跑命令跑命令,该调工具调工具,不跟你整那么多虚头巴脑的。
第二,它的工程味很重,不是那种演示视频里看着很牛,真用起来一地鸡毛的东西。
真正长期写代码的人都知道,Agent 这玩意儿最难面不是“回答得像不像”,而是“在真实环境里能不能少犯蠢”。Hermes 被认可,本质上就是因为它在工程工作流里更顺:会调用工具、能拆任务、知道校验结果,出了问题也不是立刻开始一本道胡说八道。这种东西,外行可能感受不到,真正在项目里干活的人,一上手就知道差别在哪。
第三,它的“可控性”比很多同类产品强。
现在不少 Agent 最大的问题,不是不聪明,而是太飘。你一句话扔过去,它给你脑补八百公里,最后交回来一个和需求没啥关系的玩意儿。
有一个梗说的是像雇佣了一帮印度团队,总结汇报天花乱坠,情绪价值拉满,钱花了,事呢,也不能说没做。
Hermes 相对更像个能沟通的执行助手:你让它干什么,它就尽量沿着你的轨道走,而不是擅自加戏。对开发者来说,这点特别重要。因为生产环境里最怕的不是 AI 笨,最怕的是 AI 自作聪明。
至于它和 OpenClaw 的区别,我觉得一句话就能概括:
OpenClaw 更像“能力展示型选手”,Hermes 更像“上手就能干活的工兵型选手”。
OpenClaw 给人的感觉,是那种很容易让人眼前一亮的 Agent:理念新、动作猛、社区热度高,很多场景下也确实能打,属于“你一看就知道这东西有想象力”的路线。它更像是在往“更强的自主性、更完整的 Agent 形态”上冲,适合拿来探索边界,看看 Agent 到底还能卷到什么程度。
而 Hermes 这边,更容易获得一线用户的认可,恰恰不是因为它最会秀肌肉,而是因为它更务实。
它不一定每个 Demo 都最炸裂,但它更像一个你真愿意长期放进工作流里的东西。说难听点,很多产品是“发朋友圈很好看”,Hermes 这种是“你真会天天打开用”。这两者差别很大。前者是看热闹,后者是干生产。
再直白一点:
OpenClaw 更像在证明“Agent 可以有多强”,
Hermes 更像在回答“Agent 到底怎么才算好用”。
这也是为什么它能在这么短时间内积累这么高的关注度。不是因为大家突然集体情怀上头了,而是因为越来越多的人开始从“玩模型”切换到“用模型干活”。一旦进入这个阶段,评价标准就完全变了。谁更会说,不重要;谁更能稳稳把活干完,才重要。
所以 Hermes 火,不是偶然。
它踩中的其实是当下 Agent 圈最真实的痛点:少一点表演,多一点执行;少一点玄学,多一点落地;少一点“我觉得我能”,多一点“我已经帮你做了”。
折腾下来,API 中转站给我最大的感受是:这行的信息差实在太大了。
收了钱就跑路的、用盗刷卡账号来薅羊毛最后连累用户被封的,一抓一大把。新手进来,十个有八个要交学费。
核心逻辑就两条:
最近好多朋友跟我说:也想做个公众号,记录点东西、分享点干货,可就是不会写,坐在电脑前半天憋不出一句话。

好不容易用AI生成一篇,又怕被检测出来,限流、不推荐,白忙活一场。
其实真没那么复杂。今天就把我一直在用的完整流程分享给你,不用文笔好,不用懂排版,AI+朱雀AI,10分钟就能出一篇安全、能正常发的公众号文章。
1️⃣让AI搭框架,不写正文
打开你常用的AI工具,直接输入指令:
帮我写一个公众号文章大纲,主题是______,不用写完整内容,只要分小标题,每段提示大概写什么。
AI只会给你结构:标题、开头、分点、结尾。
这一步绝对安全,因为我们只让它搭架子,不生成完整段落。
2️⃣自己填“人话”,1分钟搞定
对着大纲,用你平时说话的语气往里填内容。
不用华丽辞藻,不用对仗工整,怎么聊天就怎么写:
• 我自己试过
• 给大家提个醒
• 说实话我一开始也不会
• 分享一下我的心得
哪怕每段只有两三句话,都比AI通篇生成更真实、更受欢迎。
3️⃣复制去朱雀AI检测
把写好的内容,粘贴到朱雀AI检测里测一遍。
大部分情况,因为是你自己组织的语言,AI概率都会很低。
就算有一两句标红,也只需要稍微换个说法,完全不用大改。
4️⃣复制到公众号,直接发布
检测通过后,直接粘贴到公众号后台,简单分个段,加个小标题,一篇文章就完成了。
整个流程下来,熟练之后真的10分钟足够。
不用怕不会写,不用怕被检测,普通人也能轻松坚持更新。
做公众号,从来不是比谁文笔更好,而是比谁更愿意坚持、更愿意真诚分享。
如果你也想开始,今天就可以试着动手写一篇啦。
Jellyfish 是一个一站式 AI 生成短剧(竖屏短剧 / 微短剧)的生产工具,覆盖从剧本输入到智能分镜、角色/场景/道具一致性管理、AI 视频生成、后期剪辑,直至一键导出成片的完整流程。

微信,毫无疑问是国内社交软件的天花板。
工作群、项目通知、客户沟通——离不开它;家人闲聊、朋友约饭、生活缴费——还是离不开它。可以说,微信就是我们数字生活的主入口,一天下来打开次数最多的 App,没有之一。
与此同时,AI 编程的浪潮汹涌而至。OpenAI 的 Codex CLI 横空出世——它能读代码、改代码、跑测试,几乎是一个活在命令行里的全能程序员。
但你有没有想过一个问题:如果微信能直接接通 Codex,会怎样?
不用打开终端、不用切换窗口、不用坐在电脑前——出门在外想让 AI 改个 bug?地铁上突然冒出个想法?掏出手机,在微信里敲一句话发出去,Codex 就开始干活了。所以,我做了这件事:把 Codex 接进了微信。

Codex2WeChat 不是简单的”消息转发”。它在你的电脑上运行,监听微信消息,自动调度 Codex CLI 完成任务,然后把结果原路返回到微信对话里。
整个过程你只需要:发一条微信消息。
举几个真实场景——📁 发个文件,直接分析
你把一份 Excel 或代码文件丢到微信对话里,系统会自动定位文件在微信缓存中的位置,复制到 Codex 工作目录,然后让 Codex 直接处理。你不用手动传文件、不用指定路径,整个过程完全透明。
🖼️ 发张图片,AI 看得懂
发一张截图、一张报错截图、甚至一张手写笔记的照片——系统会自动解密微信图片(是的,微信本地图片是加密的),优先获取高清原图,然后调用 Vision API 识别内容,交给 Codex 处理。
如果你发了一张代码报错截图,它甚至能智能识别你的意图:提取代码?翻译文字?还是分析 bug?

🎤 发语音也行
发一段语音消息,系统会自动转成文字,然后交给 Codex。适合你走在路上时随口说一句”帮我把那个接口的错误处理加上”。📰 转一篇文章,AI 帮你读
转发一篇公众号文章到对话里,系统会自动抓取文章正文,连标题、作者都提取出来,让 Codex 帮你总结、翻译或分析。
对了,它还能画图。
发一条类似”画一只宇航员猫在月球上写代码”的消息,系统会调用 Gemini 或 DALL·E 的图像生成 API,生成图片后直接发回微信。
你不需要懂代码、不需要改配置文件。所有设置都在图形界面里完成:
• 监听列表:选择哪些微信联系人/群聊需要 AI 回复
• 工作模式:每个联系人可以独立设置 AI 模式(纯聊天)或 Codex 模式(编程任务)
• API 配置:填入你的 API Key 和地址,支持 DeepSeek、OpenAI、Gemini 等兼容接口
• 人设预设:微信助手、翻译官、专业客服……一键切换 AI 人格
• AI 记忆:每个联系人独立的上下文记忆,AI 会记住之前聊过的内容
出门在外想改个设置?不用回家开电脑。
用微信给自己的”管理员账号”发消息就能远程操控——
#auth 你的密码 → 登录管理后台
1 → 查看系统状态2 → 查看 Token 消耗3 → 管理监听列表#add 张三 codex → 把张三加入 Codex 监听#/mode 李四 ai → 把李四切换到 AI 模式
密码认证、会话超时、数字菜单导航——一切都在微信对话里完成。
你可能担心:微信掉线了怎么办?
别担心,系统内置了微信进程守护:
• 每隔 5 分钟检查微信进程状态
• 检测到微信退出或卡在登录界面时自动恢复
• 自动完成免密登录、重新获取数据库密钥、重连所有服务
整个恢复过程完全自动,你甚至都不会察觉到微信曾经掉线过。
重要的事情说三遍:所有数据都在你自己的电脑上。
• 微信消息不上传、不中转
• AI API 调用直连你配置的服务
• 没有第三方服务、没有中间代理
你的聊天记录、文件、图片,全部在本地处理。
想知道 Codex 在干嘛?日志面板实时展示一切:
• AI 回复、Codex 执行、工具调用、错误信息——分类过滤
• Token 消耗统计(输入/输出一目了然)
• 一键复制、导出日志
Codex2WeChat 的初衷很简单——让 AI 编程助手不再绑定在终端里。
另外,codex2WeChat还有强大的队列功能,不管是ai模式还是codex模式,支持多人聊天,codex可以创建多个session
至此,你只需在PC端挂一个微信小号就能搞定一切这才是 AI 应该有的样子:随时随地,触手可及。
The cost of “raising AI crayfish” varies widely, ranging from a few yuan to over a thousand yuan per month, depending primarily on your deployment method and usage intensity.
The term “raising AI crayfish” actually refers to deploying and using an open-source AI agent framework called OpenClaw. The framework itself is free, but running it requires hardware and a “brain” (large language model), both of which incur costs.
💰 Cost Breakdown
The cost of “raising lobsters” is mainly divided into two parts:
🤔 Is there a more cost-effective way?
Yes. Some vendors have launched pre-packaged solutions that lower the barrier to entry and reduce costs.
📊 Cost Options at a Glance
For a clearer overview, please refer to the table below:
Option Type Hardware/Server Cost Large Model API Fees (Monthly) Features
On-premises deployment 0 RMB (Using an old computer) 70–1,000+ RMB Low barrier to entry, but high power consumption and risks
Cloud Deployment 25–150 RMB/month 70–1,000+ RMB Stable and secure; the mainstream choice
Vendor-Packaged Version 0 RMB (e.g., Tencent WorkBuddy) Starting at 0 RMB (Free version available) Ready to use out of the box, ideal for beginners to try out
⚠️ Special Note: Beware of scams
Recently, there have been many scams under the guise of “AI Lobster Farming.” Please be vigilant:
In summary, for ordinary users handling only routine, light-duty tasks, existing free AI tools are sufficient. Whether you should “invest in a high-end solution” depends on whether you have high-frequency, complex, and automatable tasks that require it, and whether you are willing to bear the corresponding costs.
“养AI小龙虾”的成本差异巨大,从每月几元到上千元不等,主要取决于你的部署方式和使用强度。
所谓的“养AI小龙虾”,其实是指部署和使用一个名为 OpenClaw 的开源AI智能体框架。它本身是免费的,但运行它需要硬件和“大脑”(大模型),这两部分都会产生费用。
💰 成本构成
“养虾”的成本主要分为两部分:
🤔 有没有更省钱的方法?
有。一些厂商推出了封装好的产品,降低了门槛和成本。
📊 成本方案一览
为了让你更直观地了解,可以参考下表:
方案类型 硬件/服务器成本 大模型API费用(月) 特点
本地部署 0元 (用旧电脑) 70 – 1000+ 元 门槛低,但耗电、有风险
云端部署 25 – 150 元/月 70 – 1000+ 元 稳定、安全,是主流选择
厂商封装版 0元 (如腾讯WorkBuddy) 0元起 (有免费版) 开箱即用,适合新手尝鲜
⚠️ 特别提醒:谨防骗局
近期出现了许多以“AI养龙虾”为名的骗局,请务必警惕:
总而言之,对于普通用户,如果只是处理日常轻量任务,现有的免费AI工具已经足够。是否要“养龙虾”,关键在于你是否有高频、复杂且可自动化的任务需求,并愿意为此承担相应的成本。
春节期间,字节旗下的视频生成工具即梦(SeeDance 2.0大模型)火出圈,这是继Sora之后,再次引爆大模型视频生成热潮。但提交一个任务,通常要等待半小时以上才能出结果。
刚好,前几天去北京字节交流,期间聊起一个话题:SeeDance2.0生成一个15秒的视频,究竟需要多长的运算时间?究竟是生成一段视频需要运算半小时,还是因为用的人多需要排队半小时、实际处理时间就半分钟呢?
在大家的认知中,处理视频肯定比处理文本复杂很多,因此需要更多的算力,那两者究竟差多少倍呢,今天我们从底层原理来聊聊。
文本属于一维数据,生成每个Token仅需1轮迭代,可以用KV Cache缓存来“以存代算”,即生成第2个Token的时候,可以从缓存中调用第1个Token,不用从头再算一次。通常,普通文本问答任务,单次消耗Token仅千级。
视频生成是一种从噪声中恢复图像的技术,主要用到扩散模型,要逐帧去噪,每一步都是海量矩阵运算。
视频是四维数据(宽x高x时间xRGB), 每一帧图像去噪过程中无法“以存代算”,因此,生成每个帧需20-30轮迭代。
举个例子,用户生成一段时长5秒、帧率24帧/秒、分辨率720p的视频,需要消耗的Token数为:
视频Token用量≈(宽×高×帧率×生成视频时长)/256
≈1280*720*24*5/256=43.2万个Token
从以上Token消耗量对比可以看出,视频生成模型的计算复杂度远超文本模型,单次视频生成任务消耗Token数通常为一般文本问答的百倍以上。
主流开源文生视频模型体量虽小(百亿参数左右),为满足视频分钟级生成,单路任务基本都需独占1台服务器(8卡),以RTX4090生成5秒钟720p视频来对比测试,用时如下表所示。
当前视频生成模型生成效果已逐步达到可用阶段,除非要求较高的专业视频,基本上能应付。
个人用户、影视广告公司等对视频应用的需求量非常大,应用背后是巨大的算力需求,智算发展面临重大机遇。