简体中文
|
繁體中文
|
English
|
首页
软件分享
镜像难题,Docker用户必看
迷你主机厂商推荐
特别版Chrome浏览器
Search
1
OpenWrt可让宽带速度瞬间提升?broadbandacc完全揭秘
2,708 阅读
2
无缝转播IPTV,OpenWRT新手也能get udpxy
2,650 阅读
3
OpenWRT必看!安装iStore应用商店,扩展更丰富应用
2,636 阅读
4
OpenWrt轻松多拨,提升网速的必备神器
2,380 阅读
5
零泄漏,零污染,MosDNS让你的网络飞起来
2,207 阅读
简体中文
|
繁體中文
|
English
默认分类
网络赚米
OpenWrt
应用程序
AI
科技
VPS
数码
电脑
云服务
黄鱼
润学
PDD
登录
Search
标签搜索
性价比
OpenWrt
开户
eSIM
开源工具
VPS
香港
Mini PC
安装教程
docker
Docker 部署
迷你主机
银行
银行卡
美国
Docker部署
本地部署
跨平台
CN2 GIA
散热
Xiaopao
累计撰写
847
篇文章
累计收到
2
条评论
首页
栏目
默认分类
网络赚米
OpenWrt
应用程序
AI
科技
VPS
数码
电脑
云服务
黄鱼
润学
PDD
页面
软件分享
镜像难题,Docker用户必看
迷你主机厂商推荐
特别版Chrome浏览器
搜索:
搜索到
4
篇与
的结果
2026-05-07
Gemma 4:把 AI 带进你的口袋,玩转本地智能
最近我一直在玩一波本地 AI,感觉自己像发现了新大陆。今天想跟你聊聊最近火热的 Gemma 4,它把大模型的威力搬进了手机、浏览器,甚至还能离线跑。整个过程就像把一台大卡车的发动机塞进了自行车,既惊讶又让人忍不住想试一试。为什么大家都在讨论 Gemma 4?先说结论:Gemma 4 是 Google DeepMind 发布的开源大模型,和云端的 Gemini 不同,它专门为本地运行优化。想象一下,你在飞机上、地铁里,甚至在山洞里,只要手机里装了模型,你就能和 AI 对话、写代码、分析图片,根本不需要网络。核心亮点 全平台离线:Android App、Chrome Extension、WebGPU 浏览器插件,都可以本地推理。 多尺寸模型:1B、4B、12B、27B 甚至 31B,大小从几百 MB 到十几 GB不等,能对应不同硬件。 多模态支持:新版还能看图说话,直接把照片丢进去,让模型帮你识别、描述。 开源许可证:Apache 2.0,个人商业都能搞,随便改。 装上它到底有多简单?我用了两种方式: 手机:下载安装 Google AI Edge Gallery(不是 Play 商店,需要手动 APK),打开后点几下就能下载 4B 模型,整个过程 5 分钟左右。 浏览器:安装 Gemma Gem Chrome 扩展,后台会用 WebGPU 把模型拉到本地,第一次下载大概 1.5 GB,之后就能随时在任何页面弹出聊天框。 对比之前的 “买个 GPU、装 Ubuntu、跑一堆依赖”,简直是天壤之别——现在只要点几下,模型就出现在你的指尖。到底能干啥?下面列几个我觉得最实用的场景: 随时随地写代码:无网络的飞机上,打开 Chat 窗口,让模型帮你写函数、调试。 文档摘要:把一大段会议纪要粘进去,模型几秒钟给出要点。 图片理解:拍张发票或收据,模型直接读出金额,省去手动输入。 浏览器自动化:让模型在页面上点按钮、填表单,省得每次手动点击。 硬件需求到底有多高?别被大模型的名字吓到,这里有个简易对照表: 模型推荐 RAM存储空间适合设备 Gemma 4 1B4 GB~1.5 GB2021 年以上的 Android 手机 Gemma 4 4B6 GB+~3–4 GBPixel 7、三星 S23 系列 Gemma 4 12B12 GB+~8–10 GB高配手机或配备 16 GB RAM 的笔记本 Gemma 4 27B / 31B32 GB+~30 GB+配 GPU 的笔记本或桌面电脑 如果你手头只有普通手机,推荐先玩 4B,已经够日常用了;如果想搞点重度任务,换台配了 Nvidia GPU 或 Apple Silicon 的笔记本会更爽。常见坑 & 小技巧 下载经常卡住?先检查剩余存储空间,最好用 Wi‑Fi。 模型加载慢?关掉后台 App,给它腾出点内存;或者换成更低位量化的 q4 版本。 电池不耐?启用手机的 NPU(高通 Snapdragon 8 Gen 2、Google Tensor),能省掉一半电耗。 想在 iPhone 用?暂时只能通过电脑的 Ollama 再投屏,或者等官方 iOS 版发布。 如果你想更进一步…本地跑模型已经够酷,但如果你想把模型包装成产品,单纯的本地推理会有点局限。这里推荐 MindStudio——一个零代码平台,直接把 Gemma 4(以及 Gemini、Claude、GPT‑4o)接入业务系统,省去模型管理、API 密钥、服务器运维。你只需要拖拽几下,就能把 AI 加入 CRM、客服机器人、文档分析流。总结:本地 AI 已经不再是遥不可及的梦从最初装个大模型要花几天时间、几百美元的硬件费用,到现在点几下就能把 4B 模型装进手机,我真的觉得 AI 正在向普通人跑去。它让我们的隐私更有保障,也让成本从月付几百降到一次性下载免费。最重要的是,拥有本地 AI 后,你再也不必担心网络不稳、数据泄露,真正掌控自己的信息。如果你还在犹豫,不妨先在旧手机上装个 1B 版玩玩,感受一下 AI 能帮你把『找不到的东西』变成『随手可得』的快感。等手感好了,再升级到 4B、12B,甚至用笔记本跑 27B,大模型不再是科研实验室的专属,任何有想法的普通人都可以玩转它。好了,今天的分享就到这里。有什么想法或者遇到问题,直接在评论区聊,咱们一起探索本地 AI 的可能性吧!😊
2026年05月07日
223 阅读
0 评论
0 点赞
2026-04-22
本地跑 Gemma 4:从零到玩转 AI 小助手的轻松指南
最近有没有跟我一样,看到一堆关于大模型的新闻,心里一阵激动又一阵懵逼?我也是。说白了,就是想在自己的电脑上玩玩 AI,却总被各种硬件、接口、付费限制卡住。今天我把从官方文档、社区经验、各种教程里拼凑出来的实战流程,整理成一篇「朋友聊天」版的长文,帮你一步步把 Gemma 4 放进本地电脑,配上 Hermes Agent、OpenClaw,甚至还能接入微信、Telegram,零成本、全隐私、随手可用。准备好了吗?😉一、为什么要本地装 Gemma 4?1️⃣ 省钱——云端 API 按调用次数收费,跑几百次就能花掉几百块。把模型装在本地,硬件一次性投资,后面几乎不花钱。2️⃣ 隐私——所有对话、文件都保存在自己的机器里,根本不用担心数据泄漏。3️⃣ 可控——想改模型参数、加插件、调上下文长度,都是自己动手,随意随性。二、硬件小贴士:选对设备才能顺畅跑 轻量级(E2B/E4B):Apple Silicon M1/M2/M3 系列或者 8‑16 GB 内存的普通笔记本,几分钟就能起飞。 中等性能(26B MoE):配备 16 GB 以上显存的 RTX 3060 以上显卡,或者 Apple M2 Pro+ 32 GB 统一内存。可以满足大多数多步推理。 旗舰级(31B Dense):需要 24 GB 以上显存(RTX 4090、A100),适合企业级高并发。 如果手头只有普通笔记本,先装 gemma4:e4b,够日常写代码、写文案、玩玩图像生成。三、一步到位:用 Ollama 安装 Gemma 4 在 Ollama 官网下载对应系统的安装包。Mac 直接 brew install ollama,Linux 用 curl -fsSL https://ollama.com/install.sh | sh,Windows 双击安装。 打开终端,确认版本:ollama --version(看到类似 ollama version is 0.20.1 就成功了) 拉取模型(只要一行命令):ollama pull gemma4:e4b(或者 gemma4:26b) 启动服务并对话:ollama run gemma4:e4b,出现 >>> 提示符后直接输入 你好,帮我写个 Python 排序函数。 如果你想在别的程序里调用,只要访问 http://127.0.0.1:11434/v1/chat/completions 的 OpenAI 兼容接口,curl 或者任何 SDK 都能玩。四、把 Hermes Agent 拉进来:让模型会「动手」Hermes 是一个会记忆、会调用工具的智能体。把它和本地 Gemma 配合,你可以让 AI 自动写代码、查文件、甚至发送微信消息。 一键安装脚本(Linux/macOS):curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash。 安装完成后运行健康检查:hermes doctor,确保没有报错。 配置模型(交互式向导):hermes setup,选择「Custom endpoint」,把地址改成 http://127.0.0.1:11434/v1,模型名填 gemma4:e4b。 启动聊天界面:hermes chat,现在你可以对着它说「把今天的邮件内容分类」之类的任务,Hermes 会先调用本地工具(比如文件系统),再让 Gemma 给出答案。 记得把 hermes-agent 的工作目录(默认 ~/.hermes)备份,技能库会自动保存在那里。五、OpenClaw 加持:多平台自动化的“大管家”OpenClaw 更像是一个「网关」,负责把各种聊天渠道(Telegram、Slack、企业微信)接进来,然后把任务交给后端模型。下面给出最简 Docker 组合的步骤。 在项目根目录建 docker-compose.yml,把 Ollama、OpenClaw、Hermes 三个服务都写进去(参考我整理的完整文件)。 执行 docker compose up -d,等几分钟 Ollama 拉完模型。 打开浏览器 http://localhost:18789,进入 OpenClaw 控制台,点「添加模型」——填入 http://ollama:11434(容器内部名称),模型名 gemma4:e4b。 配置好 Telegram Bot Token(在 @BotFather 那里弄到),把 Bot 添加到 OpenClaw,马上就能在 Telegram 里跟「本地 AI」聊了。 最酷的地方是:OpenClaw 负责「渠道」,Hermes 负责「执行」,两者共用同一个 Gemma 4 大脑,任何一次对话都可以在两个系统之间自由切换。六、实战案例:本地 AI 助手帮你写周报假设你每天要写一篇项目周报,平时要跑几段日志、汇总数据、形成段落。以前要打开 Excel、拷贝粘贴、手动写文字。现在只需要: 在 Telegram 给 Bot 发「帮我生成本周项目周报」。 OpenClaw 收到指令后调用系统脚本读取 /var/log/project/*.log,把内容发给 Hermes。 Hermes 把日志交给本地 Gemma,要求它「先抽取关键指标(新增功能数、Bug 修复数),再按固定模板写段落」。 Gemma 返回文字,Hermes 把结果回传给 OpenClaw,Telegram 里立刻看到完整的周报草稿。 全流程几秒搞定,省下的时间足够喝杯咖啡甚至多陪家人。七、常见坑 & 小技巧 模型加载慢:第一次拉模型会慢,耐心等。后面可以在 docker-compose.yml 里加 environment: OLLAMA_KEEP_ALIVE=3600,保持模型常驻显存。 显存不够:先尝试更小的变体 gemma4:e2b,或者使用 Ollama 提供的 4‑bit 量化模型(ollama create gemma4-26b-q4)。 网络访问受限:如果 Hermès 报错找不到 Ollama,确保容器在同一网络,或把地址改成局域网 IP(192.168.x.x:11434),不要用 127.0.0.1。 上下文窗口不够:大模型支持 256k token,实际使用时可以在请求体里加 "options": {"num_ctx": 65536},根据任务调大。 多模型切换:想同时保留轻量的 e2b 用于日常聊天,另装一个 26b 用于复杂推理,只需要再拉一次模型,使用时指定模型名称即可。 八、展望:本地 AI 还能干啥?把 Gemma 4 装好以后,你可以往下面几个方向玩: 多模态:把本地相册的图片丢进模型,让它写图说、生成标签。 自定义插件:写一个 Python 脚本,把 Excel 表格直接解析成 JSON,Hermes 可以调这个插件自动生成报表。 团队共享:把整个 Docker Compose 文件放在 Git,团队成员一键拉起,保证每个人使用的模型、配置完全一致。 最重要的是,进入本地 AI 的时代后,你不再是「被动消费」的用户,而是「主动创造」的作者。只要有一台能跑模型的机器,你就拥有了一个随叫随来的「知识库」和「助理」。结语从「下载 Ollama」到「Hermes + OpenClaw」再到「微信、Telegram 自动化」的完整闭环,其实并不需要多少专业背景,只要跟着上面的步骤一点点敲命令,就能把看似高大上的大模型变成自己生活中的小工具。希望这篇「聊天式」的长文能帮你把 AI 从云端搬回本地,让技术真正贴近生活。有什么疑问或者好玩的小案例,欢迎在评论里聊聊,我会随时补充、一起玩耍。
2026年04月22日
223 阅读
0 评论
0 点赞
2026-04-15
从 Gemma 4 到 Hermes Agent:本地 AI 大模型的实战思考与生活化指南
最近在咖啡馆里,偶然听到旁边的朋友在聊「Gemma 4」和「Hermes Agent」——听起来像科幻小说里的神器,但其实离我们每个人的日常已经不那么遥远了。今天我想把这些技术拆成可操作的碎片,像给你递上一杯温热的咖啡,慢慢品味它们在本地电脑上跑起来的可能性。👀 为什么要关注本地大模型?想象一下,你在写代码、整理文档、甚至聊天时,总是要把请求丢到外部云平台——每一次都要等网络来回,费用也像咖啡豆一样不断累积。如果把模型直接装在自己的机器里,就像把咖啡机搬到家里,想喝时随时按按钮,零等待、零流量、零隐私泄露。⚙️ Gemma 4:Google 的新一代本地友好模型Gemma 4 有四个规格,最常被提到的是 2 B、4 B、26 B(Mixture‑of‑Experts)以及 31 B(Dense)。它们的共同点是: 采用宽松的 Apache 2.0 许可证,商用、闭源都不怕踩雷。 专为本地运行调优,参数效率高,显存占用比同等 dense 模型低很多。 原生支持高级推理、函数调用、结构化 JSON、system 指令和多模态(文字、图片、音频)输入。 最有意思的是 26 B 的 MoE(Mixture‑of‑Experts)结构——总参数看起来有 26 B,但每次推理只会 Activate 大约 3.8 B,等于是只打开一扇门,让模型在显存压力和算力需求之间找到了黄金平衡。对一块 24 GB 显卡来说,跑 26 B 的 MoE 已经可以和跑 4 B dense 的体验差不多,却拥有更强的推理能力。🚀 本地跑通的三条路径从源码到部署,我总结了三条最常见的道路,供你挑选: Ollama + 本地 Gemma 4:最省事的方式,只需要一行 curl 安装 Ollama,随后 ollama pull gemma4:26b 就能把模型拉到本地。显卡 < 16 GB 用 2 B/4 B,显卡 ~24 GB 用 26 B,显存更高的可以直接玩 31 B。 Ollama + Open‑Chat(或 Hermes Agent):在 Ollama 基础上接入一个本地助手框架,提供工具调用、浏览器自动化等能力。关键是要使用 Ollama 原生的 http://127.0.0.1:11434 接口,别走 /v1 的 OpenAI 兼容层,否则工具调用会失效。 云端 OpenAI 兼容 API(比如薛定猫):如果手头没有合适的 GPU,先在云端走一遍验证。因为大多数本地框架都实现了 OpenAI 兼容的 REST 接口,代码可以保持不变,后面再切回本地模型。 这三条路最大的好处是「代码不变,换模型」。写好一次调用代码,换成本地 Ollama 或者云端服务,只需要改一下 URL 和模型名。🛠️ Hermes Agent:会记忆、会成长的个人 AI 小伙伴说到本地智能体,我必须把目光投向 Hermes Agent。它不像传统的「一次性」Agent,更多像是你的私人助理,甚至可以把自己的经验写进自己的简历: 持久化记忆:所有对话会被存入本地向量数据库,系统会把历史记忆做一次摘要,帮助后续对话快速回溯。 Skill 自动生成:完成一次任务后,框架会把任务拆解过程抽象成结构化的 Skill,下次遇到类似需求直接调用,省掉重复思考的时间。 闭环训练雏形:在执行工具调用时产生的轨迹可以导出,用来微调底层模型,真正做到“用模型帮助自己改模型”。 这些功能听起来有点像科幻电影,但在实际使用中已经可以感受到:比如让 Agent 写一段爬虫代码,它会先生成代码、执行、捕捉报错、再自动改进,直到成功为止。整个过程不需要你一次次手动调试,Agent 能自己把“错误”当作学习材料。🧩 把两者拼起来:本地多模态 AI 工作流实战下面给出一个我自己玩过的例子,帮助你把 Gemma 4(E2B)和 Hermes Agent 组合成一个完整的本地 AI 栈: 在本地装好 Ollama,拉取 gemma4:e2b(约 2 B 参数,几乎可以在 8 GB 显存的笔记本上跑) 使用 vLLM 将模型包装成 OpenAI 兼容的 HTTP 服务,端口 8000。 运行 Hermes Agent 的安装脚本,让它在「Custom Endpoint」里填入 http://localhost:8000/v1,模型选 google/gemma-4-e2b-it。 给 Hermes Agent 加入「图片识别」Skill:在聊天里发送一张商品照片,Agent 会把图片喂给 Gemma 4(多模态输入),返回产品描述并自动生成一个 Markdown 报告。 后续每次再问相似商品时,记忆库已经把之前的描述向量化,能够快速检索并给出一致的答案。 整个闭环只需要几分钟的配置,却让本来需要云端调用的功能,全部跑在自己的电脑里。更重要的是,所有交互都是本地完成的,隐私不再是担心的点。💡 实际选型小贴士 显存不够?先尝试 2 B/4 B 版的 Gemma 4,或者把模型量化成 Q4_K_M 格式,显存需求能降低 30% 以上。 想要长上下文?选择 Edge 版(E2B/E4B),它们默认支持 128K token,足够一次性给模型阅读一本短小说。 工具调用不稳定?务必使用 Ollama 原生 API(不要走 /v1),因为原生层保留了完整的 function calling 协议。 企业级需求(比如合规、审计)可以先在云端用薛定猫这样聚合平台做 PoC,确定业务流程后再迁移到本地。 📚 小结:从“技术干货”到“日常助理”把大模型装进自己的电脑,听起来像是把巨兽搬进小屋。Gemma 4 用轻量化、MoE 和 Apache 2.0 授权,让这件事在硬件可及范围内变得现实。Hermes Agent 则把“会说话的模型”升级为“会记住、会学习、会复用经验”的数字助理。两者结合后,你可以在本地搭建一个完整的 AI 工作流:从多模态感知、长上下文推理,到工具调用、记忆沉淀,全部闭环在自己的掌控之中。如果你和我一样,对技术有一点小狂热,又怕被 SaaS 限制住手脚,那么现在正是把这套本地 AI 栈搬回家的好时机。把 Ollama 当作厨房的燃气灶,把 Gemma 4 当作主食原料,把 Hermes Agent 当作会帮你切菜、调味的智能厨师,你的创意料理就可以随时上桌。🌟祝你玩得开心,记得把成功的经验写进自己的 Skill 库,下一次再让 Agent 自动复用!
2026年04月15日
221 阅读
0 评论
0 点赞
2026-04-07
在树莓派5上跑起Gemma 4:我的实验记录
开篇聊聊动机嘿,朋友,我最近在折腾点儿新玩意儿 — — 把 Gemma 4 这个小模型塞进我的树莓派 5。说干就干,过程像是点燃一根小火柴,又带点儿不确定性。在我这儿,树莓派 5 已经是我的小型服务器,装了 Ubuntu Server,只有几条命令行工具,没装图形界面,SSH 成了我的唯一通道。于是我决定挑战一下:能不能在这样简陋的机器上跑起 Gemma 4 的最小版本 E2B?准备工作:给树莓派装点儿软件第一步,我得把 LM Studio 的 CLI 版装上。官方给了个自动脚本,点几下就搞定。装好后它会建议立刻启动 daemon,我就照着做。 打开终端,运行官方脚本完成安装。 启动 daemon,检查可用命令。 把模型存放目录换到外接 SSD,这样即使卡掉也不会把宝贵的模型塞进 SD 卡里。 下载最小的 Gemma 4 模型接下来是下载 4.5GB 大小的 E2B 模型。下载期间,我给大家科普一下 Huul 官方说的三个亮点: 整个 Gemma 4 家族都是为 Agent 工作流设计的,原生支持 Function Calling。 模型能识别图像、视频,甚至小型模型还支持原生语音处理,能直接听懂人声。 上下文窗口长到 128k Token,几乎支持所有语言。 好消息是,Gemma 4 采用 Apache 2.0 开源许可,你可以自由玩、自由商用。模型加载和启动 API下载完成后,模型大约有 40 亿参数,已经装在了 SSD 上。随后我加载模型,看到它顺利跑进 RAM,随后启动 API 服务器监听 4000 端口。为确保能从本地网络访问,我把服务器重新启动并把 host 参数换成 0.0.0.0,理论上应该可以从任何机器发请求。可惜官方没给 host 参数,只能通过端口转发来实现。于是我使用 SoChat 这一小工具,把内部 4000 端口映射到外部 4001,形成桥梁,外部机器的请求就能被转发进去。从外部机器访问模型把映射设置好后,我关掉树莓派的 SSH 会话,回到我的 MacBook。用 curl 发送一次 GET 请求到树莓派的 4001 端口,列出可用模型。返回的 JSON 里果然能看到我刚刚下载的 Gemma 4,说明一切工作正常。now 我把服务器再次重启,这次加上 host=0.0.0.0,确保所有网络接口都能接受请求。在编辑器里和模型聊天因为 LM Studio 的服务器兼容 OpenAI API,任何支持自定义 endpoint 的工具都能用。我选用了 Zed 编辑器。在 Zed 的设置里,我添加了一个新的 LLM 配置: 服务器地址指向树莓派的 IP。 端口填 4000。 模型名称写成 Gemma 4。 保存后,我在聊天窗口里选上这个模型,发送一个简短的提示:“写一段关于春天的诗”。模型开始“思考”,随后输出了诗句,过程像是慢慢在脑子里翻书。实测性能: CPU 炸裂 & 回答速度为了看看模型到底占多少资源,我打开 htop 监控。在生成回答的瞬间,四个 CPU 内核全部满载,内存占用也快到了极限。第一次测试是让它写一个排序函数。它先“思考”,再生成代码。整个过程大约 6 分钟,感觉像是等咖啡慢慢滴滤。第二次测试是让它想出三个 Web App 的创意。思考阶段稍快,生成文本约 5 分钟,内容详细,每个创意都配上了简短描述。总的来说,虽然速度不算快,但对非实时任务或者自动化脚本来说已经足够用了。如果不想要“思考”阶段,关闭 reasoning 模式可以把时间缩短不少,但相应的输出质量也会下降一点。感想与展望通过这次实验,我发现即使是最小的 Gemma 4 也能在树莓派 5 上跑起来,而且还能通过本地网络供其他设备调用。这种“把 AI 模型放在边角料硬件上”的玩法,其实打开了很多可能性:比如在家庭服务器、离线摄像头、智能家居网关上跑小模型,省掉对大云服务器的依赖。未来,我打算继续玩跑满参数更大的模型,或者把模型部署到其他低功耗设备上,看看能否在更小的空间里实现更强的能力。如果你对这篇实验感兴趣,别忘了点个赞、关注,我会继续分享更多实战技巧。
2026年04月07日
219 阅读
0 评论
0 点赞