大家可能听说了7 月 10 日OpenAI 搞了一场发布会发布了GPT-5.6包含三个新模型。查了一下GPT-5.6 系列的三个型号Sol旗舰、Terra均衡、Luna性价比名字来自拉丁语里的太阳、大地和月亮。我更新了Codex后已经可以使用这些模型了。查了官网定价Sol 每百万 token 输入 5 美元、输出 30 美元Terra 减半2.5 美元和 15 美元Luna 最低1 美元和 6 美元。三款模型 24 小时内全量上线覆盖 ChatGPT、Codex 和 API。GPT各模型价格链接 https://developers.openai.com/api/docs/pricing编程是 GPT-5.6 的主战场一下子有三个新的模型应该怎么选我也很关心各个模型的实力。查了官网的评测Sol 在 Artificial Analysis 编程智能体指数上拿了 80 分比 Fable 5 高 2.8 分输出 token 不到一半耗时不到一半成本便宜约三分之一。Terminal-Bench 2.1 和 DeepSWE 也刷新了最好成绩。Terra 略高于 Fable 5Luna 超过 Opus 4.8两者耗时都只有对手三分之一左右。 Agents Last Exam 上Sol 拿下 53.6 分比 Fable 5 高出 13.1 分。开中档推理也比对方高 11.4 分成本只有四分之一。所以看了这些感觉性价比不错。但也不是全面碾压。SWE-Bench Pro 上 Claude Fable 5 是 80%Sol 是 64.6%——精准修改单文件的场景Claude 依然更强。FrontierMath 最难的 Tier 4 题目Sol 的 65.9% 甚至不如自家上代 GPT-5.5 的 72.5%。OpenAI 强在规划和编排Claude 强在执行。网上资料还了解到这次还有个新玩法叫 ultra 模式。默认四个智能体并行最多十六个人多力量大。Terminal-Bench 2.1 上 Sol Ultra 干到 91.9%GPT-5.5 同期 88.0%。官网的发布会视频上研究员的说法是这些智能体能像一支有经验的团队那样拆分工作有机会要去试一下的。我更新codex应用后开始还以为搞错了Codex变成了ChatGPT。后来才了解到Codex 独立 App 下线了能力全部并入 ChatGPT。还有一个让我在意的数字GPT-5.6 的内测期间研究员人均每日输出 token 量超过 GPT-5.5 时期最高水平的两倍。Lovable 联合创始人说新模型让用户构建应用的步骤少了约 25%工具调用少 35% 到 48%。话说到这份上我脑子里冒出一个想法。家里抽屉里躺着两部旧手机。儿子放暑假最近开始上网课上周推开他的房门数学课直播开着他却在玩玩具。想过买监控摄像头。但专门为网课买一套设备总有种杀鸡用牛刀的感觉。我去应用商店搜了一圈监控类 App要么限免后弹窗收费要么塞满开屏广告。更要命的是它们几乎全部要求把视频流上传到厂商服务器。一个家庭监控画面为什么要经过别人家的云正好旧手机闲着正好 GPT-5.6 Codex 合体了。我打算试试让 AI 帮我把旧手机改成一个纯局域网的家用监控设备。功能需求已经想清楚了旧手机端装上 App 当作摄像头同一 WiFi 下另一台手机或电脑通过浏览器就能看实时画面、同步收听声音。录像全部存本地不经过任何云端。监控时手机屏幕可以锁屏同时绕过电池优化限制防止系统杀进程。纯局域网传输意味着什么拿 Wireshark 抓包数据包只在路由器内部兜圈不会有一帧画面离开家门。目前刚把需求梳理完正式开发还没启动。后续会在公众号更新开发过程和踩坑记录包括 GPT-5.6 在真实项目中的实际表现以及各模型的切换策略。如果你也有闲置旧手机或者对家庭监控的隐私方案有想法留言区聊聊。有没有什么你特别想要的功能运动检测、夜间模式、多摄像头联动——需求收集得越多开发方向越清晰。