https://linux.do 论坛的话题更新通知频道。
Jason Xu 在 2个48team还是国模订阅? 中发帖
个人一个月的用量差不多两个team的账号刚好够,但是tibo最近抽风,感觉降智明显,缓存命中也不高,所以想看看也没有国模订阅合适的。
不知道大家推荐team,还是国模订阅啊?可以说说具体原因,为什么推荐key1 (@key5230) 在 本人做正在做游戏麻烦,向剧情方面或者是游戏内功能构建那个AI会更好一点 中发帖
本人做正在做游戏麻烦,向剧情方面或者是游戏内功能构建那个AI会更好一点,比如说现在装备道具等等没什么灵感了@poyi 在 Grok Build SuperGrok用量缩水确认 中发帖
用codex调用grok build cli里面的supergrok正价订阅,牺牲了两周的额度全用来做测试了。
模型、xhigh、CLI 版本、350k 输入、64 工具回合、12 路并发和缓存比例都基本相同,平均 token 成本也只差约 0.2%。
同条件测试
上周
本周
Grok Build
1.0.5
1.0.5
起始用量
2%
1%
结束状态
100% + 402
100% + 402
实测新增 token
239,869,568
125,999,903
缓存占比
96.4403%
96.5251%
CLI 等价成本
$45.174066
$23.676065
每百万 token 成本
$0.188328
$0.187905
按完整 100% 外推:
上周:约 244,764,865 token,$46.095986
本周:约...@Wyrm 在 想找一个远程控制的 DSH 插件 中发帖
在远程服务器上安装 dsh, 以及一个远程被控的插件.
本地 dsh 安装控制端插件. 然后通过 url 和 key 连接到被控端.
不知道目前有没有类似的插件, 理念类似 paseo@jyeric 在 Ox-alpha-free 模型 DeepSWE 能力评测,超过dsv4f/dsv4p,落后于luna 中发帖
之前做过的评测: 【更新完毕】GPT 5.6 全三种模型 juice值参考 - 前沿快讯 / 前沿快讯, Lv1 - LINUX DO
最近还会做一个评测,感兴趣的可以关注论坛账号获取通知。
本文内容采用 CC BY-NC-SA 4.0 [协议内容] [法律文件]协议发布,转载请注明本贴链接,不可商业性使用本文内容。
针对于ox-alpha模型(不设置effort,opencode default是max),采用了 **DeepSWE**v1.1 benchmark作为评测基准。
对于113个test,每个测试单次测试,使用mini-SWE-agent(官网测试Harness),Pass@1 ,测试上限由默认1小时延长至10小时(tps过低),通过为73个,失败为40个,通过率为64.6%。
[image]
根据官网数据,目前模型软件工程能力位于deepseek-v4-pr...Ayuan (@wendou) 在 想问问佬友们都在用什么项目进行浏览器的自动化 中发帖
之前一直都在用的是playwright-cli和browser类似的skill,但是cookie始终是个绕不过去的问题,最终还是想实现agent能够在原生浏览器进行操作,但是目前搜集到的能够实现此功能的项目(仅我知道的)ego,只支持mac端,win再一次汤都喝不到,所以想问问佬们是怎么进行的。之前还是用codex的computer control,但是体感不是很好,win系统codex很卡,再加上computer control是通过截图来获取信息,时间线拉的比较长,让人有一种等待焦虑的感觉。
所以回归正题,佬友们有没有win上的浏览器操作的项目推荐 🙂Russ Cox (@bobkit) 在 糖果题补充版-水杯题(关心GPT降智的佬友进) 中发帖
背景
最近GPT降智问题,搞得中转站和普通用户都很头疼,我刚好抽时间研究了一下。在研究的过程中,发现大家普遍采用的糖果题。从结果统计上来讲,糖果题还是有一定区分度的,但不够实锤。我感觉主要还是本身过于简单,其实我人脑仔细思考一下,也能做出来。AI之所以答错成29,主要还是一个思维盲区——没有注意到摸的时候可以区分形状。
所以我一直在想有没有更好的问题来区分是否降智,于是有了前面一个主题 一道自创的AI测试题,有感兴趣的佬友来试试吗
有挺多热心佬友也参与了测试,最终证明这个方法算是一个失败的尝试:问题太难,解决一次需要花费的时间太久;允许大模型写代码调用,即使是弱鸡模型,借助暴力搜索,也能取得不错结果。
昨天突然灵光一现:我能不能把这个问题稍微改一下,把规模降低,但是不允许写代码?然后把目标也收敛一下,不为别的,就是为了区分是 gpt-5.6-sol 还是 gpt-5.6-lua 。
...@worldsHello 在 最近折腾 Harness 的一些感受和思考 中发帖
最近还在继续折腾之前发过的这个学习工具:
本来只是想做个学习 Agent,结果越写越不对劲。
一开始是图谱、聊天、工具调用,后面慢慢又塞进了文件、Shell、Sandbox、Skill、Memory、子应用、联网、Artifact……
做到后面突然发现:
我这好像已经不是在单纯写 Agent 了,而是在一点点搓 Harness。
刚好最近 Harness 这个词也越来越热。
DeepSeek 放出了自己的 DeepSeek Harness,OpenAI 最近也开始频繁提 model-native harness。
而且这段时间我自己折腾下来,有一个感受特别明显:
同样一个模型,放在不同 Harness 里面,用起来真的能像两个模型。
有的 Agent 给它一个 Shell,看起来无所不能,真正跑长任务的时候却很容易开始原地打转。
有的 Agent 一股脑塞几十上...Eeevan 在 Opencode Go 涨价最勤快,降价就装死 中发帖
昨天Deepseek发公告,周末变成梁文谷
Opencode和Commandcode到现在都没有跟进
涨价他俩最勤快,周末峰谷调整又装死
[image]
[image]zhaopaicai611 在 我去这内存条真理财产品吧? 中发帖
翻到了24年的内存条订单
同款点进去直接翻倍了
年度最佳理财产品
[Screenshot_2026-08-23-19-50-31-871_com.jingdong.app.mall]
[Screenshot_2026-08-23-19-50-35-228_com.jingdong.app.mall]@wcof 在 【聊天】佬们,我想换电脑,有推荐的二手渠道吗~ 中发帖
我现在是MacBookPro M1 ,我想换个M4pro 满血的。但是我预算只有12K, 我看海鲜市场24G 都要13K+, 转转也差不多13K。 但是我看二手回收价才10K 13K都可以48G了… 这个怎么搞喃fang (@HermitFang) 在 关于openai的latex写作网站prism一些疑问,以及鹈鹕骑自行车测试 中发帖
一直在用prism,因为最近这个也内置了5.6 sol,并且还有“极高”这个挡位选择今天突然突发奇想查了一下它的juice值,惊奇的发现是128,而网页版本的sol 选择高挡位是42。所以,这个极高对应的是哪个?
另外,还想问一下有无佬知道这玩意跑的是啥的额度,我去他们官方discord问了也没人回。
PS 我试了一下 鹈鹕骑自行车,卧槽,牛逼啊!
[pelican]
[image]
[image]