https://linux.do 论坛的话题更新通知频道。
@Wyrm想找一个远程控制的 DSH 插件 中发帖

在远程服务器上安装 dsh, 以及一个远程被控的插件. 
本地 dsh 安装控制端插件. 然后通过 url 和 key 连接到被控端. 
不知道目前有没有类似的插件, 理念类似 paseo
Token不是偷啃 (@jwhcj)GPT好慢啊 中发帖

今天首字慢TPS也慢,真是神了,昨天还好好的。用的CPA反代+机场。 
 [image]
@jyericOx-alpha-free 模型 DeepSWE 能力评测,超过dsv4f/dsv4p,落后于luna 中发帖

之前做过的评测: 【更新完毕】GPT 5.6 全三种模型 juice值参考 - 前沿快讯 / 前沿快讯, Lv1 - LINUX DO 
最近还会做一个评测,感兴趣的可以关注论坛账号获取通知。 
本文内容采用 CC BY-NC-SA 4.0 [协议内容]  [法律文件]协议发布,转载请注明本贴链接,不可商业性使用本文内容。 
针对于ox-alpha模型(不设置effort,opencode default是max),采用了 **DeepSWE**v1.1 benchmark作为评测基准。 
对于113个test,每个测试单次测试,使用mini-SWE-agent(官网测试Harness),Pass@1 ,测试上限由默认1小时延长至10小时(tps过低),通过为73个,失败为40个,通过率为64.6%[image] 
根据官网数据,目前模型软件工程能力位于deepseek-v4-pr...
Ayuan (@wendou)想问问佬友们都在用什么项目进行浏览器的自动化 中发帖

之前一直都在用的是playwright-cli和browser类似的skill,但是cookie始终是个绕不过去的问题,最终还是想实现agent能够在原生浏览器进行操作,但是目前搜集到的能够实现此功能的项目(仅我知道的)ego,只支持mac端,win再一次汤都喝不到,所以想问问佬们是怎么进行的。之前还是用codex的computer control,但是体感不是很好,win系统codex很卡,再加上computer control是通过截图来获取信息,时间线拉的比较长,让人有一种等待焦虑的感觉。 
所以回归正题,佬友们有没有win上的浏览器操作的项目推荐 🙂
Russ Cox (@bobkit)糖果题补充版-水杯题(关心GPT降智的佬友进) 中发帖

背景
最近GPT降智问题,搞得中转站和普通用户都很头疼,我刚好抽时间研究了一下。在研究的过程中,发现大家普遍采用的糖果题。从结果统计上来讲,糖果题还是有一定区分度的,但不够实锤。我感觉主要还是本身过于简单,其实我人脑仔细思考一下,也能做出来。AI之所以答错成29,主要还是一个思维盲区——没有注意到摸的时候可以区分形状。 
所以我一直在想有没有更好的问题来区分是否降智,于是有了前面一个主题 一道自创的AI测试题,有感兴趣的佬友来试试吗 
有挺多热心佬友也参与了测试,最终证明这个方法算是一个失败的尝试:问题太难,解决一次需要花费的时间太久;允许大模型写代码调用,即使是弱鸡模型,借助暴力搜索,也能取得不错结果。 
昨天突然灵光一现:我能不能把这个问题稍微改一下,把规模降低,但是不允许写代码?然后把目标也收敛一下,不为别的,就是为了区分是 gpt-5.6-sol 还是 gpt-5.6-lua 。 
...
zhoxi3codex 拼车是不是将成为历史,issue中出现封号案例 中发帖

[image] 
这下好了大家都没得用了
@worldsHello最近折腾 Harness 的一些感受和思考 中发帖

最近还在继续折腾之前发过的这个学习工具: 


本来只是想做个学习 Agent,结果越写越不对劲。 
一开始是图谱、聊天、工具调用,后面慢慢又塞进了文件、Shell、Sandbox、Skill、Memory、子应用、联网、Artifact…… 
做到后面突然发现: 
我这好像已经不是在单纯写 Agent 了,而是在一点点搓 Harness。 
刚好最近 Harness 这个词也越来越热。 
DeepSeek 放出了自己的 DeepSeek Harness,OpenAI 最近也开始频繁提 model-native harness。 
而且这段时间我自己折腾下来,有一个感受特别明显: 

同样一个模型,放在不同 Harness 里面,用起来真的能像两个模型。 

有的 Agent 给它一个 Shell,看起来无所不能,真正跑长任务的时候却很容易开始原地打转。 
有的 Agent 一股脑塞几十上...
EeevanOpencode Go 涨价最勤快,降价就装死 中发帖

昨天Deepseek发公告,周末变成梁文谷 
Opencode和Commandcode到现在都没有跟进 
涨价他俩最勤快,周末峰谷调整又装死 
 [image] 
[image]
zhaopaicai611我去这内存条真理财产品吧? 中发帖

翻到了24年的内存条订单 
同款点进去直接翻倍了 
年度最佳理财产品 
 [Screenshot_2026-08-23-19-50-31-871_com.jingdong.app.mall] 
[Screenshot_2026-08-23-19-50-35-228_com.jingdong.app.mall]
@wcof【聊天】佬们,我想换电脑,有推荐的二手渠道吗~ 中发帖

我现在是MacBookPro M1 ,我想换个M4pro 满血的。但是我预算只有12K, 我看海鲜市场24G 都要13K+, 转转也差不多13K。 但是我看二手回收价才10K 13K都可以48G了… 这个怎么搞喃
fang (@HermitFang)关于openai的latex写作网站prism一些疑问,以及鹈鹕骑自行车测试 中发帖

一直在用prism,因为最近这个也内置了5.6 sol,并且还有“极高”这个挡位选择今天突然突发奇想查了一下它的juice值,惊奇的发现是128,而网页版本的sol 选择高挡位是42。所以,这个极高对应的是哪个? 
另外,还想问一下有无佬知道这玩意跑的是啥的额度,我去他们官方discord问了也没人回。 
PS 我试了一下 鹈鹕骑自行车,卧槽,牛逼啊! 
[pelican] 
 [image] 
 [image]
@waffiekimi 网页真是消耗大啊 中发帖

199套,随便问几个问题就消耗全月的5%,用了个swarm,直接干接近20%。比kimi code 猛多了,而且还是快速模型,不敢用了~
@LunaNoodle所以到底是北京时间 24 号重置还是 25 号重置 中发帖

在凌晨两点说的明天下午,到底是把这个时间当晚上,说的当天下午 也就是北京时间的 24 号凌晨。还是真正的明天下午呢,也就是北京时间 25 号凌晨呢。 
这决定今晚是否放开蹬啊😲 
* 
投票
茴香豆 (@maple2)有没有佬知道如何提取steam清单,无家庭组但想本机共享游戏 中发帖

游戏非常的分散,家庭组已经满了但是不想每次切号玩游戏,想提取出清单来导入到大号这样不切号也能玩游戏了,请问有没有什么提取工具或者提取教程什么的
奶龙 (@luxiaoyu070)gemini的知识库很旧 中发帖

在用最新的gemini3.7的时候,有没有感觉他的知识库明显很旧,反倒是用gemini3.6知识库比他新。 
 [image] 
就问他们自家的模型,他自己都回答不上。 
有没有可能gemini3.7 本来是gemini的pro模型,结果性能不行砍成flash了。
wohaokunr (@hk_w)做了个QQ群监控 中发帖

放个效果图: 

根据群聊内的实时发言描绘群成员的人物画像 
 [图片] 


人物关系图谱 
 [image] 

接入了mimo-v2.5-pro做关系分析,三个消息记录长期99+的群聊,运行一天,消耗约44万tokens。连小米mimo标准版订阅的1%都没用到。 
项目用到了nonebot2框架,WebUI 前端用的是 React + TypeScript。项目最开始的数据表和基础类是手搓,后面就是放飞自我qwen3.8max、sol、luna、glm5.3混着来了。
SuperSkidder有什么低成本水论文的途径吗? 中发帖

因为大创结题要求最好发一篇论文,期刊级别啥的没有要求(我们的项目主要是翻译+AI,然后翻译是针对短剧出海的) 
然后下面讨论的前提是: 

最好能比较稳妥地投稿通过
审稿周期尽量短、版面费尽量低一点

我目前定的方向大概是 AI Agent 和英语翻译,相当于 AI 和语言学这两个领域,但是也不是一定按这个方向发 
和 AI 沟通了挺久,如果发英文期刊的话,应该就是 Digital Translation 和 Journal of Audiovisual Translation 这两个 
但是问题是我不准备花太多精力准备这个论文,这两个期刊发表的难度貌似还是挺大的,想问下这个级别的期刊投稿难度到底怎么样呢?gpt 说我很有希望 😂 
不选中文普刊主要是因为版面费太高,也有一些中文普刊备选项,看名字就感觉很扯,不知道投稿难度怎么样?有什么坑吗? 
 [image] 
我看闲鱼啥的论文辅导似乎...
XUEQIU (@wsxq181)月之暗面(bushi) 中发帖

[photo_2026-08-23_19-25-01] 
月之暗面(Moonshot AI) 🤣 
今天的月亮很漂亮诶,想看看佬们那里的月亮
𝓵𝓮𝔃𝓲𝓼𝓱𝓮𝓷 (@lezishen)有没有中转站老板说说最近成本提升了多少 中发帖

我知道肯定是有提升,但有没有算过具体提升了百分比多少?成本大概提升到了什么程度
aidi (@mujiang)给 AI Agent 的 Skill 也需要“安检”:我做了一个开源的技能治理工具 中发帖

起因现在给 AI Agent(Claude、Codex 等)装一个“技能包”(Skill)越来越容易——网上一大把现成的 SKILL.md,复制粘贴就能用。但很少有人会先问一句:这段指令真的安全吗?一个看似普通的 Skill 里可能暗藏隐患:curl xx | bash:下载外部脚本直接执行忽略沙箱和审批策略:Prompt 诱导绕过安全限制API_KEY=xxx:明文硬编码密钥泄漏sudo chmod -R 777:非必要的权限提升这些内容一旦被 Agent 当作“操作指南”执行,风险就会从文本建议直接转化为系统动作。为此我开发了 OneCode Skill Sanitizer (safe-agent-skills):一个将不可信的 Skill 转化为有审查记录、可验证、防篡改的可信资产治理工具。 它做了什么?1. 确定性风险扫描 
不依赖大模型主观判断,纯规则引擎扫描 Skill 文本...
Back to Top