https://linux.do 论坛的话题更新通知频道。
@Wyrm 在 想找一个远程控制的 DSH 插件 中发帖
在远程服务器上安装 dsh, 以及一个远程被控的插件.
本地 dsh 安装控制端插件. 然后通过 url 和 key 连接到被控端.
不知道目前有没有类似的插件, 理念类似 paseo@jyeric 在 Ox-alpha-free 模型 DeepSWE 能力评测,超过dsv4f/dsv4p,落后于luna 中发帖
之前做过的评测: 【更新完毕】GPT 5.6 全三种模型 juice值参考 - 前沿快讯 / 前沿快讯, Lv1 - LINUX DO
最近还会做一个评测,感兴趣的可以关注论坛账号获取通知。
本文内容采用 CC BY-NC-SA 4.0 [协议内容] [法律文件]协议发布,转载请注明本贴链接,不可商业性使用本文内容。
针对于ox-alpha模型(不设置effort,opencode default是max),采用了 **DeepSWE**v1.1 benchmark作为评测基准。
对于113个test,每个测试单次测试,使用mini-SWE-agent(官网测试Harness),Pass@1 ,测试上限由默认1小时延长至10小时(tps过低),通过为73个,失败为40个,通过率为64.6%。
[image]
根据官网数据,目前模型软件工程能力位于deepseek-v4-pr...Ayuan (@wendou) 在 想问问佬友们都在用什么项目进行浏览器的自动化 中发帖
之前一直都在用的是playwright-cli和browser类似的skill,但是cookie始终是个绕不过去的问题,最终还是想实现agent能够在原生浏览器进行操作,但是目前搜集到的能够实现此功能的项目(仅我知道的)ego,只支持mac端,win再一次汤都喝不到,所以想问问佬们是怎么进行的。之前还是用codex的computer control,但是体感不是很好,win系统codex很卡,再加上computer control是通过截图来获取信息,时间线拉的比较长,让人有一种等待焦虑的感觉。
所以回归正题,佬友们有没有win上的浏览器操作的项目推荐 🙂Russ Cox (@bobkit) 在 糖果题补充版-水杯题(关心GPT降智的佬友进) 中发帖
背景
最近GPT降智问题,搞得中转站和普通用户都很头疼,我刚好抽时间研究了一下。在研究的过程中,发现大家普遍采用的糖果题。从结果统计上来讲,糖果题还是有一定区分度的,但不够实锤。我感觉主要还是本身过于简单,其实我人脑仔细思考一下,也能做出来。AI之所以答错成29,主要还是一个思维盲区——没有注意到摸的时候可以区分形状。
所以我一直在想有没有更好的问题来区分是否降智,于是有了前面一个主题 一道自创的AI测试题,有感兴趣的佬友来试试吗
有挺多热心佬友也参与了测试,最终证明这个方法算是一个失败的尝试:问题太难,解决一次需要花费的时间太久;允许大模型写代码调用,即使是弱鸡模型,借助暴力搜索,也能取得不错结果。
昨天突然灵光一现:我能不能把这个问题稍微改一下,把规模降低,但是不允许写代码?然后把目标也收敛一下,不为别的,就是为了区分是 gpt-5.6-sol 还是 gpt-5.6-lua 。
...@worldsHello 在 最近折腾 Harness 的一些感受和思考 中发帖
最近还在继续折腾之前发过的这个学习工具:
本来只是想做个学习 Agent,结果越写越不对劲。
一开始是图谱、聊天、工具调用,后面慢慢又塞进了文件、Shell、Sandbox、Skill、Memory、子应用、联网、Artifact……
做到后面突然发现:
我这好像已经不是在单纯写 Agent 了,而是在一点点搓 Harness。
刚好最近 Harness 这个词也越来越热。
DeepSeek 放出了自己的 DeepSeek Harness,OpenAI 最近也开始频繁提 model-native harness。
而且这段时间我自己折腾下来,有一个感受特别明显:
同样一个模型,放在不同 Harness 里面,用起来真的能像两个模型。
有的 Agent 给它一个 Shell,看起来无所不能,真正跑长任务的时候却很容易开始原地打转。
有的 Agent 一股脑塞几十上...Eeevan 在 Opencode Go 涨价最勤快,降价就装死 中发帖
昨天Deepseek发公告,周末变成梁文谷
Opencode和Commandcode到现在都没有跟进
涨价他俩最勤快,周末峰谷调整又装死
[image]
[image]zhaopaicai611 在 我去这内存条真理财产品吧? 中发帖
翻到了24年的内存条订单
同款点进去直接翻倍了
年度最佳理财产品
[Screenshot_2026-08-23-19-50-31-871_com.jingdong.app.mall]
[Screenshot_2026-08-23-19-50-35-228_com.jingdong.app.mall]@wcof 在 【聊天】佬们,我想换电脑,有推荐的二手渠道吗~ 中发帖
我现在是MacBookPro M1 ,我想换个M4pro 满血的。但是我预算只有12K, 我看海鲜市场24G 都要13K+, 转转也差不多13K。 但是我看二手回收价才10K 13K都可以48G了… 这个怎么搞喃fang (@HermitFang) 在 关于openai的latex写作网站prism一些疑问,以及鹈鹕骑自行车测试 中发帖
一直在用prism,因为最近这个也内置了5.6 sol,并且还有“极高”这个挡位选择今天突然突发奇想查了一下它的juice值,惊奇的发现是128,而网页版本的sol 选择高挡位是42。所以,这个极高对应的是哪个?
另外,还想问一下有无佬知道这玩意跑的是啥的额度,我去他们官方discord问了也没人回。
PS 我试了一下 鹈鹕骑自行车,卧槽,牛逼啊!
[pelican]
[image]
[image]@LunaNoodle 在 所以到底是北京时间 24 号重置还是 25 号重置 中发帖
在凌晨两点说的明天下午,到底是把这个时间当晚上,说的当天下午 也就是北京时间的 24 号凌晨。还是真正的明天下午呢,也就是北京时间 25 号凌晨呢。
这决定今晚是否放开蹬啊😲
*
投票茴香豆 (@maple2) 在 有没有佬知道如何提取steam清单,无家庭组但想本机共享游戏 中发帖
游戏非常的分散,家庭组已经满了但是不想每次切号玩游戏,想提取出清单来导入到大号这样不切号也能玩游戏了,请问有没有什么提取工具或者提取教程什么的奶龙 (@luxiaoyu070) 在 gemini的知识库很旧 中发帖
在用最新的gemini3.7的时候,有没有感觉他的知识库明显很旧,反倒是用gemini3.6知识库比他新。
[image]
就问他们自家的模型,他自己都回答不上。
有没有可能gemini3.7 本来是gemini的pro模型,结果性能不行砍成flash了。SuperSkidder 在 有什么低成本水论文的途径吗? 中发帖
因为大创结题要求最好发一篇论文,期刊级别啥的没有要求(我们的项目主要是翻译+AI,然后翻译是针对短剧出海的)
然后下面讨论的前提是:
最好能比较稳妥地投稿通过
审稿周期尽量短、版面费尽量低一点
我目前定的方向大概是 AI Agent 和英语翻译,相当于 AI 和语言学这两个领域,但是也不是一定按这个方向发
和 AI 沟通了挺久,如果发英文期刊的话,应该就是 Digital Translation 和 Journal of Audiovisual Translation 这两个
但是问题是我不准备花太多精力准备这个论文,这两个期刊发表的难度貌似还是挺大的,想问下这个级别的期刊投稿难度到底怎么样呢?gpt 说我很有希望 😂
不选中文普刊主要是因为版面费太高,也有一些中文普刊备选项,看名字就感觉很扯,不知道投稿难度怎么样?有什么坑吗?
[image]
我看闲鱼啥的论文辅导似乎...XUEQIU (@wsxq181) 在 月之暗面(bushi) 中发帖
[photo_2026-08-23_19-25-01]
月之暗面(Moonshot AI) 🤣
今天的月亮很漂亮诶,想看看佬们那里的月亮aidi (@mujiang) 在 给 AI Agent 的 Skill 也需要“安检”:我做了一个开源的技能治理工具 中发帖
起因现在给 AI Agent(Claude、Codex 等)装一个“技能包”(Skill)越来越容易——网上一大把现成的 SKILL.md,复制粘贴就能用。但很少有人会先问一句:这段指令真的安全吗?一个看似普通的 Skill 里可能暗藏隐患:curl xx | bash:下载外部脚本直接执行忽略沙箱和审批策略:Prompt 诱导绕过安全限制API_KEY=xxx:明文硬编码密钥泄漏sudo chmod -R 777:非必要的权限提升这些内容一旦被 Agent 当作“操作指南”执行,风险就会从文本建议直接转化为系统动作。为此我开发了 OneCode Skill Sanitizer (safe-agent-skills):一个将不可信的 Skill 转化为有审查记录、可验证、防篡改的可信资产治理工具。 它做了什么?1. 确定性风险扫描
不依赖大模型主观判断,纯规则引擎扫描 Skill 文本...