https://linux.do 论坛的话题更新通知频道。
𝓵𝓮𝔃𝓲𝓼𝓱𝓮𝓷 (@lezishen) 在 特朗普披露6月投资组合“大换血”:减持Meta 买入伯克希尔等股票 中发帖
[Screenshot_2026-08-23-20-23-25-475_com.lanjinger.choiassociatedpress-edit]🐟 (@stevessr) 在 “缺失感”或许可以解释为什么与社会脱节的青少年会转向成瘾行为 中发帖
[!quote]+
近期心理学研究表明,感到情感疏离、不被他人关注的青少年更容易通过成瘾行为来应对困境。一项新开发的心理量表能够帮助科学家测量这种主观的缺失感,这种缺失感似乎将不良的家庭沟通与各种成瘾行为联系起来。这些发现已分别发表在《行为成瘾*杂志》(Journal of Behavioral Addictions*)和《儿童与青少年精神病学及心理健康》(Child and Adolescent Psychiatry and Mental Health)的两篇论文中。
巴伊兰大学教育学院成瘾行为实验室主任亚尼夫·埃弗拉蒂和耶鲁大学的马克·N·波滕扎希望更好地了解为什么一些青少年会求助于网络、药物或重复性行为来应对情绪。诸如孤独或空虚之类的现有心理学概念描述的是孤立感或生活意义的缺失,但研究人员怀疑背后可能存在更深层次的原因。
“目前关于青少年成瘾行为的研究大多集中于特定的风险...@demonfaith 在 是自己搭个线路机,还是接着用机场挂链式,还有佬友有没有好tw落地 中发帖
现在是用个机场套了个NAT 的hinat落地
有没有必要弄个香港线路机,感觉亚太线路机好贵,还是说继续保持这样机场链式落地鸡
此外,说是300mb的带宽,但不知道为什么非常慢,一点没头绪,是小鸡的问题吗?wei Carson 在 tibo你是人类啊?plus一星期20刀的用量? 中发帖
[image]
[image]
从未使用过反代的,比如 CPA、Sub2,今天给我 web 端降质就算了,然后我今天打算用一下Codec,然后看了一下用量不对啊,然后我挂着跑了两个小时,然后就直接给我完全停了。我去看那个用量,只有 20 刀,Tibo,你是人类吗?给我 Web 端降智就算了,Codec 给我降这么狠啊Jason Xu 在 2个48team还是国模订阅? 中发帖
个人一个月的用量差不多两个team的账号刚好够,但是tibo最近抽风,感觉降智明显,缓存命中也不高,所以想看看也没有国模订阅合适的。
不知道大家推荐team,还是国模订阅啊?可以说说具体原因,为什么推荐key1 (@key5230) 在 本人做正在做游戏麻烦,向剧情方面或者是游戏内功能构建那个AI会更好一点 中发帖
本人做正在做游戏麻烦,向剧情方面或者是游戏内功能构建那个AI会更好一点,比如说现在装备道具等等没什么灵感了@poyi 在 Grok Build SuperGrok用量缩水确认 中发帖
用codex调用grok build cli里面的supergrok正价订阅,牺牲了两周的额度全用来做测试了。
模型、xhigh、CLI 版本、350k 输入、64 工具回合、12 路并发和缓存比例都基本相同,平均 token 成本也只差约 0.2%。
同条件测试
上周
本周
Grok Build
1.0.5
1.0.5
起始用量
2%
1%
结束状态
100% + 402
100% + 402
实测新增 token
239,869,568
125,999,903
缓存占比
96.4403%
96.5251%
CLI 等价成本
$45.174066
$23.676065
每百万 token 成本
$0.188328
$0.187905
按完整 100% 外推:
上周:约 244,764,865 token,$46.095986
本周:约...@Wyrm 在 想找一个远程控制的 DSH 插件 中发帖
在远程服务器上安装 dsh, 以及一个远程被控的插件.
本地 dsh 安装控制端插件. 然后通过 url 和 key 连接到被控端.
不知道目前有没有类似的插件, 理念类似 paseo@jyeric 在 Ox-alpha-free 模型 DeepSWE 能力评测,超过dsv4f/dsv4p,落后于luna 中发帖
之前做过的评测: 【更新完毕】GPT 5.6 全三种模型 juice值参考 - 前沿快讯 / 前沿快讯, Lv1 - LINUX DO
最近还会做一个评测,感兴趣的可以关注论坛账号获取通知。
本文内容采用 CC BY-NC-SA 4.0 [协议内容] [法律文件]协议发布,转载请注明本贴链接,不可商业性使用本文内容。
针对于ox-alpha模型(不设置effort,opencode default是max),采用了 **DeepSWE**v1.1 benchmark作为评测基准。
对于113个test,每个测试单次测试,使用mini-SWE-agent(官网测试Harness),Pass@1 ,测试上限由默认1小时延长至10小时(tps过低),通过为73个,失败为40个,通过率为64.6%。
[image]
根据官网数据,目前模型软件工程能力位于deepseek-v4-pr...Ayuan (@wendou) 在 想问问佬友们都在用什么项目进行浏览器的自动化 中发帖
之前一直都在用的是playwright-cli和browser类似的skill,但是cookie始终是个绕不过去的问题,最终还是想实现agent能够在原生浏览器进行操作,但是目前搜集到的能够实现此功能的项目(仅我知道的)ego,只支持mac端,win再一次汤都喝不到,所以想问问佬们是怎么进行的。之前还是用codex的computer control,但是体感不是很好,win系统codex很卡,再加上computer control是通过截图来获取信息,时间线拉的比较长,让人有一种等待焦虑的感觉。
所以回归正题,佬友们有没有win上的浏览器操作的项目推荐 🙂Russ Cox (@bobkit) 在 糖果题补充版-水杯题(关心GPT降智的佬友进) 中发帖
背景
最近GPT降智问题,搞得中转站和普通用户都很头疼,我刚好抽时间研究了一下。在研究的过程中,发现大家普遍采用的糖果题。从结果统计上来讲,糖果题还是有一定区分度的,但不够实锤。我感觉主要还是本身过于简单,其实我人脑仔细思考一下,也能做出来。AI之所以答错成29,主要还是一个思维盲区——没有注意到摸的时候可以区分形状。
所以我一直在想有没有更好的问题来区分是否降智,于是有了前面一个主题 一道自创的AI测试题,有感兴趣的佬友来试试吗
有挺多热心佬友也参与了测试,最终证明这个方法算是一个失败的尝试:问题太难,解决一次需要花费的时间太久;允许大模型写代码调用,即使是弱鸡模型,借助暴力搜索,也能取得不错结果。
昨天突然灵光一现:我能不能把这个问题稍微改一下,把规模降低,但是不允许写代码?然后把目标也收敛一下,不为别的,就是为了区分是 gpt-5.6-sol 还是 gpt-5.6-lua 。
...