https://linux.do 论坛的话题更新通知频道。
proposalcourse 在 这是 Free 帐号问题吗...每个帐号就0.08月限啊... 中发帖
痛苦
Plus用了Astra分钟啥都没跑出来周限额就80%了,五小时后借着继续2分钟后周限97%
天啊
买了10个Free号,想说跑跑看,terra两分钟烧掉8个帐号,换luna继续2分钟,全死了
这是帐号问题吗…每个帐号就0.08啊… 我的老天啊 [image]
[image]Barry (@BarryYan) 在 A800 + Qwen3.8-27B + vLLM + Caddy 网关部署记录:单卡 256K 上下文与 OpenAI-compatible 接入 中发帖
A800 + Qwen3.8-27B + vLLM 推理服务部署记录
看到站里有佬发了 5090D + SGLang + WSL 的部署记录,我这边刚好走的是 vLLM 版本,环境是单张 A800 80GB,目标不是公网商业服务,而是给自己几台可信设备用一个 OpenAI-compatible API。
一、环境概况
项
配置
GPU
NVIDIA A800 80GB
模型
Qwen/Qwen3.8-27B
引擎
vLLM 0.29.0
精度
BF16,未量化,未 CPU offload
上下文
原生 262,144 tokens
并发
max_num_seqs=1
本地推理端口
127.0.0.1:8000
管理网关
Caddy 127.0.0.1:6008
客户端入口
SSH tunnel 到本机 127.0.0.1:18000/v1
...@approachai 在 huggingface大家一般咋用呢 感觉没法过滤到需要的模型 中发帖
比如H3模型
如果是企业显卡,当然可以用官方模型。
但是个人显卡,一般需要一些优化后的模型, 上面列出的模型太多,不知道哪个适用啊 也没有关键词来搜索
比如适用amd rocm的模型 。
请有经验的佬友分享下@KeenQuokka90 在 有没有大佬有测模型真假比较牛的skill,求分享 中发帖
各位大佬好,最近想测试一下某个模型到底是不是宣传的那个版本,或者是否存在套壳、降级、冒充等情况。
想请教大家有没有现成的 Skill、测试脚本或评测方案,可以从以下方面进行验证:
模型身份与版本特征
推理、代码、长上下文等实际能力
不同提示词下的稳定性
与官方模型的输出差异
是否能识别模型套壳或降智
如果有成熟的 Skill、Prompt、测试集或使用经验,麻烦分享一下。最好是可以直接部署或运行的方案,感谢各位大佬。PsyMoth 在 有什么舒服的姿势去连接1024proxy?并且求推荐连接1024的链式代理 中发帖
目前是把1024proxy放进resin,然后再给resin套一个上游代理.
目前是用站内佬友推荐的mesl当链式代理,手上有好几个订阅当连接1024都不稳定(是1024的原因吗?),之前是测试mesl连接1024发现很稳就一直用了@xiaolei543 在 分享一个1000G,闲置节点 中发帖
https://5159fa3d-c339-4bab-aad3-a4d8107eba5d.9674021.xyz/Abyss/1edc369227d5725a0f5dac9c7635f03d@lixiuming 在 「招聘 - 深圳」海外 App 研发工程师 20-35K 中发帖
岗位介绍
我们正在开展面向 Google Play 和 App Store 的海外多应用项目,寻找具备多品牌、多包或马甲包(A/B面包)项目实操经验的研发工程师,负责工程配置、构建封包、上架发布、审核问题整改及上线后的持续维护。
岗位职责
完成多应用工程搭建与封包
根据产品方案完成工程配置、应用标识、资源、签名、发布环境及第三方服务配置,支持多款应用独立构建、发布和维护。
负责上架与版本更新
承担所负责平台的构建、测试发布、正式提审及后续更新,完成发布前技术检查,配合产品核对审核资料与实际功能。
处理审核相关技术问题
根据拒审、整改通知或下架反馈,排查涉及的功能、权限、第三方服务和配置问题,完成技术整改、验证及重新提交,配合提供审核说明。
持续维护已上线应用
跟进平台要求、操作系统及第三方服务变化,评估对存量应用的影响,及时完成适配和更新,保障应用持续在...lin ye 在 Jev-based user intent recognition scheme 中发帖
引言
研究了一种应用于开发场景的基于 Jev 的识别用户意图的方案
需求
解决跟 AI 沟通时,我想问问题但 AI 动手干,或者说我想让 AI 动手干但 AI 只是回答的场景
背景
用户意图识别传统方案包括有 OMA 的意图识别流程,通过提示词注入,让 AI 自己先分析。或者通过外源请求,让大语言模型独立分析一下,给结果。
前者的问题是大语言模型自己分析可能不够客观,后者的问题是大语言模型请求慢。Jev 可以解决这两个问题。
实验过程
实验一:多标签布尔判断
方案
我把用户提示词作为上下文,然后设置了“需不需要修改代码” “是否是回答” “是否是计划” “是否是审查” “是否是执行”这几个标签,每个标签接收是或否。
如果是需要修改代码,那么不看后面其他问题的答案;如果是不需要修改代码,那么继续看后面四种标签。
对于后面四个标签,之所以各自提问“是否”,而不是进行多选一,是因为用...