QR コードでダウンロード
「Harness」の検索結果:全32件
作者:Cage、Daniel / 01. Key Takeaways 1.DeepSeek Harness(DSH)发布的是一套可以热重载的 harness ,并且设计成适合 coding agent 自己去修改、进化的形态。这个发布思路很有野心,没有在白领工作/coding agent 这些方向去和 Claude Code/Codex/Workb…
8月13日晚,DeepSeek没有发新模型,而是开源了一个叫Harness的东西。 一天之内,GitHub星标近8万。这个速度超过了当年R1和Grok-1的纪录。 Harness不是模型权重,不是API接口,而是一层"壳"——套在模型外面、让模型真正能干活的执行系统。DeepSeek给了一个公式:Model + Harness = Agent。 翻译一下:…
达里奥散播焦虑,奥特曼眩晕瘫坐,大模型各领风骚十几天,一片FOMO情绪中,每个对AI又爱又恨的企业老板都意识到:是时候把天道酬勤的牌匾拿下来,报一个企业Agent速成班了。 企业级Agent是Coding之后下一个大市场,已经是供需两端高度统一的共识。因此,AI办公大战打完了东线的电梯广告,迅速转移到了西线核心战场:让老板们开发票。 然而,当老板们掏出预算…
主持人:感谢邱先生的精彩分享。 接下来,有请罗汉堂秘书长陈龙先生,发表题为「智链驱动的第三次金融科技浪潮」的主旨演讲。 掌声有请陈教授。 陈龙:肖风总,各位领导,各位朋友,大家早上好! 我其实已经预判到「智链」的名字过于共识,所以改了一下。今天我想用十几分钟的时间,和大家讲我看到的正在发生的「未来」,即题目「两种 Token 驱动的第三次金融科技浪潮」。 …
Today.ai 是齐俊元的新作品,定位:下一代 Personal Agent而早在 2014 年,他便买下 today.ai 这个域名,想做一个 AI 个人助理 今天 Today AI 海外版已上线,而国内版也将正式发布 今天我恰好来了西岸梦中心,便在中午去了他们的办公室,和团队聊了一个多小时,想知道他们是如何构建这套 Agent 的 Today 办公室…
我们始终相信,关于 AGI 进展最有价值的信号,一定来自一线推进它的人。市场与估值反映预期,而 researchers 的探索则在决定哪些可能性会成为现实。 尤其让我们感兴趣的是年轻 researchers,对他们来说,许多行业已经习惯的做法,仍然可以重新问一句为什么。我们希望和这样的思维多碰撞,聊聊正在做的研究,也聊聊各自认为值得 bet、还没有被充…
现在的 Agent 的产品越来越多,有些主打 Coding,有些事做日常办公,也有些用于情感陪伴虽然这些产品的用途不同,背后的工作原理其实都大同小异,便是 Harness 对上下文的自动化编排 本文则是以原理的角度,给大家讲一下 Agent 工具是如何使用进行上下文编排,让模型一步步把事情做完,然后输出结果的 我尽可能用简单的语言,让大家能看明白 同时我们…
文|王欣逸 编辑|张雨忻 今年,用AI自我改进AI,几乎成了海内外头部实验室的共识。 近一年来,OpenAI创始成员Andrej Karpathy、前Meta FAIR研究总监田渊栋、前DeepMind首席科学家Jeff Dean都相继加入RSI(Recursive Self-Improvement,递归自进化)创业的热潮。 发生在RSI身上的,几乎是一个…
文章转载于字母AI OpenAI昨天一口气打出了四张大牌。 Agents API、GPT-Live-1 API、Data agent、ChatGPT for Financial Services,一天横跨Agent、语音、数据和金融四条产品线,每一条都值得单独拿出来说道。 但这四张牌里,最值得看的可能还是Agents API。 因为这一次,OpenAI把C…
Techub News 消息,英伟达研究团队近日提出名为「Mid-Harness」的新方法,旨在提升 AI 代理在命令行环境下的可靠性。该方法通过引入一个「判断模型」来评估 AI 代理的中间执行步骤,可以识别并纠正潜在错误,从而提高任务完成率。研究认为,该方法有望降低成本并提升效率。(Crypto Briefing)
Techub News 消息,高盛另类投资部门(Goldman Sachs Alternatives)领投了 AI 软件交付平台 Harness 的 2.4 亿美元 E 轮融资。本轮融资突显了市场对 AI 驱动的软件交付解决方案日益增长的需求,以及企业环境中对高效、安全、合规部署流程的迫切需求。 (Crypto Briefing)
Techub News 消息,加密研究机构 Delphi Digital 在 X 平台发文表示,AI 的锁定效应正从模型本身转向控制框架。用户会在更好的模型出现时切换,但控制框架因承载用户上下文而更难离开。 其报告指出,开源项目 Hermes Agent 可作为替代方案,将所有数据与上下文保留在用户本地设备上运行。(@Delphi_Digital)
Techub News 消息,AI 初创公司 Datalab 发布了开源基准套件 OmniExtractBench,旨在评估结构化文档提取系统的性能。该基准汇集了来自 4 个现有基准的 620 份文档,通过统一评分器以可解释的六种判定类型评估模型填充 JSON 模式的准确性。 Datalab 指出,现有提取基准存在偏见、评分机制不透明、文档类型单一等问题。OmniExtractBench 采用匈牙利算法进行基于内容的行对齐,评分器可通过 PyPI 安装,数据则在 Hugging Face 上以 CC BY 4.0 许可证提供。(MarkTechPost)
Techub News 消息,英伟达 SoL-Pi 系统通过优化模型与环境之间的控制层,可将编码代理的 Token 使用量减少高达 49%,同时性能变化不大。研发智能体通过 3000 多次测试中的 152 种方法来开发该系统,尽管在其他基准测试中提升幅度较小。(The Decoder)
Techub News 消息,Google 正准备发射一颗搭载其 AI 处理器的卫星,以测试其在太空环境中的性能。该卫星将配备 Google 的 Tensor 处理单元,计划于 10 月 1 日搭乘 SpaceX 的猎鹰 9 号火箭发射升空。 此次任务是 Google 实验性项目 Suncatcher 的一部分,旨在评估其 TPU 如何应对太空飞行的物理压力以及太空的辐射和极端温度环境。该项目最终目标是将 AI 数据中心送入轨道。(The Verge AI)
Techub News 消息,MarkTechPost 发布 2026 年最佳开源 AI 智能体框架指南,对 11 款框架进行评估,其中 OpenCode、Pi 和 Goose 因对本地模型推理的良好支持而位列前三。该排名基于开源许可、本地运行时文档、维护状态和安全控制四个维度。 OpenCode 在其文档中详细说明了 Ollama、LM Studio 和 llama.cpp 三种本地运行路径,并内置了拥有完全访问权限的“build”代理和只读的“plan”代理。Pi 框架设计简约,原生支持 llama.cpp 路由服务器,专注于为小型本地模型提供短工具列表以节省上下文。 Goose 则记录了最多的本地运行时选项,包括 Ollama、LM Studio 等,并由 Linux Foundation 旗下的 Agentic AI Foundation 管理,提供桌面应用、CLI 和 API。指南强调,使用本地模型时,框架的设计至关重要,需注意上下文窗口大小、工具调用支持和内存预算。(MarkTechPost)
Techub News 消息,MarkTechPost发布2026年最佳开源AI智能体(Agent)框架榜单,对11个开源框架进行排名。榜单依据OSI批准的开源许可、本地运行环境文档、维护状态及安全控制四项标准进行评估。OpenCode、Pi和Goose位列前三。OpenCode以其广泛的本地环境支持和内置的“build”与“plan”智能体著称;Pi主打极简设计,专注于代码相关工具;Goose则因支持最多本地运行时和由Linux基金会下属的Agentic AI Foundation治理而入选。该指南旨在帮助开发者基于本地大语言模型(LLM)更有效地构建和部署AI智能体。(MarkTechPost)
Techub News 消息,AI 模型 Venice 推出新的学习页面,提供超过 50 个长文与视频教程,内容涵盖如何为任何模型设置带有私有推理功能的 Hermes Agent,以及如何使用自定义视频工具链自动化 AI 电影制作等。 该学习页面旨在帮助用户更全面地了解和利用 Venice 模型内的各种工具与功能。(@ErikVoorhees)
Techub News 消息,AI 搜索公司 Keenable AI 开源实时搜索基准 NEEDLE,该基准每小时从 RSS 订阅源和 Google Trends 等公共来源重建查询集,而非使用固定数据集,以解决模型可能直接读取答案或利用参数记忆的问题。NEEDLE 涵盖新闻、金融、学术、法律和稀有实体查询,通过统一协议对 15 个搜索 API 进行评测,并引入“终极天花板”指标,衡量整个领域可检索的最佳结果。 NEEDLE 作为开源评估工具,可通过 Python CLI 安装运行,需要 OpenRouter 密钥进行评判,支持在笔记本电脑或 CI 环境中使用。评测结果显示,金融类查询接近解决,Exa 得分 0.910,Keenable 为 0.872,Perplexity 为 0.871,Google 为 0.847,而“终极天花板”为 0.965。(MarkTechPost)