🔥 AI资讯

AI人工智能行业每日热点,全球AI前沿动态

Qwen3.6是营销名称?揭秘阿里云千问大模型推理资源包真相

Qwen3.6 不是新模型。阿里云从未发布过这个版本:GitHub 上没有代码,Hugging Face 上没有权重,arXiv 上没有论文,千问官网也没有对应的技术文档。 它其实是“千问大语言模型推理资源包(qwenmax)”的市场名称,...

AI资讯

Qwen3.6是真实版本吗?阿里云官方确认Qwen2.5仍是最新公开模型

Qwen3.6?不存在。 阿里云官方文档、Hugging Face模型库、百炼控制台API列表里都找不到这个版本号。最新公开发布的仍是Qwen2.5——2024年7月12日上线的7B和72B双版本。Qwen3尚未进入OpenBenchmar...

AI资讯

智谱GLM-4-Coder代码能力存疑:无公开测试指标、API接入与Tool Calling协议细节

智谱唐杰内部信提出“GLM时刻”转向Coding能力,但没公布任何可验证的代码生成指标、API接入方式或开源计划。 硬核开发者已经没耐心了:DeepSeek R1在SWEbench(v0.2.2标准)上跑出68.2%,HumanEvalX ...

AI资讯

智谱GLM-4-Flash与CodeGLM-3技术指标现状分析:响应延迟、调试准确率及SLA实际表现

智谱创始人唐杰7月11日发布内部信《巨浪已来》。全文未提及GLM新模型架构变更、开源节奏调整、API性能升级,也未提供任何用户可验证的代码生成能力提升证据。技术指标全部维持原状:GLM4Flash仍为v2026.03.15版本;CodeGL...

AI资讯

OpenAI分析SWE-Bench Pro缺陷:AI代码能力评测存在数据污染与系统性水分

OpenAI自曝SWEBench Pro缺陷:AI代码评测的水分到底有多大? OpenAI最近的一份分析报告,把AI代码评测的一层窗户纸给捅破了。他们指出,被广泛使用的基准测试SWEBench Pro存在系统性缺陷。这个消息在开发者圈子里引...

AI资讯

Qwen发布AgentWorldBench基准测试:评估语言世界模型在AI Agent中的真实表现

Qwen推出AgentWorldBench:Agent基准测试新尝试,但离落地还有距离 阿里云通义团队发布了AgentWorldBench基准测试,试图为AI Agent建立更贴近真实世界的评估框架。这个基准聚焦语言世界模型(Languag...

AI资讯

Gemini API托管智能体重大升级:后台任务与远程MCP支持,Agent开发进入一键部署时代

Gemini API托管智能体重大升级:后台任务与远程MCP让Agent开发进入“一键部署”时代 Google DeepMind为Gemini API的托管智能体(Managed Agents)带来了一次重要更新,核心新增了后台任务执行与远...

AI资讯

DeepSeek半年开源百亿参数大模型:训练栈全自控如何实现国产AI自主突破

DeepSeek半年发布开源百亿参数大模型:训练栈全自控如何重塑国产AI自主性 DeepSeek在半年内完成了从自研训练框架、自建智算集群到开源发布DeepSeekLLM和DeepSeekCoder等多个百亿参数大模型的全流程闭环。这种速度...

AI资讯

DeepSeek半年开源多款百亿参数大模型,全自研训练栈实现国产AI自主可控突破

DeepSeek半年连发数款开源大模型,全自研训练栈打破国产AI“卡脖子”困局 深度求索(DeepSeek)团队在短短半年内,基于自研训练框架、自建智算集群与万卡级算力,连续发布并开源了DeepSeekLLM、DeepSeekCoder等多...

AI资讯

Gemini API升级:Managed Agents新增后台任务与远程MCP支持,提升AI Agent生产级可靠性

Gemini API重大升级:Managed Agents新增后台任务与远程MCP支持 Google Gemini API刚刚发布了对Managed Agents的重大升级,新增后台任务执行与远程MCP(Model Context Prot...

AI资讯