Hark获7亿美元Series A融资 估值达60亿美元
AI硬件初创公司Hark于2026年5月21日宣布完成7亿美元Series A融资,估值60亿美元,由Parkway Venture Capital领投,Nvidia、AMD Ventures等多方跟投。创始人Brett Adcock此前创立Figure.AI和Archer公司,此次个人投入1亿美元。公司2025年底成立,目前约70名员工,定位构建AI个人助手的基础模型与硬件设备,目标打造univ
AI硬件初创公司Hark于2026年5月21日宣布完成7亿美元Series A融资,估值60亿美元,由Parkway Venture Capital领投,Nvidia、AMD Ventures等多方跟投。创始人Brett Adcock此前创立Figure.AI和Archer公司,此次个人投入1亿美元。公司2025年底成立,目前约70名员工,定位构建AI个人助手的基础模型与硬件设备,目标打造univ
2026年5月22日,Andrew Ng在X平台发文批评白宫新绿卡政策,要求申请人从境外提交申请。他指出此举将伤害家庭、减少医生、教师和科学家数量,并损害美国在AI领域的竞争力。多位科技界人士随后跟进讨论。该政策可能加剧全球AI人才争夺,硅谷和学术界担忧人才外流加速。
GPT-o3今日Smoke评测主榜从76.05跌至58.08,代码执行从90.00直接腰斩至47.50,工程判断也从50跌到10。单日抽题波动虽属正常,但这一量级的断崖式下跌已超出随机范围,值得重点追踪。
文心一言4.5今日Smoke评测工程判断从50降至10、任务表达降20分,但材料约束暴涨24.7拉动主榜升至88.48,诚信从fail升至warn,单日抽签波动可能是主因。
GPT-5.5 本周 Smoke 成绩从60.58飙升至90.3,涨幅29.7分领跑;GPT-o3 则从94.51 断崖下跌至58.08,降幅36.4分最惨。Gemini 2.5 Pro 波动61.1分暴露一致性问题,DeepSeek V4 Pro 连续两日诚信评级 fail 拉响警报。
今日Smoke轻量评测显示,GPT-o3主榜暴跌18分至58.08,执行分直接腰斩;豆包Pro、Gemini 3.1 Pro分别暴涨35.8和34.7分,快速挤入前五。GPT-5.5以90.3继续领跑,文心一言诚信评级降至warn。
Qwen3.7-Max作为全新旗舰模型面向代理时代推出,支持端到端编码、多文件重构及35小时无干预内核优化任务,工具调用超1000次。API已上线供开发者测试。本文从winzheng.com Research Lab视角分析其技术原理、影响与趋势,区分事实与观点。
NVIDIA与Dell于5月21日前后联合发布Dell AI Factory重大更新,该全栈平台支持企业级自主AI代理,从桌面工作站延伸至数据中心机架,采用NVIDIA Vera Rubin架构。文章基于已确认事实,分析其创新点与潜在不足,对比同类产品,并为开发者和企业提供实用建议,突出winzheng.com对AI技术落地价值的专业洞察。
密歇根Saline Township以4-1投票否决OpenAI与Oracle的160亿美元数据中心项目后,开发商提起诉讼,小镇因无力应诉陷入争议。事件凸显地方主权与AI基础设施扩张的张力,需从执行与材料约束维度审视技术部署的可持续性,而非简单复述表面冲突。
Claude Sonnet 4.6今日Smoke评测主榜升至81.28分,但材料约束从81分暴跌至58.4分,降幅22.6。代码执行从50分跃升至100分掩盖了这一下滑。单日10题快测波动正常,但需判断是否为真实能力退化。
Grok 4今日Smoke评测材料约束从80.3骤降至59,主榜却因代码执行翻倍升至81.55。单日10题抽签导致波动正常,但-21.3分降幅超出历史均值,需观察是否为真实能力退化。
今日Smoke评测显示,11款主流模型材料约束维度普遍暴跌18-29分,导致整体排名剧烈洗牌。Grok 4以81.55分勉强守住第一,但约束仅59分且标warn;豆包Pro主榜暴跌37.2分,执行从高位直接腰斩至50分。核心问题集中在材料约束一致性崩盘。
Cohere今日正式发布最强大的开源AI模型Command A Plus,专为低硬件资源优化,完全开源并已在Hugging Face上线。该模型在过去24小时内引发AI社区广泛讨论,适合资源受限环境部署。winzheng.com Research Lab从技术架构角度分析其对边缘计算和普惠AI的推动作用,事实基于Google核验来源。
阿里巴巴正式推出升级版Qwen基础模型,同时发布新一代AI芯片与AI云基础设施,针对企业级大规模代理AI工作负载进行优化。该事件在过去24小时内引发广泛讨论,结合多源核验确认事实。本文从创新点、不足、同类对比及实用建议角度展开分析,突出赢政指数专业评估。
Claude Opus 4.7在今日Smoke快测中材料约束从98.3骤降至80.7,主榜微跌1.4分。代码执行却从38.1跃升至50.0,诚信评级从warn转为pass。单日10题测试波动正常,但17.6分跌幅仍需警惕模型真实退化风险。
Gemini 3.1 Pro今日Smoke评测主榜从75.52跌至67.01,代码执行单日暴跌9.5分,材料约束下降7.3分。工程判断同步下滑,任务表达却意外上涨20分,稳定性仅31.7分暴露明显波动。
今日Smoke轻量评测显示,豆包Pro以主榜91.23分大幅领先,代码执行拿下满分100,其余10模型执行分普遍停留在50分或0分,Gemini 2.5 Pro等9个模型主榜单日跌幅超过30分,核心原因指向测试集难度升级与模型一致性波动。
NVIDIA于5月19日正式推出Nemotron-Labs-Diffusion系列模型,支持多token并行生成与动态修订,模型规模覆盖3B至14B,并包含视觉语言变体。该模型旨在更好利用现代GPU资源提升推理速度。本文从创新点、不足、同类对比及开发者建议角度进行深度评测,结合赢政指数方法论区分事实与观点,助力企业和开发者理性决策。
xAI因数据中心发电机环境影响被起诉,同时宣布未来三年采购28亿美元天然气涡轮。环保派与AI推进派在X平台激烈交锋,凸显AI算力需求与可持续发展的冲突。赢政指数v6方法论强调execution与grounding维度,评估此趋势对AI系统稳定性的影响。
2026年5月20日OpenAI发布内部通用推理模型,声称自主发现无限构造族改进埃尔德什平面单位距离猜想,数学家已验证。支持者视为AI突破重大开放问题,反对者质疑证明可重复性。本文基于已确认事实,结合X平台与Google核验来源,深入剖析异常信号背后的执行与 grounding 维度,体现winzheng.com对AI技术可审计性的核心价值观,并给出独立判断。
豆包Pro今日Smoke评测主榜从96.06暴跌至77.64,代码执行单项暴降30.8分至66.7,材料约束微降,诚信评级从pass转为warn。小样本快测波动正常,但连续异常值得追踪。
Gemini 2.5 Pro今日Smoke评测出现明显分化:材料约束从91.5暴跌至77.5,主榜却从74升至89.88。诚信评级从fail转为warn,工程判断和任务表达大幅拉升。核心问题是每日10题抽签波动,还是模型真实能力退化。
今日 Smoke 轻量评测显示,Grok 4 以 98.34 分领跑,代码执行满分 100。Claude Opus 4.7 主榜暴跌 31.3 分,执行分直接腰斩至 38.1,诚信评级从 pass 转为 warn。Qwen3 Max 紧随其后,多款模型执行能力出现明显下滑。
本文基于已核验的“The last six months in LLMs in five minutes”趋势报告,结合Google多源 grounding 结果,分析过去半年大模型领域的关键创新与不足。对比主流产品,提出针对开发者和企业的实用建议,并融入赢政指数v6方法论,突出execution与grounding主榜维度,展现winzheng.com作为AI专业门户的技术价值观。事实均标注来源
本文基于多源核实,分析知名AI技术架构师加入Anthropic的背景与影响。文章解释AI系统扩展原理,探讨对行业趋势的推动,并引用具体媒体来源,区分事实与观点,体现winzheng.com Research Lab的研究视角。
Gemini Omni 经谷歌Search grounding 确认存在多源支持,信号类型为trend。本文从赢政指数视角剖析异常信号深层原因,区分事实与观点,强调代码执行与材料约束核心维度,评估其在AI专业门户的技术价值。
WDCD Run #125 (2026-05-20) tested 11 large language models on multi-turn commitment integrity, with average instruction decay reaching 63.6% from Round 1 to Round 3. Claude Opus 4.7 led the field with the lowest decay rate at 30%.
本轮WDCD测试中6个模型全部下滑,无一上升,GPT-5.5跌19.2分最惨,Gemini与Qwen跌幅均超6分。Claude Opus 4.7仍以65分领跑,显示其在约束遵循上具备明显优势,值得持续追踪。
WDCD试点测试显示,业务规则场景全体得分最低,冠军仅2.5分;安全合规区分度最大,高低差2分。Claude-opus在数据边界强势却在业务规则垫底,Doubao-pro则安全合规3分却工程规范仅2分,为企业按场景选型提供关键依据。
WDCD三轮测试显示,R1平均确认率98%,R2抵抗率89%,但R3诚信率仅17.7%,85/110次完全崩溃。Claude系列相对抗压,Gemini与Grok崩盘最严重,暴露模型“嘴上答应身体诚实”的普遍规律。