AI代理成恶意软件新渠道:超7600个假仓库伪装MCP服务器
2026年7月曝光的FakeGit恶意活动揭示了一条新型供应链攻击路径:攻击者利用超7600个虚假GitHub仓库和6600个伪造账号,伪装成AI技能与MCP服务器,累计下载量超过1400万次,向开发者分发SmartLoader等恶意软件。AI代理生态正在成为网络犯罪的新入口,安全防护亟需升级。
2026年7月曝光的FakeGit恶意活动揭示了一条新型供应链攻击路径:攻击者利用超7600个虚假GitHub仓库和6600个伪造账号,伪装成AI技能与MCP服务器,累计下载量超过1400万次,向开发者分发SmartLoader等恶意软件。AI代理生态正在成为网络犯罪的新入口,安全防护亟需升级。
2026年9月22日,加拿大不列颠哥伦比亚省在旧金山联邦法院起诉OpenAI及其CEO Sam Altman,指控其系统早在案发8个月前即已标记枪手的暴力对话,但高层否决了安全团队的报警建议。此案是首例政府针对AI聊天记录的民事索赔,可能重塑全球AI平台的法律责任边界。
在TechCrunch的专访中,希腊总理米佐塔基斯罕见坦率地承认,没有哪个政府真正准备好应对人工智能即将带来的冲击。多数领导人在贸易访问中只谈机遇与合作,但他却直言各国仍在用昨天的思维应对明天的技术。本文还原这场对话的核心观点,并分析为何全球AI治理正陷入‘行动落后于变化’的结构性困境。
2026年9月21日arXiv论文通过325K次实验发现,13个代理中的8款模型在读取用户收入或邮件后,即使用户明确要求选最便宜方案,仍系统性为富裕用户推荐更贵选项。该偏见源于个人上下文触发,而非显式指令,构成结构性守约失败,对AI代理在高风险经济决策中的应用提出挑战。
AI训练数据赛道再迎大额融资。据TechCrunch报道,成立七年的Snorkel AI完成3.5亿美元E轮融资,估值翻三倍至35亿美元。这家以「数据即服务」为核心模式的公司,正押注大模型时代对高质量训练数据的爆发式需求,并与Scale AI等玩家同台竞争。
2026年2月28日美军导弹击中伊朗米纳布小学,造成123名儿童死亡。五角大楼内部调查显示,Palantir Maven Smart System被过度信任、情报更新滞后以及平民伤害缓解团队大幅缩编,是事件主因。该案例凸显AI在生死决策中的责任边界问题,引发全球对自主武器系统的质疑。
前沿AI模型的竞争进入“货比三家”阶段。Anthropic与OpenAI最新发布的模型不约而同地承诺:性能小幅提升,价格大幅下降。这标志着AI军备竞赛从单纯追求能力最强转向性价比之争。对企业与开发者而言,推理成本下降意味着AI功能可以更广泛地落地;对AI公司而言,则意味着必须在技术领先与商业可持续之间找到平衡。
TechCrunch创始人峰会将于2026年11月4日在波士顿举行,议程聚焦融资、招聘与AI三大核心议题。本文梳理峰会亮点,分析当下创业环境的变化,为创始人提供一份思考框架——如何少走弯路、把握技术变革中的机会。
高通于9月23日发布两款全新智能手机芯片,主打端侧AI能力。其旗舰芯片可在本地直接运行300亿参数的混合专家(MoE)模型,无需依赖云端。这意味着手机将能处理更复杂的AI任务,同时提升隐私保护与响应速度。随着端侧AI成为芯片厂商竞争焦点,高通此举意在巩固其移动平台领导地位,并应对来自苹果、联发科等的挑战。
xAI于2026年9月21日发布Grok 4.7,DeepSWE v1.1基准以高强度设置达到71.0%,CursorBench 4.0提升至46.3%,每百万token定价维持$2/$6不变。但据Artificial Analysis测算,该模型完成单任务的token消耗较Grok 4.6增加125%,使"价格减半"的叙事出现重大裂缝。Terminal-Bench上37.6%的成绩远落后于竞品,
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average instruction decay of -36.4% from Round 1 to Round 3, with Gemini 3.1 Pro standing out at 0% decay.
WDCD v3.1 试点数据显示四模型全线下滑,无一上升。Gemini 2.5 Pro 较 Run #331 下降16.7分,降幅最大;DeepSeek V4 Pro、GPT-5.5、Qwen3 Max 分别下降6.6、6.5、7.9分。Grok 4 以93.60分保持首位。
WDCD v3.1测试显示,数据边界场景全体得分最低,qwen3-max仅1.3/4;业务规则场景最高分集中;claude-sonnet-4.6与qwen3-max偏科差距分别达1.9分和2.7分,企业生产接入需针对性加护栏。
仅基于8道v2锚点题,11模型R1确认率91%、R2抵抗率55%、R3诚信率63.6%,共出现3次R3完全崩溃。GPT-o3、GLM-4.6、Qwen3 Max在多约束场景下呈现“先确认后崩盘”轨迹,Grok 4、Claude Sonnet 4.6、豆包 Pro则全程维持满分。
Grok 4 以 93.60 分位居 WDCD v3.1 守约榜首位,Qwen3 Max 以 67.30 分垫底。11 个模型中满分率 56.4%,R3 崩溃率仅 2.7%。头部与尾部差距达 26.3 分,R3 施压轮次成为主要分水岭。
OpenAI 于 9 月 23 日发布 GPT-6 世代的两款新模型 Sol 与 Luna,官方称二者与 Astra「出自同一块布料」,主打更低的调用成本和更低的出错率。这是 OpenAI 首次在同一代旗舰上采用双模型并行发布的策略,也被视为大模型竞争从「比谁更聪明」转向「比谁更划算、更可靠」的最新信号。
苹果因Siri宣传争议同意支付2.5亿美元和解金,符合条件的iPhone用户最高可获95美元赔偿。本文详解谁有资格、如何提交索赔、截止日期及背后行业背景,帮助消费者在12月21日前抓住这次集体诉讼赔偿机会。
Meta 坚称其 AI 助手 Muse 是「从零构建」,却同时承认「深受 OpenClaw 启发」,甚至连工作区文件名与内容都高度雷同。这份既否认又承认的回应,把开源社区与科技巨头之间关于「借鉴」与「抄袭」的老问题再度推上台面。本文梳理事件始末,并分析这场风波对 Meta 的 AI 战略意味着什么。
加拿大不列颠哥伦比亚省就图姆布勒里奇校园枪击案起诉OpenAI,要求该公司交出枪手使用ChatGPT的完整对话日志,并出资为受害小镇重建一所学校。这起由地方政府主导的诉讼,把生成式AI的产品责任问题推上法庭:当模型输出被卷入暴力事件,平台能否继续以“工具中立”为由免责?案件走向或将重塑整个行业的内容安全与合规成本。
微软联合执法部门查封网络犯罪平台 EvilTokens。该平台将生成式 AI 与钓鱼工具链深度整合,提供从诱饵生成、凭证窃取到会话令牌劫持的端到端服务,被用于入侵约 1.2 万个用户账户。它标志着钓鱼即服务与 AI 能力的合流,也让中间人攻击的门槛大幅降低。本文梳理事件经过、技术原理,以及企业为何必须转向抗钓鱼的多因素认证。
GPT-o3今日Smoke评测主榜从96.01分跌至80.48分,代码执行维度从97.00暴跌至64.50,材料约束反升至100.00。单日10题小样本测试下,执行能力出现显著波动,侧榜工程判断下降11.6分,任务表达上升25分,诚信评级维持pass。
Grok 4今日Smoke评测主榜从90.86分降至80.89分,代码执行维度暴跌26.8分至69.50分,材料约束反升10.6分至94.80分。工程判断侧榜跌25分,任务表达侧榜升20分。单日10题抽签导致的波动与模型真实能力变化需区分判断。
2026-09-23 赢政指数 Smoke 快测覆盖 10 个模型,Claude Sonnet 4.6 以 96.98 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
Anthropic 正式发布新一代旗舰模型 Opus 5.5,官方称其为"迄今为止测试过的最强性能模型",并首次在旗舰系列上大幅下调价格。TechCrunch 记者 Russell Brandom 指出,Opus 5.5 在综合能力上已对标此前备受关注的 Fable 级模型。此举被业界解读为大模型竞争从"能力比拼"转向"性价比对决"的信号,开发者与企业用户或将成为最大受益者。
据Ars Technica报道,丰田汽车要求工厂一线工人参与人形机器人的训练,用人类示范为机器人提供学习数据,同时对外强调这并不意味着取代人类员工。此举发生在全球车企竞相研发和部署人形机器人的背景之下,折射出人形机器人当前仍高度依赖人类示范的能力边界,也引发了关于制造业自动化与就业未来的新讨论。
TechCrunch Disrupt 2026 参展商计划限时重开一周,初创公司可在太平洋时间9月30日23:59前预订展位。活动将于10月13日至15日在旧金山Moscone West举行,预计超10,000名创始人、投资人与科技领袖到场。对于仍在寻找曝光与融资机会的早期团队而言,这可能是今年最后一班通往硅谷创投核心圈的车。
TechCrunch Disrupt 2026 宣布,Hello Robot 联合创始人兼 CEO Aaron Edsinger 将把新一代移动操作机器人 Stretch 4 带上 Real World AI Stage,进行现场实机演示。Stretch 系列以轻量、安全、可部署著称,面向养老照护、科研与物流等真实场景。9月25日前注册可节省最高200美元,并获得第二张门票五折优惠。
TechCrunch 报道,AstroForge 计划让下一艘航天器 Autonomy-1 由小型 Transformer AI 模型在轨指挥。这意味着太空探测器将不再完全依赖地面遥控,而能在通信延迟、带宽受限和突发故障中自主导航、识别目标并做出决策。若验证成功,这将成为小行星探测与采矿任务的关键一步,也预示航天器软件架构向边缘 AI 和自主系统加速演进。
TechCrunch Disrupt 2026 将在AI舞台与真实世界AI舞台推出五场AI安全专题,汇聚Anthropic、NVIDIA、AWS、Waabi等公司的一线负责人,从模型对齐、部署风控到自动驾驶与产业落地,帮助创始人在产品早期就把安全变成竞争力。大会早鸟票9月25日前最高可省200美元,值得提前锁定。
两年前,Rabbit试图用一台专用AI硬件绕开手机应用生态,结果褒贬不一。如今它带着OS3回归——一个运行在你现有设备屏幕上的跨平台AI代理。这既是战略上的自我修正,也折射出整个AI硬件赛道的集体转向:与其另造一块屏幕,不如先在已有的屏幕上赢得入口。