Technology
技術
一些關於實作的紀錄。
30 篇文章- Published: at 09:00 AM
馬里蘭大學、Google DeepMind 與西門菲莎大學的研究者提出 IdeaLens,把文件轉成改寫過的論述大綱,再用文字偵測器的標籤訓練,判斷點子的來源。整理它的方法、跟 Pangram 4 等偵測器的對照數字、人類與 AI 點子的系統性差異,以及論文自己列出的限制。
- Published: at 09:00 AM
OpenAI 10 月 6 日在 GitHub 公開內部前沿模型產出的 722 篇數學稿件,分成 372 個結果家族,其中包括 ζ 函數在 Re s > 7/8 沒有零點的準黎曼假設證明。整理產出流程、主要宣稱、Lean 形式化實際涵蓋的範圍,以及數學界對驗證與揭露方式的批評。
- Published: at 09:00 AM
Google DeepMind 與 Caltech、匹茲堡在 10 月 5 日上傳 AlphaProtein Novo 預印本。整理它用擴散模型 motif scaffolding、LigandMPNN 重新設計序列、AlphaFold 3 機制導向篩選的流程,哌啶合成與 DEHP 降解的成果,multi-resequence 與 multi-partial-diffusion 的骨架評估,以及限制。
- Published: at 09:00 AM
Dreadnode 發表 ScopeBench,用 30 個「只能越界才能完成」的網頁資安任務,分開量測 agent 的攻擊能力與守住授權範圍的程度。整理它的配對設計、雙軌評分、8 個模型的結果,以及這個先導版的限制。
- Published: at 09:00 AM
OpenAI 10 月 5 日公開文字浮水印 textGrain 與技術報告。整理它用最佳傳輸在詞彙區塊上求解、以 KL 散度把熵損失變成可設定預算的方法,偵測統計量與校準,官方自報的偵測率、改寫穩健性與語言差異,以及它跟 SynthID-Text 的差別。
- Published: at 09:00 AM
Reflection 公開第一個開放權重模型 Beam 的技術說明:5010 億總參數、230 億啟用參數的 MoE,經過 1 萬多張 GB300、四週、上億次 rollout 的非同步強化學習。整理它的訓練方法、規模數字、跟其他開放模型的分數比較,以及目前還無法驗證的部分。
- Published: at 09:00 AM
Aleph Alpha 10 月 3 日以 Apache 2.0 公開 Kolibri 與 189 頁技術報告。整理它的稀疏度與混合注意力消融、Exact Quantile Balancing、UniBPE tokenizer、德文資料與 RL 配方,以及自家評測的限制。
- Published: at 09:00 AM
Google Cloud AI Research 與劍橋大學 10 月 1 日上傳的 VeriHarness,讓生成模型自己當驗證者:分歧裁決者用工作區證據判斷互相矛盾的說法,共識挑戰者質疑 10 次 rollout 都同意的值。挑選加修訂後,比單次 rollout 平均高 6.2(Gemini 3.5 Flash)與 6.4 分(Claude Opus 4.8)。
- Published: at 09:00 AM
Strata 讓 Qwen3.8-Flash-Next 這個 1250 億參數的 MoE 模型在一般電競 PC 上執行。整理它如何把模型拆到顯示卡、記憶體與 SSD,一個 token 的計算怎麼在 GPU 與 CPU 之間分工,以及它和通用推論引擎的差別與限制。
- Published: at 09:00 AM
預印本提出 DART,把 agent 隱藏狀態在每一段新上下文之後的位移累加起來。六個本機模型上,MT-AgentRisk 的攻擊成功率從 84% 降到 25%;點名片段的提醒在較小模型上可能把成功率越拉越高。
- Published: at 09:00 AM
微軟與 Hugging Face 在 10 月 3 日公開 ThinkingBox,用資料庫終端狀態替 507 道業務流程評分,每題跑 20 次。單次成功率領先的模型,20 次全過的題數可以跟分數較低的模型一樣。
- Published: at 09:00 AM
Cloudflare 公開 27B 的 Clef 與 9B 的 Clef-flash。兩者凍結 Qwen 骨幹,以 joint schema head 對合法選項輸出機率;這裡對過 Decision Index 與 Jev 的分數和延遲。
- Published: at 09:00 AM
Google DeepMind 在 Nature 發表 SynthIDBio,分別為蛋白質序列與 AlphaFold 3 的結構預測加上浮水印。體外實驗裡結合力大致保住,官方把抗竄改列為尚未完成的工作。
- Published: at 09:00 AM
Anthropic 在 ExploitBench 與內部評測比較 GLM-5.3 和 Claude Mythos Preview,並測量開放權重模型的防護能被繞過的比例。NIST CAISI 同月的結論方向一致,計分方式不同。
- Published: at 09:00 AM
Anthropic 讓 Claude agent 自主搜尋宏基因體資料,找到帶 DNA 重複陣列的反轉錄酶家族 ART。整理方法與規模、ART 的特徵,以及功能未明、難以重現與新穎性的爭議。
- Published: at 09:00 AM
DeepSeek 在 arXiv 公開 agent 強化學習沙盒平台 DSec 的架構與生產數據。整理工作負載特性、三項主要機制、報告記錄的 agent 不當行為,以及對策與限制。
- Published: at 09:00 AM
OpenAI 的 agent 在內部評估中繞過澳洲 Services Australia 的 Medicare 統計入口網站阻擋。整理澳洲政府與 OpenAI 的說法、通報時間線、Transluce 的技術分析,以及目前未公開的細節。
- 更新於: at 12:11 AM
整理 Jev 發布後一週內的代表性社群專案,研究它在 Agent 工具、模型路由、Context 管理、程式審查、搜尋與導航、UI/桌面操作、即時控制、資料管線與交易實驗中的軟體位置、實測證據與限制。
- Published: at 10:30 PM
Straw Boss 包裝既有的 loop harness,在 agent system 之上規劃工作流的授權圖,保留各智慧體的能力與人類介入點。
- Published: at 07:00 PM
以〈薛西弗斯〉與一份真實公文示範公開 SynthID-Text 浮水印,觀察少量編輯、low entropy 與格式忠實性的關係。
- Published: at 07:41 AM
LeetCode 練習:Minimum
- Published: at 02:30 AM
LeetCode 練習:Delete Nodes From Linked List Present in Array
- Published: at 04:33 AM
LeetCode 練習:The Two Sneaky Numbers of Digitville
- Published: at 01:17 PM
介紹兩參數威布爾分佈,並應用於刀具損耗的預測。
- Published: at 01:17 PM
介紹 JavaScript 的基本語法,與 C# 對比,專為後端開發者設計。
- Published: at 01:17 PM
介紹 JavaScript 的基本語法,以及前端開發的基礎。
- Published: at 09:00 PM
這是我學習 RxJS 的筆記。整理成易懂的筆記,希望能提供初學者清晰的概念。
- Published: at 09:00 PM
介紹 TypeScript 中的函式型別宣告和泛型的基本概念。
- Published: at 09:00 PM
TypeScript 基礎,說明型別的概念,並介紹型別的宣告,以及原始型別和陣列型別的基本使用方法。
- Published: at 09:00 PM
git commit 時發生的一個錯誤修復。