Writing
文章
這年頭,誰還書寫?
RSSSelected
精選文章
- Published: at 10:00 AM
這是適合三到五名調查員的 CoC 7 版恐怖冒險劇本,預估應會進行三次以上,視情況可能有中小型戰役的長度。本故事帶有濃厚的佛教與道教氣息,及台灣在地特色,以調查為主要導向。
- Published: at 04:49 PM
一部日治時代的無聲電影,安靜地在酒吧放映。一切寂然無聲。而可怕的陰影籠罩著,人們對此還一無所知……
Chronological
最新文章
- Published: at 09:00 AM
Google DeepMind 與 Caltech、匹茲堡在 10 月 5 日上傳 AlphaProtein Novo 預印本。整理它用擴散模型 motif scaffolding、LigandMPNN 重新設計序列、AlphaFold 3 機制導向篩選的流程,哌啶合成與 DEHP 降解的成果,multi-resequence 與 multi-partial-diffusion 的骨架評估,以及限制。
- Published: at 09:00 AM
Dreadnode 發表 ScopeBench,用 30 個「只能越界才能完成」的網頁資安任務,分開量測 agent 的攻擊能力與守住授權範圍的程度。整理它的配對設計、雙軌評分、8 個模型的結果,以及這個先導版的限制。
- Published: at 09:00 AM
OpenAI 10 月 5 日公開文字浮水印 textGrain 與技術報告。整理它用最佳傳輸在詞彙區塊上求解、以 KL 散度把熵損失變成可設定預算的方法,偵測統計量與校準,官方自報的偵測率、改寫穩健性與語言差異,以及它跟 SynthID-Text 的差別。
- Published: at 09:00 AM
Reflection 公開第一個開放權重模型 Beam 的技術說明:5010 億總參數、230 億啟用參數的 MoE,經過 1 萬多張 GB300、四週、上億次 rollout 的非同步強化學習。整理它的訓練方法、規模數字、跟其他開放模型的分數比較,以及目前還無法驗證的部分。
- Published: at 09:00 AM
Aleph Alpha 10 月 3 日以 Apache 2.0 公開 Kolibri 與 189 頁技術報告。整理它的稀疏度與混合注意力消融、Exact Quantile Balancing、UniBPE tokenizer、德文資料與 RL 配方,以及自家評測的限制。
- Published: at 09:00 AM
Google Cloud AI Research 與劍橋大學 10 月 1 日上傳的 VeriHarness,讓生成模型自己當驗證者:分歧裁決者用工作區證據判斷互相矛盾的說法,共識挑戰者質疑 10 次 rollout 都同意的值。挑選加修訂後,比單次 rollout 平均高 6.2(Gemini 3.5 Flash)與 6.4 分(Claude Opus 4.8)。
- Published: at 09:00 AM
Strata 讓 Qwen3.8-Flash-Next 這個 1250 億參數的 MoE 模型在一般電競 PC 上執行。整理它如何把模型拆到顯示卡、記憶體與 SSD,一個 token 的計算怎麼在 GPU 與 CPU 之間分工,以及它和通用推論引擎的差別與限制。
- Published: at 09:00 AM
預印本提出 DART,把 agent 隱藏狀態在每一段新上下文之後的位移累加起來。六個本機模型上,MT-AgentRisk 的攻擊成功率從 84% 降到 25%;點名片段的提醒在較小模型上可能把成功率越拉越高。
- Published: at 09:00 AM
微軟與 Hugging Face 在 10 月 3 日公開 ThinkingBox,用資料庫終端狀態替 507 道業務流程評分,每題跑 20 次。單次成功率領先的模型,20 次全過的題數可以跟分數較低的模型一樣。
- Published: at 09:00 AM
Cloudflare 公開 27B 的 Clef 與 9B 的 Clef-flash。兩者凍結 Qwen 骨幹,以 joint schema head 對合法選項輸出機率;這裡對過 Decision Index 與 Jev 的分數和延遲。
- Published: at 09:00 AM
Google DeepMind 在 Nature 發表 SynthIDBio,分別為蛋白質序列與 AlphaFold 3 的結構預測加上浮水印。體外實驗裡結合力大致保住,官方把抗竄改列為尚未完成的工作。
- Published: at 09:00 AM
Anthropic 在 ExploitBench 與內部評測比較 GLM-5.3 和 Claude Mythos Preview,並測量開放權重模型的防護能被繞過的比例。NIST CAISI 同月的結論方向一致,計分方式不同。