SirDimples@programming.devEnglish · 22 hours agoQwen3.8-2.4T-A95B Open Weights Released!plus-squaremodelscope.cnexternal-linkmessage-square2linkfedilinkarrow-up132arrow-down11
arrow-up131arrow-down1external-linkQwen3.8-2.4T-A95B Open Weights Released!plus-squaremodelscope.cnSirDimples@programming.devEnglish · 22 hours agomessage-square2linkfedilink
SirDimples@programming.devEnglish · 22 hours agoQwen3.8-27B drops two days from nowplus-squaremodelscope.cnexternal-linkmessage-square1linkfedilinkarrow-up143arrow-down12
arrow-up141arrow-down1external-linkQwen3.8-27B drops two days from nowplus-squaremodelscope.cnSirDimples@programming.devEnglish · 22 hours agomessage-square1linkfedilink
ZephyrXero@lemmy.worldEnglish · 2 days agoA custom Qwen 35B that can run on just a 4GB GPUplus-squaremicroflare.bearblog.devexternal-linkmessage-square0linkfedilinkarrow-up115arrow-down13
arrow-up112arrow-down1external-linkA custom Qwen 35B that can run on just a 4GB GPUplus-squaremicroflare.bearblog.devZephyrXero@lemmy.worldEnglish · 2 days agomessage-square0linkfedilink
leanleft@lemmy.mlEnglish · 3 days agomodel : Ling-3.0-tiny (8b)plus-squarehuggingface.coexternal-linkmessage-square1linkfedilinkarrow-up111arrow-down11
arrow-up110arrow-down1external-linkmodel : Ling-3.0-tiny (8b)plus-squarehuggingface.coleanleft@lemmy.mlEnglish · 3 days agomessage-square1linkfedilink
SirDimples@programming.devEnglish · 10 days agoGLM-5.3 Imminent dropplus-squaregithub.comexternal-linkmessage-square5linkfedilinkarrow-up121arrow-down12
arrow-up119arrow-down1external-linkGLM-5.3 Imminent dropplus-squaregithub.comSirDimples@programming.devEnglish · 10 days agomessage-square5linkfedilink
leanleft@lemmy.mlEnglish · 13 days agomodel: deepseek-moe-16bplus-squaregithub.comexternal-linkmessage-square0linkfedilinkarrow-up16arrow-down12
arrow-up14arrow-down1external-linkmodel: deepseek-moe-16bplus-squaregithub.comleanleft@lemmy.mlEnglish · 13 days agomessage-square0linkfedilink
leanleft@lemmy.mlEnglish · 19 days agohow many models have you collected locally?plus-squaremessage-squaremessage-square3linkfedilinkarrow-up14arrow-down11
arrow-up13arrow-down1message-squarehow many models have you collected locally?plus-squareleanleft@lemmy.mlEnglish · 19 days agomessage-square3linkfedilink
Shifu@lemmy.worldEnglish · 29 days agoSpent two weeks on a kernel that benchmarked 29x faster. End to end it's maybe 6-10%, and it's not even wired in yet.plus-squaremessage-squaremessage-square3linkfedilinkarrow-up118arrow-down12
arrow-up116arrow-down1message-squareSpent two weeks on a kernel that benchmarked 29x faster. End to end it's maybe 6-10%, and it's not even wired in yet.plus-squareShifu@lemmy.worldEnglish · 29 days agomessage-square3linkfedilink
catch88@sh.itjust.worksEnglish · edit-21 month agoI gave my local LLM agent a face — an avatar frontend with an "emotion-beat" output contract (open-source)plus-squaresh.itjust.worksimagemessage-square8linkfedilinkarrow-up113arrow-down118
arrow-up1-5arrow-down1imageI gave my local LLM agent a face — an avatar frontend with an "emotion-beat" output contract (open-source)plus-squaresh.itjust.workscatch88@sh.itjust.worksEnglish · edit-21 month agomessage-square8linkfedilink
Shifu@lemmy.worldEnglish · 1 month agoBitNet b1.58-2B-4T at 36 tok/s on Xeon - pure C99, no Python/BLAS, single binary for ternary + GGUFplus-squaremessage-squaremessage-square0linkfedilinkarrow-up15arrow-down11
arrow-up14arrow-down1message-squareBitNet b1.58-2B-4T at 36 tok/s on Xeon - pure C99, no Python/BLAS, single binary for ternary + GGUFplus-squareShifu@lemmy.worldEnglish · 1 month agomessage-square0linkfedilink
leanleft@lemmy.mlEnglish · 1 month agoalibaba-pai/DistillQwen-ThoughtY-4Bplus-squarehuggingface.coexternal-linkmessage-square0linkfedilinkarrow-up110arrow-down10
arrow-up110arrow-down1external-linkalibaba-pai/DistillQwen-ThoughtY-4Bplus-squarehuggingface.coleanleft@lemmy.mlEnglish · 1 month agomessage-square0linkfedilink
leo@sh.itjust.worksEnglish · 2 months agoLocal LLM Inference Optimization: The Complete Guideplus-squarecarteakey.devexternal-linkmessage-square2linkfedilinkarrow-up135arrow-down13
arrow-up132arrow-down1external-linkLocal LLM Inference Optimization: The Complete Guideplus-squarecarteakey.devleo@sh.itjust.worksEnglish · 2 months agomessage-square2linkfedilink
lunarwingorg@lemmy.worldEnglish · 2 months agoLunarWing — self-hostable AI agent framework built in Rust, focused on privacy and real secret managementplus-squarelemmy.worldimagemessage-square4linkfedilinkarrow-up17arrow-down12
arrow-up15arrow-down1imageLunarWing — self-hostable AI agent framework built in Rust, focused on privacy and real secret managementplus-squarelemmy.worldlunarwingorg@lemmy.worldEnglish · 2 months agomessage-square4linkfedilink
robber@lemmy.mlEnglish · 2 months agoGemma4 12b released with "unified" approach to multi-modalityplus-squarehuggingface.coexternal-linkmessage-square1linkfedilinkarrow-up116arrow-down12
arrow-up114arrow-down1external-linkGemma4 12b released with "unified" approach to multi-modalityplus-squarehuggingface.corobber@lemmy.mlEnglish · 2 months agomessage-square1linkfedilink
pepperfree@sh.itjust.worksEnglish · 3 months agoInfinity-Parser2 - Multimodal Document Parserplus-squarehuggingface.coexternal-linkmessage-square0linkfedilinkarrow-up16arrow-down10
arrow-up16arrow-down1external-linkInfinity-Parser2 - Multimodal Document Parserplus-squarehuggingface.copepperfree@sh.itjust.worksEnglish · 3 months agomessage-square0linkfedilink
BB84@mander.xyzEnglish · edit-23 months agoOrthrus-Qwen3: up to 7.8×tokens/forward on Qwen3, identical output distributionplus-squaregithub.comexternal-linkmessage-square2linkfedilinkarrow-up15arrow-down10
arrow-up15arrow-down1external-linkOrthrus-Qwen3: up to 7.8×tokens/forward on Qwen3, identical output distributionplus-squaregithub.comBB84@mander.xyzEnglish · edit-23 months agomessage-square2linkfedilink
robber@lemmy.mlEnglish · edit-24 months agollama.cpp: don't sleep on --split-mode tensorplus-squaregithub.comexternal-linkmessage-square0linkfedilinkarrow-up112arrow-down11
arrow-up111arrow-down1external-linkllama.cpp: don't sleep on --split-mode tensorplus-squaregithub.comrobber@lemmy.mlEnglish · edit-24 months agomessage-square0linkfedilink
Yerbouti@sh.itjust.worksEnglish · 4 months agoNoob here: Why is Google making Gemma open-source?plus-squaremessage-squaremessage-square11linkfedilinkarrow-up16arrow-down12
arrow-up14arrow-down1message-squareNoob here: Why is Google making Gemma open-source?plus-squareYerbouti@sh.itjust.worksEnglish · 4 months agomessage-square11linkfedilink
hok@lemmy.dbzer0.comEnglish · 4 months agoWhich open models are actually good at agentic coding?plus-squaremessage-squaremessage-square7linkfedilinkarrow-up113arrow-down10
arrow-up113arrow-down1message-squareWhich open models are actually good at agentic coding?plus-squarehok@lemmy.dbzer0.comEnglish · 4 months agomessage-square7linkfedilink
Fmstrat@lemmy.worldEnglish · 4 months agoIntel B70: LLama.cpp SYCL vs LLama.cpp OpenVino vs LLM-Scalerplus-squaremessage-squaremessage-square0linkfedilinkarrow-up15arrow-down10
arrow-up15arrow-down1message-squareIntel B70: LLama.cpp SYCL vs LLama.cpp OpenVino vs LLM-Scalerplus-squareFmstrat@lemmy.worldEnglish · 4 months agomessage-square0linkfedilink