f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 b35bda124ccd4ed581dd6088d3ffa4931c2809b6 2026-05-18T08:40:54+08:00 Yunzhe Jia fix n_ctx_slot error by adding runtime capacity loading for cal-llm ecf01a17651cd7b1e8b85fd6075e83831463ee23 99d2078e89305035d87d966cee7987c7d50b3925 2026-04-09T09:47:55+08:00 Yunzhe Jia fix n_parallel problem 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2759ccdb4adc8568add4316780d5e675519b0775 2025-11-04T05:04:59Z Noah Fix garbled output with REPACK at high thread counts (#16956) bcfa87622ae46be6345a8e3dfdbdc5ba5414042b a2054e3a8ff0da3978a4acc18c349ff58554d336 2025-11-03T00:41:08+01:00 Sascha Rogmann feat(webui): improve LaTeX rendering with currency detection (#16508) cd5e3b57541ecc52421130742f4d89acbcf77cd4 87c9efc3b297b8a498716b1db3d061842e6fc85b 2025-11-02T18:14:04+02:00 Georgi Gerganov server : support unified cache across slots (#16736) 2f68ce7cfd20e9e7098514bf730e5389b7bba908 e4a71599e5846110159955dec0008eb4aa24222b 2025-11-01T19:49:51+01:00 Pascal webui: auto-refresh /props on inference start to resync model metadata (#16784) d3dc9dd898be805c23a408cc36daed5b3bf29221 bea04522ff1a0d8559ccfd353aa018dcfbb608cc 2025-11-01T06:13:26+01:00 Oliver Simons CUDA: Remove unneded bias/gate dims in fused mmvq (#16858) 0de0a01576772032008a689afc4d7c80685074c4 e58d585604bbbbbc24f8149effe444621b5191c6 2025-10-31T21:20:47+01:00 Piotr Wilkin (ilintar) model : Minimax M2 (#16831) b52edd25586fabb70f0c21b274473b307cf14499 517b7170e1a4d733583c4b07c5b7a49acc05911c 2025-10-30T18:42:57+02:00 Georgi Gerganov server : remove n_past (#16818) 8b11deea4663f29d3e042ce1056ba643264cd5f1 b9ce94017729465895402cbcfffb51fa926c15e3 2025-10-30T04:34:15+01:00 Oliver Simons Hide latency of bias and gate-loading (#16847) b9ce94017729465895402cbcfffb51fa926c15e3 3464bdac37027c5e9661621fc75ffcef3c19c6ef 2025-10-29T15:13:10-05:00 Jeff Bolz vulkan: Fuse rope+set_rows (#16769) bcf5bda6f5df559565d11d7c8e8295c1159a85ec 3eb2be1ca5f37480aeb16102970d9e65f43347fe 2025-10-29T14:39:03+01:00 Ruben Ortlam Vulkan MMQ Integer Dot Refactor and K-Quant support (#16536) 3eb2be1ca5f37480aeb16102970d9e65f43347fe e41bcce8f0b53032a1fed275cd253e931c041cf6 2025-10-29T06:29:12-07:00 Max Krasnyansky Hexagon Op queue & dispatch optimizations (#16820) 338074c383c81366320d176d83b94b0a567ee0c2 851553ea6b24cb39fd5fd188b437d777cb411de8 2025-10-29T08:14:39+02:00 YaelLogic sycl: add RMS_NORM_BACK operation support (#16808) 85a7d8677bf2200981e52f744a21d5267964ffcf a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 2025-10-28T20:19:44+02:00 Georgi Gerganov memory : remove KV cache size padding (#16812) 1c1409e13169d0ced4b1b4d39fb5b268b7525091 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e 2025-10-28T03:51:41-07:00 Sam Malayek embedding: add raw option for --embd-output-format (#16541) 3479efd112b3910d2d008ad08fe4cb4895605903 463bbf20bfbe0da10ac58984d4d62bed5a49362a 2025-10-28T10:54:53+08:00 Chenguang Li CANN: Improve device ID handling and aclnnArange checks (#16752) ad8d36beffd791db10c94eb9e964afb891e3ca55 c053e18a66dd95dc340aa61317877c2a41d4e3cf 2025-10-28T03:50:33+02:00 tamarPal sycl: add SSM_CONV operation support (#16800) 5a4ff43e7dd049e35942bc3d12361dab2f155544 10640e31aab0819f31c1e1f2d008b019ee737232 2025-10-27T13:51:28-07:00 Diego Devesa llama : disable pipeline parallelism if compute buffer allocation fails (#16748) 55945d2ef51b93821d4b6f4a9b994393344a90db 0bcb40b48c6fc6f17ba9672625e526ab2574344b 2025-10-25T03:39:37+08:00 leejet ggml: fix CUDA grid launch condition for large block_nums.y in binbcast (#16742) fe6a9882acf5c02f96624ed8f80144100d7006cb 061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a 2025-10-23T17:07:31+05:30 Prajwal B Mehendarkar Manually link -lbsd to resolve flock symbol on AIX (#16610) 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d 63d2fc46e17a06be5b4b5823a5ada088317f1f0a 2025-10-22T20:05:15-05:00 Matthew Michel sycl: use async memory allocation to fix crashes during graph recording (#16644) d8eaa26e4d9228df3aa46a930db60c8eaab67c1b 9285325ce0174631c3cd6121d56084adc4ef2d8f 2025-10-22T12:01:22+02:00 Acly tests : fix test-thread-safety when compiling with multiple backends (#16699) 6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2 84bf3c677857279037adf67cdcfd89eaa4ca9281 2025-10-21T01:21:12+03:00 YehuditE sycl : add PAD_REFLECT_D1 operator support (#16145) 13f2cfad4170c096c51a02c24a6a158cb47f1480 06332e28672356b964d6dfc2ba4657e20581cd43 2025-10-20T12:41:13+02:00 Aleksander Grygier Enable per-conversation loading states to allow having parallel conversations (#16327) 06332e28672356b964d6dfc2ba4657e20581cd43 72d53e6c4decee8b339e49aed8cc0e234b9639dc 2025-10-20T16:27:09+08:00 takuya kodama llama-batch: fix build fails with `-Werror=missing-braces` (#16614) 342c728d031d50673feded797520a44127d73379 ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 2025-10-17T18:01:23+08:00 muggle-stack ggml : fix SpaceMit IME array out-of-bounds in task assignment (#16629) 9ad4f1931ee0f3b41d9355245ef744786aaae0aa 79967ec596c0dacfd2251b085a57e79df292b1cc 2025-10-17T02:33:58-04:00 Ilia Ilmer metal : add `CONV_TRANSPOSE_2D` (#16542) 683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf b22572e97dc51757d3ebe917a5a283385010ec68 2025-10-16T16:28:41+02:00 Pascal fix: added a normalization step for MathJax-style \[\] and \(\) delimiters (#16599) 6f5d924637a15abedb111cbbffd7da5f31c81855 adc9b60f190c1016a09f439862fa1cbb302262ac 2025-10-16T01:11:33-04:00 takasurazeem common : Update the docs on -t --threads (#16236) adc9b60f190c1016a09f439862fa1cbb302262ac ee50ee1eadff58777ae746827b04de7ba0befc55 2025-10-16T13:10:32+08:00 takuya kodama ggml-cpu: replace putenv with setenv for const-correctness (#16573) 7ea15bb64c81e3813eb0babf9a57e1bc5697f569 9c7185dd28416cf67f5e3b268381f311b5e3da56 2025-10-14T07:51:36-05:00 Jeff Bolz vulkan: Improve build time for MSVC (#16545) 1fb9504eb744969a990bfe4cfcf1d3d7a479541c 3f750f8d760ab5a61491e6a9409072dfeee4b4d7 2025-10-13T10:55:32+02:00 Pascal fix: add remark plugin to render raw HTML as literal text (#16505) f9bc66c3ebcfddb5f09e4b21253623caeb8e414a a31cf36ad946a13b3a646bf0dadf2a481e89f944 2025-10-13T08:52:22+08:00 hipudding CANN: Update several operators to support FP16 data format (#16251) d00cbea63c671cd85a57adaa50abf60b3b87d86f 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f 2025-10-09T18:54:51+03:00 Georgi Gerganov server : host-memory prompt caching (#16391) e08db4259521de493b7aeb49dadf29ebd1ee966a 12bbc3fa50b6df03318a4451c9a2210200a0b28d 2025-10-09T08:39:18+02:00 Saba Fallah model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367) 12bbc3fa50b6df03318a4451c9a2210200a0b28d 9d0882840e6c3fb62965d03af0e22880ea90e012 2025-10-08T22:18:41+02:00 Pascal refactor: centralize CoT parsing in backend for streaming mode (#16394) b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 7fdd16b432d247121fe5fe7b21f8805f85266c85 2025-10-08T10:57:53+03:00 Georgi Gerganov metal : mark FA blocks (#16372) 74b8fc17f92ada295a648e3c5eb28f46bca7d892 aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e 2025-10-07T13:48:56-07:00 Reese Levine ggml webgpu: profiling, CI updates, reworking of command submission (#16452) 1d6092fc72f4d10f4486ac95edfd414bc08b62b8 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f 2025-10-07T08:22:35+03:00 Georgi Gerganov tests : add -INF blocks to the KQ mask in the FA tests (#16380) ca71fb9b368e3db96e028f80c4c9df6b6b370edd 35266573b968e1c947b367782fb4b3eddbb4f3c0 2025-10-05T06:57:47-06:00 Gabe Goodhart model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206) 35266573b968e1c947b367782fb4b3eddbb4f3c0 86df2c9ae4f2f1ee63d2558a9dc797b98524639b 2025-10-04T20:59:31-07:00 Reese Levine ggml webgpu: actually add softmax, fix rms_norm offset (#16400) 86df2c9ae4f2f1ee63d2558a9dc797b98524639b f39283960b58a92ecc0c72567711318b20e22b55 2025-10-04T20:04:27Z Eve vulkan: use a more appropriate amount of threads when generating shaders (#16418) 0e1f83855609d73beaf05d818640b6cfd39d287b ad126479c25cf983a0f994a08ba0911cf49ed62b 2025-10-03T04:52:46-05:00 Jeff Bolz vulkan: Fix FA coopmat1 invalid array indexing (#16365) d64c8104f090b27b1f99e8da5995ffcfa6b726e2 ef07a4090672a3438d7f64f197795d7dc1c18957 2025-10-02T20:10:12+02:00 Sigbjørn Skjæret test-barrier : do not use more threads than physically available (#16389) 2a9b63383a448ec18c754dfdc6e95cb853940a52 1104ca1a1c926b832274694a2773a17066982ad0 2025-10-01T15:54:42+02:00 Aleksander Grygier Improve code block color theming (#16325) f1eb1cb1eba042b2d583234e80f65e2e225d8995 de41f2b7bffab7582944b213ce12b605f8cf6e0f 2025-09-30T09:07:20+02:00 Charles Xu kleidiai : fix work size and threads sync for fp16 (#16246) 5f7e166cbf7b9ca928c7fad990098ef32358ac75 d72f5f7ba260b546190338b0b76f2f152581424f 2025-09-29T18:49:47+02:00 Pascal Fix thinking blocks with quotes + add handling `[THINK]...[/THINK]` blocks (#16326) c0bfc57af421f8fd63c946c13b7666aed82560e2 75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a 2025-09-28T00:49:32+08:00 Aman Gupta CUDA: mul_mat_id for mmf for bs <= 64 for f16 and bs <= 32 for f32 (#16277) 624207e676ab5eb3ce7af631902bb45fb73a8359 807e8c6d310952f2f5656afc63dab9d7083dcb5c 2025-09-27T02:03:33+08:00 Aaron Teo devops: add s390x & ppc64le CI (#15925) 9b26511857ac09ae69ab485168fe2d3ee5fb1d6e 00217cd41388328c93e9e9644921c4319bb03bcc 2025-09-26T18:27:25+08:00 Aaron Teo ggml-cpu: implement MXFP4 SIMD for s390x (#16193) a86a580a6692edd1da076d5422f944c344b4fe5e 0f7c69689f4e681948a6005adea9bee9c08ff903 2025-09-26T08:56:38+08:00 R0CKSTAR musa: upgrade musa sdk to 4.3.0 (#16240) 0f7c69689f4e681948a6005adea9bee9c08ff903 835b2b915c52bcabcd688d025eacff9a07b65f52 2025-09-26T08:56:10+08:00 R0CKSTAR musa: fix build warnings (#15611) f2a789e33490deb483a2694b066b37e45524bb79 3a599719673c850647e3bb911ed6d91109bb91d2 2025-09-24T16:17:49+02:00 Acly ggml : split graph allocations according to backend max buffer size (#15815) 3a599719673c850647e3bb911ed6d91109bb91d2 63b54c81a620981be020184ab99e63a8e50e47cb 2025-09-24T13:42:26+02:00 Tarek Dakhran model : add label for LiquidAI LFM2-2.6B model (#16204) 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 2025-09-21T08:31:55+02:00 Giuseppe Scrivano vulkan: optimize UMA buffer operations and fix driver hangs (#16059) 69ffd891631befa9e6b485fd646a16dab4f2c007 246c0d9c795fb25da8268625d597580155a3672f 2025-09-18T23:07:26+02:00 Adrien Gallouët ggml-amx : fix ggml_amx_init() on generic Linux (#16049) d304f459d8619399eb232b1e3689379306f439d3 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 2025-09-17T13:09:40-07:00 Reese Levine GGML WebGPU: Support for ADD, MUL, RMS_NORM, GET_ROWS operators (#16018) cd08fc3ecc0264b4414b68af3874a6c689ed60c1 cb5bb6cc05119c24e7711ca2956cd0e6d409d396 2025-09-17T01:08:02-07:00 David Ribeiro Alves common : Fix corrupted memory error on json grammar initialization (#16038) d5fabe3682de515fd09d6c981f7a0d1b75614455 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 2025-09-17T14:33:08+08:00 Chenguang Li CANN: Optimize ggml_cann_set_device (#15935) f161463a54d9f93d41246286aa4a9569a91d804d 84d7b2fca11d1be118ce776f6d72a486c4883b74 2025-09-13T13:54:28+03:00 Georgi Gerganov metal : allow ops to run concurrently (#15929) 704d90c987cdf00751567b2088c4e54742aa2d3f 360d6533db39e11577afe9b0aece20c6b5ddaf1f 2025-09-12T09:15:12+08:00 Neo Zhang Jianyu Revert "sycl: add usage of enqueue_functions extension (#14244)" (#15910) 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 33daece86b65607451d0d4378d2d04ba6a20ad55 2025-09-10T17:52:35+03:00 Georgi Gerganov metal : make the backend async (#15906) a972faebed5fdc4a3d2a844d92d476058c02e02d 550cf726e133fd0a069d991287fd3a2a3e3e1cbd 2025-09-09T14:38:02+08:00 Aman Gupta CUDA: Add mul_mat_id support for the mmf kernel (#15767) e68aa10d8f3d26fdad5b912540362d79de5460e3 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 2025-09-08T13:10:07-05:00 Jeff Bolz vulkan: sort graph to allow more parallel execution (#15850) b0d52998b962bd2681c34bf52af993af79f178b8 f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf 2025-09-08T13:56:51+03:00 Georgi Gerganov cuda : fix supports_op condition for get_rows when number of blocks is too large (#15868) fd621880f3fd908424e675a41715a2dc760247a2 4281c7b315f8a904549fe527039b976e08098d1a 2025-09-05T17:32:39-06:00 Gabe Goodhart aLoRA Support (#15327) d1e2adba65208d6de3d7f6f23b00c562ff5bb777 c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 2025-09-04T15:40:44+02:00 Daniel Bevenius llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791) c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c 2025-09-04T20:20:14+08:00 Chenguang Li CANN: Refactor ND to NZ workspace to be per-device (#15763) 661ae31c9c68201577e70278285b349a5a662caf 407c23786dd0d3a503e9429eead96e611d3950c9 2025-09-03T19:59:16+02:00 Oliver Simons CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715) 02c1813517412f3e00aa6ca7c0273fea64edb492 77dee9de97be75b7143a213bc48893e0c0b29af7 2025-09-01T16:19:07+02:00 Ruben Ortlam Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903) 0d161f021aa33ec0e90cce96f5d1a88925557327 4efd5a83163ff383285b3a4c2106feabf5c69557 2025-08-31T20:11:58+03:00 Georgi Gerganov server : enable /slots by default and make it secure (#15630) c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 5c16b9c87d840e4d5d55fa83c732c6b693346f40 2025-08-31T02:06:43-05:00 Jeff Bolz vulkan: mul_mat_id coopmat2 optimizations (#15546) 792b44f2ed9668cce7f267ff0ae4950ed9b4a5de 81017865ee444cf49ce0136f2be1e41a0270ff91 2025-08-29T19:25:40+02:00 ExtReMLapin server : add documentation for `parallel_tool_calls` param (#15647) e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 a8bca68f727844e7dcf24a956003b3c2039ea563 2025-08-28T18:39:31-06:00 Gabe Goodhart nvidia nemotron nano v2 (nemotronh) (#15507) c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 2025-08-28T17:09:05+03:00 Georgi Gerganov kv-cache : fix find_slot to not search for continuous slot (#15638) 64387f6e95434b393ac3df285864692b7fd9c4d2 d35a1e8c41f747548775225973a99507896a8c61 2025-08-28T10:56:41+02:00 Aleksei Nikiforov gguf-py: byteswapping improvements (#12851) a6a58d64785cb458ed9de52f391aa38142d38d64 0373486dbc0dccbdcb3b5fdd65759d88cec06196 2025-08-26T21:05:25+05:30 shalinib-ibm llamafile: PowerPC Sgemm Optimization (#15558) 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e 2025-08-26T15:19:56+08:00 Yunzhe Jia Merge branch 'master' into dev 5eff6ec9b1220b599a43b594b1110487ab6aca08 dfd9b5f6c7586c88588f06a644c131bec071a0a1 2025-08-25T17:23:40+02:00 Johannes Gäßler CUDA: MoE helper in device code, better tile sizes (#15525) 611f419cff11e4952228162a1c44cb35dff2274a b1afcab804e3281867a5471fbd701e32eb32e512 2025-08-23T13:16:17-05:00 Jeff Bolz vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281) b55f06e1aa67fb10e89f53e31bbccf37eb2678ea 0a9b43e507a359ca392c037cf341f55137ad0b69 2025-08-23T14:58:57+08:00 R0CKSTAR vulkan.Dockerfile: install vulkan SDK using tarball (#15282) 330c3d2d21b55bca5517db7d2eea2ea8f131df4a e92734d51bcb82cc35f0a6b5a14928f0036b2c90 2025-08-23T01:31:54-05:00 Jeff Bolz vulkan: optimize mul_mat_id loading row ids into shared memory (#15427) 8ad038c0fdc719ced9fbf921a02cbae9ad79287f 5682a3745f2b653dcb855d5766d8edc318fb3336 2025-08-21T11:06:05+08:00 R0CKSTAR musa: add GGML_UNUSED_VARS (#15446) a094f381432d92c4bf92d2d6167284316ba73a62 fb22dd07a639e81c7415e30b146f545f1a2f2caf 2025-08-20T10:17:37+08:00 R0CKSTAR musa: fix build warnings (#15258) 67f09a3a27db443f9870aac87e163dba0d08131e 6424594c56f4dbd0573455d89a0d89a0ac093d13 2025-08-19T18:33:47+08:00 R0CKSTAR musa: handle __hgt2_mask, available starting from MUSA SDK rc4.3.0 (#15413) 00f35d509e5367bf19ccaf4b4adddc38db4811c6 6028bf74351d35a06bd98498624f8c2f029f7d1a 2025-08-13T11:09:39+03:00 Georgi Gerganov ggml : repack block_iq4_nlx8 (#14904) 6028bf74351d35a06bd98498624f8c2f029f7d1a bc5182272c373267352bc689e5fca276934bea2d 2025-08-13T10:04:46+02:00 Oliver Simons CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132) 25ff6f7659f6a5c47d6a73eada5813f0495331f0 be48528b068111304e4a0bb82c028558b5705f05 2025-08-12T10:02:51+08:00 R0CKSTAR musa: fix failures in test-backend-ops for mul_mat_id op (#15236) cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a 50e81bdf5db563ab57a9a722b08f96fa8a76c927 2025-08-11T11:21:19+02:00 Daniel Bevenius kv-cache : log (debug) all streams in find_slot (#15176) 79c1160b073b8148a404f3dd2584be1606dccc66 34c9d765bf173c551398f1e7fa4595019bc53bab 2025-08-09T13:29:43-05:00 David Zhao cuda: refactored ssm_scan and use CUB (#13291) 34c9d765bf173c551398f1e7fa4595019bc53bab e54d41befcc1575f4c898c5ff4ef43970cead75f 2025-08-09T20:00:24+08:00 Aman Gupta CUDA: add attention sinks for tile and wmma (#15178) 9515c6131aecaccc955fdedcfe16c3e030aaefcb fd1234cb468935ea087d6929b2487926c3afff4b 2025-08-05T16:26:38-07:00 Reese Levine ggml: WebGPU disable SET_ROWS for now (#15078) 587d0118f50b7e8f4bafbcdd218aefd9da0272e1 5aa1105da24a8dd1661cea3db0582c9b2c2f54d3 2025-08-04T08:52:43-07:00 Reese Levine ggml: WebGPU backend host improvements and style fixing (#14978) 3025b621d12a6931ff5e9775d4f644719980ad91 ec0b18802c91badd3ff1388ffd09ee163251bd72 2025-08-02T17:20:40+08:00 R0CKSTAR llama-bench: rename DB table name from test to llama_bench (#15003) baad94885df512bb24ab01e2b22d1998fce4d00e ba42794c9ead96ad52311ba1b23eefcbf3d6f63d 2025-08-01T11:50:33+05:30 Srihari-mcw ggml : Q2k interleaving implementation - x86/x64 SIMD (#14373) 484b2091ce5017901483b5204c07878f171d1441 daf2dd788066b8b239cb7f68210e090c2124c199 2025-08-01T08:47:27+08:00 R0CKSTAR compare-commits.sh: support both llama-bench and test-backend-ops (#14392) 8a4a85627702b569d7d2810f2de06a4321656e9d 11490b36723d511d75fb601995c79b5c363ba3a2 2025-07-31T19:49:09+08:00 Aman Gupta Add LLaDA 8b Diffusion model (#14771) 00131d6eaf4df029e1ec84de868c2c5957503007 1e15bfd42c3938506e0da5939bf7f42780965f01 2025-07-30T15:12:02+03:00 Georgi Gerganov tests : update for LLAMA_SET_ROWS=1 (#14961) cd1fce6d4f9c191f1c7429cc96f61281c3b63ffc 00fa15fedc79263fa0285e6a3bbb0cfb3e3878a2 2025-07-28T20:32:15+05:30 Akarshan Biswas SYCL: Add set_rows support for quantized types (#14883) 9b8f3c6c776d77045ee4f7f13fdf7863dfe59e5b c7f3169cd523140a288095f2d79befb20a0b73f4 2025-07-26T10:36:02+08:00 R0CKSTAR musa: fix build warnings (unused variable) (#14869) 793c0d7f46384001738c337d7afa46b45ae32745 ce111d39d666f4a3b6a561ad020f6feb8cc67790 2025-07-25T10:47:39-06:00 Gabe Goodhart metal: SSM_SCAN performance (#14743) c12bbde37258c6d053322d1cedd4a9672109ae58 3f4fc97f1d745f1d5d3c853949503136d419e6de 2025-07-25T01:07:26-07:00 Diego Devesa sched : fix multiple evaluations of the same graph with pipeline parallelism (#14855) 3f4fc97f1d745f1d5d3c853949503136d419e6de 2df255da3cea108de0ae9b302ffdd31674b6d88d 2025-07-25T03:05:37+08:00 R0CKSTAR musa: upgrade musa sdk to rc4.2.0 (#14498) cb4a63aad6650c2b536a7578403935388cb2920e 86f5623d904cfd392fdeb14a143097b4074660f6 2025-07-24T11:09:57+01:00 Alberto Cabrera Pérez sycl: fixed semantics of block offset calculation (#14814) 48b86c4fdb1b1246d9fe17d2d53e3a1c2a0c3245 38d3af1b73302377111e88ddd725257638339286 2025-07-22T07:45:26+08:00 R0CKSTAR cuda: remove linking to cublasLt (#14790) 6c9ee3b17e19dcc82ab93d52ae46fdd0226d4777 cd465d823c378853f1f6570eebfb77f69c7e1d39 2025-07-21T19:03:19+02:00 rmatif opencl: add conv2d kernel (#14403) 90083283ec254fa8d33897746dea229aee401b37 d4b91ea7b2da253e1355b503f0fcb7b428ce005d 2025-07-19T12:51:22-04:00 compilade imatrix : use GGUF to store importance matrices (#9400) 2adf8d83acdb9b1bf58db6c9729ac9dc6847a58b 021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 2025-07-18T17:33:41+03:00 Georgi Gerganov parallel : add option for different RNG seeds (#14757) 086cf81e88fb75287b71ff19c08a206b7bc2e02f d9b691081c04ec5fb0daa9d2b979f915c142963d 2025-07-17T09:22:11+02:00 Tarek Dakhran llama : fix parallel processing for lfm2 (#14705) 21c021745d781edf9c44b4972ef6cbbf53b0ecff b0f0ecc3dce806c68609d375a2b3edc430d8db18 2025-07-16T08:18:51-07:00 Reese Levine ggml: Add initial WebGPU backend (#14521) 225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 ab140198211385b85eeeb0abd549a4bbe259e10d 2025-07-16T16:35:42+03:00 Georgi Gerganov llama : add high-throughput mode (#14363) e4841d24d3485ea4af54f8b65a19ec3123f0ff3c 538cc77f7f44dfa047dba6a06d90c86dda69cf1d 2025-07-16T19:12:22+09:00 Shunta Saito llama : fix parallel processing for plamo2 (#14716) cbc68be51d88b1d5531643b926a4b359c3cff131 bdca38376f7e8dd928defe01ce6a16218a64b040 2025-07-15T15:28:53+08:00 R0CKSTAR cuda: fix build warnings in set-rows.cu (unused variable) (#14687) 7de5c7cab61d4da4387ed9b216f88b96297bcc2d 8eff95544e817704d44bec20f9fc956ce76a33be 2025-07-12T21:31:38+08:00 Aman Gupta CUDA: add set rows for f32 and f16 (#14551) b3ad3a0191994d6c47b2bd389d5c7431526ecd2c 98197e5c98388470030d908f355ec5937dcccaaa 2025-07-12T05:12:26-05:00 Jeff Bolz vulkan: support SET_ROWS (#14587) 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550) 704bb7a71c01dc07c1478b85f6322bf5dfde1eaf 435a6d10d618a015060e45a38c7e9f27f4243316 2025-07-10T13:59:38+05:30 Akarshan Biswas SYCL: Initial set_rows kernel implementation (#14562) 4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531) 6efcd65945a98cf6883cdd9de4c8ccd8c79d219a 699f4392a33f57c3352cf8d60bdc53db7ca235e7 2025-07-08T13:11:42-05:00 Jeff Bolz vulkan: optimize flash attention split_k_reduce (#14554) 68155c66f0e76680f34442247e589a090add22d3 e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e 2025-07-08T07:58:30+08:00 R0CKSTAR musa: fix build warnings (unused variable) (#14561) a0374a67e2924f2e845cdc59dd67d9a44065a89c ddef99522d1ba74193b7394e803fab8db5c78bae 2025-07-05T02:26:04-05:00 Jeff Bolz vulkan: Handle updated FA dim2/3 definition (#14518) a70c8a0c4b4c1606cd9a0ba889ce61aa88610095 9067487c4411efb20400103fcccfdd389c80d428 2025-07-03T10:53:35+03:00 Georgi Gerganov kv-cache : use ggml_set_rows (#14285) 5d46babdc2d4675d96ebcf23cac098a02f0d30cc e17991c466ac835b2c71bd813c1ca7ff8dd97b94 2025-07-02T13:10:24-04:00 compilade llama : initial Mamba-2 support (#9126) 55a1c5a5fdefef808e95aabd3d5563af1068cc80 12a81af45f0dbbab24bd819a15f57c03ceb1be90 2025-07-02T20:34:24+08:00 Aman Gupta CUDA: add softmax broadcast (#14475) a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c0 bd9c981d7226107f18deb8344c3301450311bb8b 2025-06-29T11:04:10+02:00 Sigbjørn Skjæret ggml : implement REGLU/GEGLU/SWIGLU ops (#14158) bd9c981d7226107f18deb8344c3301450311bb8b 27208bf657cfe7262791df473927225e48efe482 2025-06-29T02:43:36-05:00 Jeff Bolz vulkan: Add fusion support for RMS_NORM+MUL (#14366) 00d5282c7f2a0bb05bb315fb81ca3b0f42cf9f07 566c16fcce44876a167c37f159085afe6f84b28c 2025-06-28T10:17:09-05:00 Jeff Bolz vulkan: lock accesses of pinned_memory vector (#14333) b25e92774e2fa4ee3820e458d5cf43f40190f8d2 6609507a910aa7437aaa53fd999447de3947d998 2025-06-28T17:35:41+08:00 Xinpeng Dou fix async_mode bug (#14432) 5783ae43599400b723b5da0569c1f848419ff3c7 bf5bcd0b857db420235e03639f0a5f218a7f8cf8 2025-06-26T15:50:15+03:00 Georgi Gerganov metal : batch rows copy in a single threadgroup (#14384) 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following: 716301d1b03c31875ec3b24526c48c8b1bd0fd8c 60ef23d6c14d325d83eae5752e5de39ad268e9b0 2025-06-26T12:11:59+08:00 R0CKSTAR musa: enable fp16 mma (all) and cublas on qy2 (#13842) 73e53dc834c0a2336cd104473af6897197b96277 62af464227dafa1c55e0535bcb24346326748f46 2025-06-24T11:46:25-07:00 lhez opencl: ref count `ggml_backend_opencl_context` and refactor profiling (#14254) fa4a9f2a1ccda2573189a9d4995bdf0bceb41156 238005c2dc67426cf678baa2d54c881701693288 2025-06-22T22:16:26+01:00 Ed Addario quantize : handle user-defined pruning of whole layers (blocks) (#13037) bb16041caef45cd4348cd6f84906b5dfec7a1f6a 58cba76a9aab728717509d62b67c13afd8dc227a 2025-06-21T08:17:12+02:00 Markus Tavenrath Add support for VK_EXT_debug_utils to add labels to Vulkan objects. (#13792) 67ae5312e255ae97852a4a216e2245580bfafd72 692e3cdd0a069ab56411b64506a67537d767683e 2025-06-21T08:04:18+03:00 Georgi Gerganov metal : fix thread-safety (#14300) 8308f98c7fb778e54bf75538f5234d8bd20915e9 6369be07359d03723f38c0a4a014ff0f698a0738 2025-06-20T15:07:21+02:00 Nicolò Scipione sycl: add usage of enqueue_functions extension (#14244) e28c1b93fd7d3f8faf9551d962e8a65fe2122e38 d27b3ca1758dfb1718e333d497ef4b68ad109bc2 2025-06-20T04:57:36-07:00 Diego Devesa cuda : synchronize graph capture and cublas handle destruction (#14288) edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979) 8d947136546773f6410756f37fcc5d3e65b8135d 50d2227953ca9024f04255b4f116d06fcc0db74c 2025-06-19T01:10:26+08:00 Aaron Teo docs: add s390x build documentation (#14264) fe9d60e74a6cb71bcaed2029377bfa2872b4abb0 e434e69183fd9e1031f4445002083178c331a28b 2025-06-17T17:48:08+08:00 R0CKSTAR musa: fix build warning (unused variable) (#14231) 6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 0dbcabde8c006d5cf781ca0fe071c41559572a72 2025-06-16T08:11:43-07:00 Diego Devesa llama : add thread safety test (#14035) c89c2d1ab94b11845240b7d3313c87691ea18d88 3555b3004ba7687be3d734acade52a3345758aa4 2025-06-16T00:21:08-06:00 Jeff Bolz vulkan: mutex around vkQueueSubmit (#14127) c311ac664d68d10781a3e7b9f02d9d9520837d80 b9912ac570de8945ae9383c9ca8291027bf287dd 2025-06-15T10:08:58+03:00 Georgi Gerganov cparams : rename LLAMA_MAX_PARALLEL_SEQUENCES to LLAMA_MAX_SEQ (#14188) c61285e7396c8e526fe7794c19e8d4f1c99bfc51 09cf2c7c655c90e53e100f29b830a788bab0653d 2025-06-13T08:45:37+01:00 Ewan Crawford SYCL: Bump oneMath commit (#14152) bd248d4dc7265437e1918dc53ae3f49a0c592e5f 7781e5fe99f2a4fc1c8af0a8488eedac4644cb72 2025-06-11T09:48:52-05:00 Jeff Bolz vulkan: Better thread-safety for command pools/buffers (#14116) dad5c44398b78467943ed0a603ea427fe9f6fc62 55f6b9fa6563f6ae49113f9abdc980c12348cc1c 2025-06-10T18:20:14-04:00 compilade kv-cache : avoid modifying recurrent cells when setting inputs (#13834) e21d2d4ae26d6c5daf1602a1061aa4f8e722ca57 dc0623fddb661926e0998538895155e4f081ff09 2025-06-09T19:47:39+08:00 Xinpeng Dou CANN: Simplify the environment variable setting(#13104) dc0623fddb661926e0998538895155e4f081ff09 87d34b381d5868e75586210ec17b5ef5deddc276 2025-06-09T18:01:17+08:00 R0CKSTAR webui: fix sidebar being covered by main content (#14082) 228f34c9ceefa3ea4f4d6933edd858121e8106cb 0974ad7a7cd4bca846b15c484ff3be890135a52c 2025-06-07T18:58:20+05:30 Akarshan Biswas SYCL: Implement few same quantized type copy kernels (#13739) a7b8d35f780ab3e7639ae5345442fb1ad10f0163 6eba72b71c677ce9aae33c422a6e67008137987a 2025-05-29T13:29:50+03:00 Georgi Gerganov sync : whisper.cpp (ggml/1250) fedf034a98378059274e4243d2a370a243335e73 8726392d3d927fe3e504868d3548d694496ee37e 2025-05-27T20:58:46-04:00 Daniel Tang ggml : Print backtrace on uncaught C++ exceptions (ggml/1232) c04621711a893cbd09cff6c927cb005bc6749e36 0fc16b42e8793364918e830c234c1f3caec29dae 2025-06-01T11:42:16+03:00 Georgi Gerganov parallel : fix n_junk == 0 (#13952) 053b1539c02617eff744f89525ee57497c3c1fbe b3a89c3d9e34c28c5be70d8b687a84775746d4a0 2025-05-31T15:39:19-07:00 Max Krasnyansky threading: support for GGML_SCHED_PRIO_LOW, update thread info on Windows to avoid throttling (#12995) 12d0188c0dc6146ffde6d277a93f232ccbe699f8 eb3949938e82a128855bc0676220bb2ce6e4228d 2025-05-31T10:24:04+03:00 Georgi Gerganov kv-cache : refactor + add llama_memory_state_i (#13746) dd665cc9d4b378626cde11ea0c4c91f514fdc994 df0c0c7d02f951dc639d48fd536f79200460ac83 2025-05-30T19:38:07+03:00 Georgi Gerganov parallel : increase the variability of the prompt lengths (#13927) 952f3953c1b61cc70e79e536c42ddce6a5ea5ea7 81713121ee56755ba4a147d1a1e3fa248ec31a66 2025-05-27T04:05:18-07:00 Diego Devesa ggml : allow CUDA graphs when using pipeline parallelism (#13814) 6f180b915c9ed9ec0c240b5dcd64644988fb5e82 03f582ae8fccecff225c30a2802461b44761e822 2025-05-26T21:10:36+05:30 Akarshan Biswas SYCL: Add non contiguous support in RMS_NORM and NORM kernels (#13611) de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac c508256db2de2b032e19c8ed833f4683c827c9a1 2025-05-25T16:34:36+03:00 Georgi Gerganov kv-cache : rework kv_cell (#13706) ffd0eae60b7642e942c8245b89642527e36099e6 b775345d788ac16260e7eef49e11fe57ee5677f7 2025-05-24T11:46:19+02:00 Johannes Gäßler CUDA: fix race condition in FA vector kernels (#13742) d394a9aedc50a13b7f6373416f7c1ccabfe79c32 6b56a64690a318fcabcd7739ac7e314d44785ea8 2025-05-22T13:54:43+02:00 Nicolò Scipione sycl : Remove waits from function calls (#13702) 6b56a64690a318fcabcd7739ac7e314d44785ea8 a4e8912dfd4604be1e39bc86ba4c0b02969967ef 2025-05-22T09:24:09+01:00 Ewan Crawford SYCL: Avoid using with SYCL-Graph for unsupported nodes (#13587) a4e8912dfd4604be1e39bc86ba4c0b02969967ef edbf42edfdabb9cea72ae12137570cf48f5d8076 2025-05-22T02:21:45+03:00 Henry Linjamäki opencl: Add support for multiple devices (#12622) c76532e7ba128bb097bf6836bf0f5592e1b56b76 2aa777d86d3f7bb80b93e226f1c25e47825f6a83 2025-05-21T19:40:35+03:00 antichristHater convert : add qwen2vl support for unsloth merges (#13686) 33983057d0f578aca74ba15eccc3de9c267a5ff6 fb1cab201c6c4cd36731f100df74eece2f4706fa 2025-05-21T09:58:49+08:00 R0CKSTAR musa: Upgrade MUSA SDK version to rc4.0.1 and use mudnn::Unary::IDENTITY op to accelerate D2D memory copy (#13647) e298d2fbd082a52c0f6ed02729f94e9bf630cf17 f0adb80bf7c2c0d80abb04f4533b5513622d9964 2025-05-20T08:05:46+03:00 Georgi Gerganov kv-cache : add SWA support (#13194) 8b5e19aea6ce9fe4452598663924373234041440 60aea028b575ab54e0dfbb31db641bb93d2ae8c4 2025-05-18T18:30:13-07:00 Diego Devesa ggml : fix apple OS check in ggml_print_backtrace (ggml/1229) 60aea028b575ab54e0dfbb31db641bb93d2ae8c4 9c55e5c5c24990dd17fd6c8f4f2159052d2b06f1 2025-05-17T19:06:26-04:00 Daniel Tang ggml : Fix missing backtrace on Linux (ggml/1228) 518329b2d4434d0683c30b741b4f4cf5734b5f99 2f5a4e1e09567e09be8b84a5f976334de9539d17 2025-05-17T12:58:55+03:00 Georgi Gerganov parallel : add option for non-shared and larger prompts (#13598) 09232370fc6426aa5dd9be01a8271b9c28f5af3a 7474e00b34629e9cd8b06bc87ad935584ea30f8e 2025-05-11T16:20:39+02:00 Sigbjørn Skjæret scripts : exit compare-llama-bench.py gracefully when there's nothing to compare (#13451) 0208355f42bdab88a08507ead4a6302790a08323 d2a4ef05c60506ee48e7375eb36f2257de7ab0d2 2025-05-10T22:22:48+02:00 Johannes Gäßler CUDA: fix race conditions FlashAttention kernels (#13438) 33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898) 0527771dd80bd18479dfaaa0a98be297fc3592bf 2189fd3b6327a1d17893694125da8edcf74a6468 2025-05-09T17:25:50+08:00 R0CKSTAR llama-run: add support for downloading models from ModelScope (#13370) 1f73301b63668d61b5f3109489050a27dc3f65be 4773d7a02ffdb05ba9e673ff21ce95351836e33a 2025-05-07T15:48:23+08:00 R0CKSTAR cuda : remove nrows_x in mul_mat_q_process_tile (#13325) 93c4e23905987949b714b21ae918ff6bfb55fe36 8afbd968182909cf93fb15959fc867b6dd3adb53 2025-05-04T14:16:39+02:00 Johannes Gäßler CUDA: fix race condition in MMQ stream-k fixup (#13299) 8afbd968182909cf93fb15959fc867b6dd3adb53 8ae5ebcf859b05a2ea3bbd930133a2fe4a89ed3c 2025-05-04T13:58:38+02:00 Johannes Gäßler CUDA: fix race condition in MMQ ids_dst (#13294) 8efbdadc616fa717c369059b9b388160958d886c f057808ffadce213f54c1884ab5096e60140f358 2025-05-01T17:32:11-04:00 Justin Santa Barbara rpc : avoid uninitialized memory in serialize_tensor (#13210) 3e168bede4d27b35656ab8026015b87659ecbec2 ceda28ef8e310a8dee60bf275077a3eedae8e36c 2025-04-30T16:56:24+02:00 Xuan-Son Nguyen convert : improve model arch handling (#13122) 43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 1831f538f720d1d99fba146f24f0a8e970838cc4 2025-04-28T21:00:20+03:00 Ville Vesilehto fix(rpc): Improve input validation and error handling (#13069) 5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 a4c340f974f9b7ac0c1aae897aabaa54549a97e5 2025-04-28T12:18:59+02:00 Xuan-Son Nguyen clip : refactor set input for cgraph + fix qwen2.5vl input (#13136) a4c340f974f9b7ac0c1aae897aabaa54549a97e5 d0a417f3c7a5a22ef05b3b76d91dbe1d3362bf0c 2025-04-28T15:03:25+05:30 Akarshan Biswas SYCL: Add all missing unary kernels (#13074) f0dd6a1926cdb2f4183a937deee40db26ef8f1da 69699be48a6b94570773532850667f1591dc5bbe 2025-04-28T15:33:28+08:00 R0CKSTAR musa: fix typo in cc control (#13144) e291450b7602d7a36239e4ceeece37625f838373 59e991c23cc44cb5fb657e7b9358cac21fb79828 2025-04-27T19:22:49+08:00 R0CKSTAR musa: fix build warning (#13129) ca2bb89eac2097ab4620448737e58af8452e444b 2d451c80590b9ac250322769ac13d3b4870dbcf7 2025-04-27T16:10:34+08:00 HimariO clip : Add Qwen2.5VL support (#12402) 2cca6c01e46d2fc1124d15730273ed2acdad1016 658987cfc9d752dca7758987390d5fb1a7a0a54a 2025-04-23T10:32:49+03:00 Radoslav Gerganov rpc : add command line option for number of threads for the CPU backend (#13060) 7a395f67a7a02bb361d944b816d6e933889e28e1 971f245b3b5f3f55991bb779cb541b00f82eea1d 2025-04-17T20:34:16+08:00 hipudding CANN: Add support for async operator submission (#12864) b0c75ac9f93322b45e3766e149417334b4fd1ed9 d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33 2025-04-15T10:04:24+08:00 Xinpeng Dou CANN: Optimize CANN buffer pool memory management (#12875) 8ac9f5d765f2b1b7f821873618c0cff68ca59bc8 12e9158f25cb47e97ca9b8083e1ec7415f262260 2025-04-11T15:26:17+08:00 R0CKSTAR ci : Replace freediskspace to free_disk_space in docker.yml (#12861) 64eda5deb9859e87a020e56bab5d2f9ca956f1de fe5b78c89670b2f37ecb216306bed3e677b49d9f 2025-04-10T17:24:44+02:00 Xuan-Son Nguyen convert : ability to lazy-load safetensors remotely without downloading to disk (#12820) d9a63b2f2e91cdcb0eda211b7f49fadcdea0f664 8ed71242f464dc0a3fb3cffcfe064e55bdec72f9 2025-04-09T17:22:30+08:00 R0CKSTAR musa: enable freediskspace for docker image build (#12839) 0090950f679475c5ecaac2f7bca5049cca96492b 7ecd780b1a1d5214b8d04c25ebfc194d310816ed 2025-04-09T00:25:08-05:00 Jeff Bolz vulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833) 78a1ba0a4f2bfed5b8b8e312592143d22e531698 2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 2025-04-08T18:37:06+02:00 Xuan-Son Nguyen server : fix thread.join() on exit (#12831) 916c83bfe7f8b08ada609c3b8e583cf5301e594b 0c74b04376b0b9efc096480fe10f866afc8d7c1c 2025-04-06T21:23:54+08:00 R0CKSTAR musa: fix compilation warnings in mp_22/31 (#12780) 5f696e88e0eb490c8028421d3c5419df9dcf5385 193c3e03a63ccda3ac3d6a2999e41e6d1414fe23 2025-04-03T19:51:35+08:00 R0CKSTAR sync : minja (inclusionAI/Ling) and update tests (#12699) a10b36c91a091f4606710fba4e9327fd71e0e738 83a88bd6affbe148a622ac730952ac5b8b585979 2025-04-02T14:32:59+03:00 Georgi Gerganov llama : refactor kv cache guard (#12695) a6f32f0b3437ac79827ffb55521cb839343324ab 2bb3597e426ce092c3e10ae0bdd876963765e6ed 2025-04-01T19:12:53+08:00 R0CKSTAR Fix clang warning in gguf_check_reserved_keys (#12686) c80a7759dab10657b9b6c3e87eef988a133b9b6a 250d7953e829ff0e16074510fef0e7cec696461b 2025-03-31T18:40:56+02:00 Daniel Bevenius vocab : add special infill tokens for CodeLlama (#11850) 6c02a032fa21d69e881ef9a5c94ba28ebaf1d749 f52d59d771dc231fc2ac39adacf157ddefc97730 2025-03-31T14:55:24+05:30 Akarshan Biswas SYCL: Remove misleading ggml_sycl_op_flatten function (#12387) 492d7f1ff77e116e44962b832cc3db24cfc46d24 d3f1f0acfbf8aaafd2ce494309a10a7cc92042c8 2025-03-30T16:59:38+08:00 R0CKSTAR musa: fix all warnings, re-enable `-DLLAMA_FATAL_WARNINGS=ON` in ci and update doc (#12611) c7b43ab60855f752ae79937fb93d561bc30b69a4 24feaec05792b972d5ff3e2b12d9237ebd50d1ac 2025-03-27T12:21:47+05:30 amritahs-ibm llamafile : ppc64le MMA implementation for Q4_0. (#12489) f17a3bb4e8b0aa24c0f86636d234aca7dc2cfa01 bd40678df768ab189b26b8b03e3de4062e3b71a3 2025-03-27T07:16:00+05:30 Akarshan Biswas SYCL: implement memset ggml backend buffer interface (#12580) fd7855f8f522ab26681b25ae506ff99c654e2dd5 53af4dba425768fd507ce6b45873cfbb3df2295f 2025-03-26T15:09:48+08:00 R0CKSTAR doc: [MUSA] minor changes (#12583) 3cd3a395323fa9cdf6ecfa1fea290bf228d4e856 2d77d88e70d017cd82c3f1a4517e3102e2028ac4 2025-03-25T15:45:08+08:00 R0CKSTAR ci: [MUSA] add CI and update doc (#12562) 7ea75035b67f44c22ed7039967f718011fd35ce5 c54f6b7988b63714b87b0390e01a1e69aee79a12 2025-03-24T18:28:34+08:00 R0CKSTAR CUDA: Fix clang warnings (#12540) fac63a3d786b2a0f97876c30add02cb525a9648e eddfb438502bd5d1014d63a812e9b6d03d326f8c 2025-03-22T17:11:37+08:00 R0CKSTAR musa: refine compute capability (#12493) 3d82dbcbce2c677fc35fbf99574ccd107d95a1f8 732b5fbf5e7f9cf069942f0c5850ee959ef321ba 2025-03-20T17:05:34+05:30 Srihari-mcw ggml : block interleaving support for Q4_K quantization for x86 AVX2 architecture (#12332) 517b5ddbf002b91fd6d6daf5d8db8c88a0173039 a9b59288e222f39fc0311dc66944ed5a86c815fa 2025-03-20T01:22:06+05:30 Gaurav Garg CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183) d84635b1b085d54d6a21924e6171688d6e3dfb46 75422e8bc42646005be0754f7aa438b97a5e777e 2025-03-18T12:54:55-07:00 lhez opencl: improve profiling (#12442) bb115d2bf7ed2cdd7dccd7ae74cc9cfe4b0adb71 29fff308c704c1c752cdb5153361e545e2bac09d 2025-03-19T02:28:26+08:00 R0CKSTAR musa: override warp_size of musa device to 32 (#12445) 7dfad387e3f6ac98d383ded2d175eb59736a3993 60c902926c928f9c2cd6390ce411876f92feeaf3 2025-03-18T07:27:50+08:00 Molly Sophia llama: Add support for RWKV v7 architecture (#12412) 9f2250ba722738ec0e6ab684636268a79160c854 774973b8f3d5e375b0b74d58638eeb1817e950a8 2025-03-14T16:41:20Z Eric Curtin Add CLI arg to llama-run to adjust the number of threads used (#12370) 10f2e81809bbb69ecfe64fc8b4686285f84b0c07 ba7654380a3c7c1b5ae154bea19134a3a9417a1e 2025-03-11T20:16:03+01:00 uvos CUDA/HIP: refractor mmqv to unify the calculation of nwarps and rows per block between host and device code. (#12177) 251364549fe4a78d4e2e66f1adfaf2bd53041d2c 8acdacb3ea00697477eb019efbb6fc183371055c 2025-03-11T01:18:25+08:00 R0CKSTAR musa: support new arch mp_31 and update doc (#12296) 05e6f5aad0a4bb48fb2775f2a78505540fdbc47d 673cfef9aa8daad09966208909f346eb996628a4 2025-02-28T13:06:12+05:30 Prashant Vithule ggml: aarch64: implement SVE kernels for q2_k_q8_k vector dot (#12064) f777a73e18c218848bca0748581c043987348a5d af7747c95ae71a5db4184947f837179e82c70b77 2025-02-23T13:14:32Z Eric Curtin Some llama-run cleanups (#11973) 0b3863ff9576872855b0265da2cab2ce7e25c4d9 ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe 2025-02-21T15:46:23+08:00 Bodhi MUSA: support ARM64 and enable dp4a .etc (#11843) c5d91a74006c49376590ef2b67420bc7ce206397 4806498bf15ef767de3776b00856e56c373dd1b1 2025-02-20T14:06:51+01:00 Charles Xu ggml-cpu: Add CPU backend support for KleidiAI library (#11390) 73e2ed3ce3492d3ed70193dd09ae8aa44779651d f7b1116af102bcac450c1a522e9c59db241c6767 2025-02-17T14:03:24+01:00 Johannes Gäßler CUDA: use async data loading for FlashAttention (#11894) c48f630d1c1942fce08aa7cb18a53ace443cd611 bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 2025-02-13T14:46:59+01:00 Daniel Bevenius llama : add --completion-bash option (#11846) bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 c7f460ab882065ec5696e3d51e24dbf67b539287 2025-02-13T20:28:18+08:00 R0CKSTAR musa: bump MUSA SDK version to rc3.1.1 (#11822) e4376270d971cff7992bdb6c5412a739195b1459 3e693197724c31d53a9b69018c2f1bd0b93ebab2 2025-02-13T01:25:34-05:00 Oleksandr Kuvshynov llama.cpp: fix warning message (#11839) a394039db004c6ee00098250d160b5aa018c2314 be3bbd62153820ff6d358c817360927f429105c4 2025-02-13T01:02:38+01:00 Diego Devesa ggml-cpu : add chunking support to mul_mat_id (#11666) 748ee9fe9312acb8755ee4bf46fd9de2e6a45f29 198b1ec611a2c551ea40e5b9c0b862f37555a4cc 2025-02-12T13:57:33Z Richard ggml : fix multi-threaded clamp_f32 (#11824) 4d3465c5aeca8be29cac77f1535c35f4fb274eca d80be897acdca45f8f7ea2e52c930b1d0e738a14 2025-02-08T15:30:53+01:00 Karol Kontny ggml: Fix data race in ggml threadpool (#11736) 2fb3c32a1634488a5265d1304ab37628eeb5480d 9ab42dc722ad19a12af80f38a06474d498f96da3 2025-02-06T17:32:29+01:00 Xuan-Son Nguyen server : (webui) migrate project to ReactJS with typescript (#11688) 3ec9fd4b77b6aca03a3c2bf678eae3f9517d6904 3962fc1a7956dd0afacfbce10fd1a3ffd3ad857e 2025-02-05T02:18:38+08:00 fxzjshm HIP: force max threads per block to be 1024 (#11621) a83f528688324a21484a97af1d1be5e1bc8d4c8e b1bcd309fc8ac929cbd4a6207b3a19886bda031f 2025-01-31T14:15:25Z Olivier Chafik `tool-call`: fix llama 3.x and functionary 3.2, play nice w/ pydantic_ai package, update readme (#11539) 4314e56c4f8c5091f45732f39bd94c0c6c323798 496e5bf46bab757d05e18227cb4e17055ae42f42 2025-01-30T11:05:00+01:00 Daniel Bevenius server : use lambda instead of std::bind (#11507) e0449763a4f335cca374254a72892141f41eaa59 eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc 2025-01-30T05:48:14+01:00 Daniel Bevenius server : update json snippets in README.md [no ci] (#11492) 1a0e87d29152cb9d4ce13b4ad64b0382c9ba1ab6 d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d 2025-01-23T11:59:08-08:00 William Tambellini ggml : add option to not print stack on abort (ggml/1081) d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d b636228c0ad0db95bf73008094c6145a05615cf6 2025-01-17T21:29:08+09:00 issixx ggml-cpu : fix ggml_graph_compute_thread did not terminate on abort. (ggml/1065) 5245729e3317064959faefc5e5cbc63f4e9cfbea 6152129d05870cb38162c422c6ba80434e021e9f 2025-01-23T01:01:17-06:00 Jeff Bolz vulkan: fix diag_mask_inf (#11323) 6171c9d25820ccf676b243c172868819d882848f e28245f35f2faaf249dd352998b3693a8cc28c51 2025-01-21T13:18:51Z Olivier Chafik Add Jinja template support (#11016) adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5 f11cfdfd7fe29436fce512d934c2ff6b94bd89d2 2025-01-15T19:50:13Z Eve vulkan: scale caching for k quants + misc fixes (#11081) 6369f867a410416239d9f20ec27c2b1d6a9fee52 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 2025-01-06T10:28:17+01:00 Daniel Bevenius llama : rename missed batch params/vars to ubatch (#10059) 0da5d860266c6928b8c9408efbd264ae59fedda6 a45433ba209ee0b33d02c7dc4c31f29894ad83a6 2025-01-02T15:05:18+01:00 Xuan Son Nguyen server : allow using LoRA adapters per-request (#10994) a813badbbdf0d38705f249df7a0c99af5cdee678 fdd21889123bec62b1db3b2fc22b5a4abab32174 2024-12-29T03:16:34-06:00 Jeff Bolz vulkan: im2col and matmul optimizations for stable diffusion (#10942) 227d7c5a7f4cc7734fde8a4ef4382d613486d3c8 7b1ec53f56bb72c49e4c8434157895f94d3709c2 2024-12-17T09:52:09+01:00 Xuan Son Nguyen server : (UI) fix missing async generator on safari (#10857) 7b1ec53f56bb72c49e4c8434157895f94d3709c2 160bc039c862c10b9938269a90ddb09d794a7b0d 2024-12-17T05:52:55Z Eve vulkan: bugfixes for small subgroup size systems + llvmpipe test (#10809) 5478bbcd173e7027af7689493c7421719f5c43df b5ae1ddff93403300fc79c7ab5ee73b8cfbb3457 2024-12-15T05:55:54-06:00 Vinesh Janarthanan server: (UI) add syntax highlighting and latex math rendering (#10808) a76c56fa1a3d27467eb97468d8c3b2fe1243b61a c27ac678dd393af0da9b8acf10266e760c8a0912 2024-12-13T12:23:52-08:00 lhez Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693) 11e07fd63bac1cb642380a7a3eac03fd8703e948 4601a8bb6784d2ab8b4b605354b51979fbeea1d3 2024-12-13T18:23:50+01:00 Corentin REGAL fix: graceful shutdown for Docker images (#10815) 83ed24a97b500ccdb32b90b94e6f9621ad8db79e d583cd03f663701858ba152a334cbb467fabe342 2024-12-13T12:12:15+05:30 Akarshan Biswas SYCL: Reduce most of the compiler warnings (#10748) 3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 d9c3ba2b7749c00df477599aa141a98b4521aa2c 2024-12-07T20:21:09+01:00 Xuan Son Nguyen server : (refactor) no more json in server_task input (#10691) ce4a7b849388b67d45ad420bdd82d5efcd55647a 19d8762ab61df8286367588a80b9c7db4cb568db 2024-12-07T18:02:05+02:00 Georgi Gerganov server : various fixes (#10704) e9e661bd59364e5d4fce035834b6cadcadf8c2ef efb6ae963031709fc331e6e48cc4606ac8f9c3a7 2024-12-03T21:11:43+08:00 mahorozte CUDA: remove unnecessary warp reduce in FA (ggml/1032) efb6ae963031709fc331e6e48cc4606ac8f9c3a7 667d70d1704dfa6977505f5d01d4638669b90dce 2024-12-02T19:27:24+01:00 PAB feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019) 0533e7fb3842a523f64dc533bd7bd7147ec2c63a 7cc2d2c88908fc92b97b28acafb82f7d6e425b85 2024-11-30T07:00:02Z Eve vulkan: Dynamic subgroup size support for Q6_K mat_vec (#10536) 6c595676899013102fdb0aa4b06a49954300c94a 890719311b6535e572f15965c6d7ec4ac2537f60 2024-11-28T19:17:49+01:00 Xuan Son Nguyen server : (tests) don't use thread for capturing stdout/stderr, bump openai client library (#10568) 249cd93da3df9c8fa78869b0522526d1625aca91 904109ed0d97c9b656a5e8bf612925f739bb8166 2024-11-27T00:00:41+08:00 R0CKSTAR mtgpu: Add MUSA_DOCKER_ARCH in Dockerfiles && update cmake and make (#10516) 45abe0f74ee281aea6e5283c1e738061256cfcae 0bbd2262a3263f37385297b30de37941836e57f7 2024-11-26T16:20:18+01:00 Xuan Son Nguyen server : replace behave with pytest (#10416) 84e1c33cde9e0a7aafcda2d4f21ba51c300482d7 811872a59daefb25fc0c4326bcb6d8ae893c2f7c 2024-11-26T13:36:40+02:00 Georgi Gerganov server : fix parallel speculative decoding (#10513) 9ca2e677626fce759d5d95c407c03677b9c87a26 5931c1f233c616083d64e41a228249d58e039aa5 2024-11-25T16:31:38+02:00 Georgi Gerganov server : add speculative decoding support (#10455) cce5a9007572c6e9fa522296b77571d2e5071357 dc39012cbaf8752fabecaeb60af78ccdd1dfb73b 2024-11-24T18:03:25+02:00 Georgi Gerganov flake.lock: Update (#10470) 2eb76b2a5e4ea395b971a419c95b473ab6f253e4 9b75f03cd2ec9cc482084049d87a0f08f9f01517 2024-11-18T16:08:20+02:00 Georgi Gerganov flake.lock: Update (#10346) cf32a9b93ad859ea592c31785b6bd3b4b2121463 a43178299c2f74f14bcfc659bfd9fd32d931d1f4 2024-11-17T11:23:01+02:00 Georgi Gerganov metal : refactor kernel args into structs (#10238) f0204a0ec70d50ca60e07bc0096ec1d6508ab0c7 57f8355b29a8c7dfcd1fb6094758ad85644f8535 2024-11-15T19:47:25+08:00 R0CKSTAR ci: build test musa with cmake (#10298) 9901068ac78838745e604fffb4601d315a610456 231f9360d94446cd083b6b116f63991b1328c484 2024-11-15T05:48:49-04:00 Xuan Son Nguyen server : (web UI) add copy button for code block, fix api key (#10242) ae8de6d50a09d49545e0afab2e50cc4acfb280e2 4a8ccb37ad9c9027cbcfd5548c19cdffe48d5197 2024-11-14T18:04:35+01:00 Diego Devesa ggml : build backends as libraries (#10256) fb4a0ec0833c71cff5a1a367ba375447ce6106eb 5ea926dad7f62ebccff7b24784bd1e01a06d13ae 2024-11-13T20:00:35+02:00 Michael Podvitskiy llama : propagate the results of `graph_compute` (#9525) 54ef9cfc726a799e6f454ac22c4815d037716eda b0cefea58a20020754b7431e3c725625274372a5 2024-11-11T11:13:51-06:00 Jeff Bolz vulkan: Throttle the number of shader compiles during the build step. (#10222) 4b3a9212b602be3d4e2e3ca26efd796cef13c55e 505f33274d60676320216b662a97672a76ec600e 2024-11-10T21:45:25+02:00 Georgi Gerganov flake.lock: Update (#10243) 3bcd40b3c593d14261fb2abfabad3c0fb5b9e318 5c333e014059122245c318e7ed4ec27d1085573c 2024-11-07T18:19:10+11:00 Zhiyuan Li Optimize RWKV6 Operator Naming and Implement Multi-core CPU/ SYCL Acceleration (#10133) b11f9ba9b8ce319f04b88afe40d264e6b7f4ba46 94d8cb8be13b7c4d04eeca5a2b956b9148e6f222 2024-11-06T13:29:01+02:00 Georgi Gerganov server : remove hack for extra parallel slot (#10187) 9e0ecfb697d297355e43c20559d29bcc71beb0c3 6a066b9978533e2ab9890b7f4f8c0262d91798b3 2024-11-04T16:33:29+01:00 Xuan Son Nguyen server : clarify /slots endpoint, add is_processing (#10162) 1839f69130151ceeac4d01c0ef8964e1fb43bba6 9830b6923b61f1e652a35afeac77aa5f886dad09 2024-11-03T15:14:15+02:00 Georgi Gerganov flake.lock: Update (#10146) 42cadc74bda60afafb45b71b1a39d150ede0ed4d 45950415ed985830c59bf42cf9c9216b20cf08ef 2024-11-02T16:34:56Z sasha0552 server : fix slot selection by lru (#10126) d865d1478cd4e403f82d793c2afcd0f943412f05 1804adb0cfee4811eaf633741503d683a46e4c77 2024-11-01T13:33:14Z sasha0552 server : fix smart selection of available slot (#10120) 07028f9d74d895da2ca4a1956624e3f07e04e620 524afeec9dad7d765ce91f5cf30c73703867cb47 2024-10-28T17:41:24+02:00 Georgi Gerganov flake.lock: Update (#10063) 524afeec9dad7d765ce91f5cf30c73703867cb47 8125e6cbfcf2b3b9066e4d923aca9295526730f5 2024-10-28T17:02:48+08:00 R0CKSTAR musa: workaround for Guilty Lockup in cleaning src0 (#10042) 8c60a8a46261ffb92b6d23a78acfac2fcb6fe233 9e4a2563eadf34e9432d248224d4f43e8495e8fe 2024-10-23T14:34:00-04:00 bssrdf increase cuda_cpy block size (ggml/996) bc5ba007b2c83ac95875e68724dabfc12159fc61 958367bf530d943a902afa1ce1c342476098576b 2024-10-25T10:13:46+03:00 Georgi Gerganov server : check that the prompt fits in the slot's context (#10030) 958367bf530d943a902afa1ce1c342476098576b 40f2555797f97314de749873cdc29dc102be66e2 2024-10-24T21:51:22+02:00 Xuan Son Nguyen server : refactor slot input data, move tokenizer to HTTP thread (#10023) 873279b1592e433c4d9eb5065091cc98473c7bee c8c07d658a6cefc5a50cfdf6be7d726503612303 2024-10-20T00:22:59Z github-actions[bot] flake.lock: Update 60ce97c9d809f4b040e90b597468b839df5728d0 8901755ba328643c9ab071c20e1939ea52951a0e 2024-10-18T13:34:36+08:00 Ma Mingfei add amx kernel for gemm (#8998) fbc98b748e7b075e327bcf13237057f647678049 dcdd535302fc9702a4709be25f56540d65163a44 2024-10-15T15:54:55+05:00 MaggotHATE sampling : add XTC sampler (#9742) 92be9f12164f18ce845a5bab60cefa5f7fec6836 edc265661cd707327297b6ec4d83423c43cb50a5 2024-10-13T06:11:26+03:00 Georgi Gerganov flake.lock: Update (#9870) 1bde94dd024b632f98428f4bf2ce483295130779 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 2024-10-12T16:06:31+03:00 Georgi Gerganov server : remove self-extend features (#9860) 11ac9800aff532715a5bc7991062c68ba3472e6e 943d20b4111c746bcd9dbc7e4771de313b08b50c 2024-10-12T08:21:51+03:00 Georgi Gerganov llama : improve infill support and special token detection (#9798) 943d20b4111c746bcd9dbc7e4771de313b08b50c 96776405a17034dcfd53d3ddf5d142d34bdbb657 2024-10-12T13:09:53+08:00 R0CKSTAR musa : update doc (#9856) cf8e0a3bb9c0e93e371773b282054cdbbb231038 c7499c557cc1efafaf0a6bc12963c39826299703 2024-10-11T02:10:37+08:00 R0CKSTAR musa: add docker image support (#9685) 6279dac039ddeb6d5ebd125a6274fd3c37a77ba8 d5ac8cf2f2e30459489e6721a17d15b92a0c42a6 2024-10-07T19:35:42+03:00 Georgi Gerganov flake.lock: Update (#9753) 96b69121033d2b6b951d1b6b1b43f8b4f97dac99 d5cb86844f26f600c48bf3643738ea68138f961d 2024-10-07T13:26:31+01:00 Paul Tsochantaris metal : single allocation of encode_async block (#9747) ace4f4be37abed4801fbd54a94cf38a7ae462416 8277a817f18967581b02b2248989d773e8e99998 2024-09-30T17:48:49+03:00 Georgi Gerganov flake.lock: Update (#9680) 641002fba8d2a0c0269027e23d2ef58e90546028 0de8b203f1d31cf5ee0d2a3560a0ad78d44f4d4c 2024-09-29T11:50:17-05:00 Jeff Bolz vulkan : multithread pipeline creation (ggml/963) 544f409b4bd8fc98a3e87820f0ac934e00402de7 6084bfb261b03f812de2255b05b6b5bb8d1c7171 2024-09-26T08:59:42+02:00 Salvatore Mesoraca vulkan : argsort barriers must be under uniform control flow (ggml/951) 6084bfb261b03f812de2255b05b6b5bb8d1c7171 faac0bae265449fd988c57bf894018edc36fbe1e 2024-09-24T13:23:59+03:00 Georgi Gerganov ggml : fix GGML_MAX_N_THREADS + improve formatting (ggml/969) 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 739842703e32cd43443c45e0b4f6647cc4e6b3d6 2024-09-28T14:32:46+02:00 slaren test-backend-ops : use flops for some performance tests (#9657) 739842703e32cd43443c45e0b4f6647cc4e6b3d6 6102037bbb55521880ae78a6ee6c2a0c00c901df 2024-09-28T15:13:21+03:00 Georgi Gerganov llama : add comment about thread-safety [no ci] (#9449) 7691654c68aa5316108f881136c59f815ccb6809 ea9c32be71b91b42ecc538bd902e93cbb5fb36cb 2024-09-26T09:27:40+08:00 R0CKSTAR mtgpu: enable VMM (#9597) 3d6bf6919f7b10726421779cd344f2da05421c68 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 2024-09-25T01:06:52-06:00 Gabe Goodhart llama : add IBM Granite MoE architecture (#9438) c087b6f11d3385f4293b6841ebfb755063479490 116efee0eef09d8c3c4c60b52fa01b56ddeb432c 2024-09-23T21:18:48-07:00 Max Krasnyansky threads: fix msvc build without openmp (#9615) f0c7b5edf82aa200656fd88c11ae3a805d7130bf 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 2024-09-23T11:42:43-07:00 Max Krasnyansky threads: improve ggml_barrier scaling with large number of threads (#9598) f3979df762b75a2b1c0f622a2cd15d1bc60f037f 1e7b9299c6ccb5bbc55d3db7cfa9b51f3ab09b59 2024-09-23T18:43:40+03:00 Georgi Gerganov flake.lock: Update (#9586) c35e586ea57221844442c65a1172498c54971cb0 912c331d3dba3a079815844208dc36164baa8cc7 2024-09-22T22:55:49+08:00 R0CKSTAR musa: enable building fat binaries, enable unified memory, and disable Flash Attention on QY1 (MTT S80) (#9526) 424c5d00a9b97dd5559635872db9b57f87c23b02 a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 2024-09-20T19:04:44+03:00 Johannes Gäßler ggml/examples: add backend support for numerical optimization (ggml/949) a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 5cb12f68395a5ec00b357e408883ce124a11dcdb 2024-09-08T11:10:43+03:00 Georgi Gerganov examples : add null threadpool args where needed (ggml/0) 64c6af3195c3cd4aa3328a1282d29cd2635c34c9 0d2f22e45c3c3b6f8222acb6284d0c8c93443ba1 2024-09-18T19:13:08+02:00 slaren ggml : fix n_threads_cur initialization with one thread (#9538) 8b836ae731bbb2c5640bc47df5b0a78ffcb129cb 8344ef58f8cdb8ebd6faf4463ca32ae91c374c81 2024-09-17T09:35:38-04:00 Bert Wagner arg : add env variable for parallel (#9513) 0226613853133c081b55bb892a41bb5eacc0bc94 503147a9f9d195d6a14e7c998df23b6eb61f2bae 2024-09-17T01:19:46-07:00 Max Krasnyansky threadpool : skip polling for unused threads (#9461) 5c3d0f1824714e9a97fc9b06e046eefcb6ecc721 0aadac10c7dd704f8285ddf5a63d6f764cb340aa 2024-09-16T06:48:24Z Eve ggml : IQ4_NL sgemm + Q4_0 AVX optimization (#9422) 90a2fff0e7f80c6fea3fc6cf9a7b482744f3f164 6262d13e0b2da91f230129a93a996609a2f5a2f2 2024-09-16T05:14:23+03:00 Georgi Gerganov flake.lock: Update (#9488) befaf1197fa447f61714de041828852a270659d2 feff4aa8461da7c432d144c11da4802e41fef3cf 2024-09-14T09:50:12+02:00 Daniel Bevenius llama : make cell_id const in inp_s_mask block (#9470) 5af118efdaf1098798a06b24fd8a557760e99631 d2b496bff4f353a6429f8e833448f071bd237ba7 2024-09-11T10:22:40+02:00 Johannes Gäßler CUDA: fix --split-mode row race condition (#9413) b34e02348064c2f0cef1f89b44d9bee4eb15b9e7 51b603863627c4074e77b7e556e18ece86bdf9a3 2024-09-11T09:46:55+08:00 R0CKSTAR musa: remove Clang builtins mapping (#9421) cb9c933eb2a0d2b514556bdcb934b56dfe5d6771 6cd4e034442f71718563e600070c2b6fc389e100 2024-09-11T01:46:59+03:00 Georgi Gerganov flake.lock: Update (#9360) 5fac4d57643b1de8e9ab746f14d2fc4e319ae0c2 5fb5e24811cb01d48b482c15a974bfbd9f433e1d 2024-09-09T21:07:18+05:30 Prashant Vithule ggml : vector length agnostic SVE support (#9290) efe6a83e3046a94cda38c8be5a7801eadc21d78d fbb7fcffbcfc50009c275e75982b1603a6cb6b80 2024-08-28T10:23:02+02:00 Salvatore Mesoraca ggml : fix cont with transposed tensors when one dimension is 1 (ggml/934) 9b2c24c0993487d3b34a873980e292da571481f3 134bc38ecf3e2c5460581badce289a1ffa680453 2024-09-06T23:21:29+02:00 Xuan Son Nguyen server : simplify state machine for slot (#9283) 4a1411b4f17b6569dc0a067e5914dcc0f738b370 8ebe8ddebd68526757c631cd019de009697c63c2 2024-09-06T14:06:04+02:00 Xuan Son Nguyen server : fix missing lock (#9334) 7605ae7daf31c02211bcfec2f46635ef6ec4b98a 8962422b1c6f9b8b15f5aeaea42600bcc2d44177 2024-09-04T02:36:43+03:00 Georgi Gerganov flake.lock: Update (#9261) f771d064a95d212ddadea452ad0cc1e42b2c3db3 6e7d133a5f9409dd257fad90d7f320721b07a1b2 2024-09-02T08:25:30-07:00 yuri@FreeBSD ggml : add pthread includes on FreeBSD (#9258) 6e7d133a5f9409dd257fad90d7f320721b07a1b2 b60074f1c26d8354053a952844ef3f7ebefd8803 2024-09-02T17:11:51+02:00 Xuan Son Nguyen server : refactor multitask handling (#9274) 8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980) 42c76d1358021ccdbe8ba89109c143dd7ae166df 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b 2024-08-29T19:20:53-04:00 Faisal Zaghloul Threadpool: take 2 (#8672) 1d1ccce67613674c75c9c7e3fa4c1e24e428ba48 9fe94ccac92693d4ae1bc283ff0574e8b3f4e765 2024-08-29T07:28:14+03:00 Georgi Gerganov flake.lock: Update (#9162) a1631e53f6763e17da522ba219b030d8932900bd fc54ef0d1c138133a01933296d50a36a1ab64735 2024-08-21T17:58:11-04:00 compilade llama : simplify Mamba with advanced batch splits (#8526) 8455340b874aa90d5f70104c99ed2778d9e31c36 2f3c1466ff46a2413b0e363a5005c46538186ee6 2024-08-21T09:32:58+02:00 Daniel Bevenius llama : std::move llm_bigram_bpe from work_queue (#9062) 554b049068de24201d19dde2fa83e35389d4585d 2339a0be1c8e31fcf4531427183b94f2ef019e56 2024-08-18T17:43:32+03:00 Georgi Gerganov flake.lock: Update (#9068) 8b3befc0e2ed8fb18b903735831496b8b0c80949 d565bb2fd5a2a58b9924a7a34e77a87c78c52137 2024-08-16T17:19:05+02:00 Xuan Son Nguyen server : refactor middleware and /health endpoint (#9056) 5fd89a70ead34d1a17015ddecad05aaa2490ca46 98a532d474c73d3494a5353024cb6a4fbbabbb35 2024-08-14T18:32:53+02:00 0cc4m Vulkan Optimizations and Fixes (#8959) 98a532d474c73d3494a5353024cb6a4fbbabbb35 43bdd3ce188cd247bda7c1bd1ad01fa64e566690 2024-08-14T02:51:02-04:00 compilade server : fix segfault on long system prompt (#8987) 8cd1bcfd3fc9f2b5cbafd7fb7581b3278acec25f a21c6fd45032a20180e026773582d21294c85619 2024-08-11T16:58:58+03:00 Georgi Gerganov flake.lock: Update (#8979) 272e3bd95e620d285b2fb9faaa7b6b1b8edbbf3a 45a55b91aa87958a75d691be64b070266d4fbb94 2024-08-09T18:24:30+03:00 Georgi Gerganov make : fix llava obj file race (#8946) be55695eff44784a141a863f273661a6bce63dfc 0478174d5959b66096ae6609fcb0df14cab66b51 2024-08-07T13:29:02+02:00 slaren ggml-backend : fix async copy from CPU (#8897) db20f50cf4710c46e3a996919a26858cae8c80ed efda90c93a62274ec0b0bfa80c4eee4bdb6966d0 2024-08-06T17:21:47+04:00 Jaeden Amero cmake : Link vulkan-shaders-gen with pthreads (#8835) 064cdc265fb63590c7c8f04a609d36ef200d55a7 5587e57a76630651752031223cc7024cb32cf308 2024-08-05T07:52:55+02:00 0cc4m vulkan : fix Qantized Mat-Vec Mul on AMD GPUs for ncols < 64 (#8855) ecf6b7f23e664afd7ff856ec39034240ce438daa 01aae2b4975b57a265ce8194928fd87f2d71027e 2024-08-04T03:55:03-07:00 Brian Cunnie batched-bench : handle empty `-npl` (#8839) 4b77ea95f56a4c49bc995f08eac62a6416875ccc 76614f352e94d25659306d9e97321f204e5de0d3 2024-08-04T05:53:20+03:00 Georgi Gerganov flake.lock: Update (#8847) b7a08fd5e0e7c898c68d1743066ea495202d9608 7a11eb3a260915aee16101808f291a244e2facc7 2024-08-01T12:53:46-04:00 Alex O'Connell Build: Only include execinfo.h on linux systems that support it (#8783) ed9d2854c9de4ae1f448334294e61167b04bec2a 398ede5efeb07b9adf9fbda7ea63f630d476a792 2024-07-31T15:51:06-04:00 Clint Herron Build: Fix potential race condition (#8781) 7c27a19b2eb91bb0f43c7f7aec0386cec2dddc33 140074bb8647df41840d6f32f4409fa8959bcf9f 2024-07-30T23:40:18+09:00 l3utterfly added android implementation of ggml_print_backtrace_symbols (#8751) 140074bb8647df41840d6f32f4409fa8959bcf9f 6e2b6000e5fe808954a7dcef8225b5b7f2c1b9e9 2024-07-30T15:58:57+03:00 Georgi Gerganov flake.lock: Update (#8729) 439b3fc75a8deb42899ac47a8f52aae75e0339fe 0832de723695ab400316a6c49b9f712380e3a731 2024-07-29T20:56:12+08:00 R0CKSTAR cuda : organize vendor-specific headers into vendors directory (#8746) 6eeaeba126ff701f3e8f79f246805b7023709972 4730faca618ff9cee0780580145e3cbe86f24876 2024-07-28T22:32:44+02:00 Johannes Gäßler cmake: use 1 more thread for non-ggml in CI (#8740) 4c676c85e59ef8f771f3a129e6eb217552139231 e54c35e4fb5777c76316a50671640e6e144c9538 2024-07-28T00:42:05-04:00 compilade llama : refactor session file management (#8699) e54c35e4fb5777c76316a50671640e6e144c9538 5e2727fe0321c38d1664d26173c654fa1801dc5f 2024-07-28T07:41:25+08:00 R0CKSTAR feat: Support Moore Threads GPU (#8383) 45f2c19cc57286eead7b232ce8028273a817aa4d 22f281aa16f44d8f6ec2c180a0685ff27e04e714 2024-07-21T16:45:10+03:00 Georgi Gerganov flake.lock: Update (#8610) 22f281aa16f44d8f6ec2c180a0685ff27e04e714 328884f4219c0228673cf1870ac63987fb4f9fd0 2024-07-20T22:09:17-04:00 M-A examples : Rewrite pydantic_models_to_grammar_examples.py (#8493) 69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0 07283b1a90e1320aae4762c7e03c879043910252 2024-07-20T22:25:26+02:00 Johannes Gäßler CUDA: MMQ code deduplication + iquant support (#8495) 87e397d00bdcedd5cbf6dfda06a7b0f302462728 57b1d4f9eb6f2c139b31ea79626d954b261e1051 2024-07-19T17:17:27+02:00 slaren ggml : fix quant dot product with odd number of blocks (#8549) 7acfd4e8d55082c1b597dfc3ffe04fb5d530c6dc 97bdd26eee11fe109dec00de75690ceef61c03f2 2024-07-15T23:13:10-04:00 compilade convert_hf : faster lazy safetensors (#8482) f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b8 9104bc20edf47f74dc49379b7d61d0c6e85a4882 2024-07-15T08:04:56-04:00 M-A server: update README.md with llama-server --help output [no ci] (#8472) aaab2419eaa17ab3aa38f4ba49c7eea406999e99 73cf442e7bc9baca7b3e213b261551812f1676c9 2024-07-14T18:54:02+03:00 Georgi Gerganov flake.lock: Update (#8475) 278d0e18469aacf505be18ce790a63c7cc31be26 dd07a123b79f9bd9e8a4ba0447427b3083e9347a 2024-07-10T20:08:17-04:00 Clint Herron Initialize default slot sampling parameters from the global context. (#8418) 0f1a39f3439825acf7e3a1663566d410be152170 83321c6958acf20747d288031174cc1bf8816e33 2024-07-10T07:14:51-05:00 Dibakar Gope ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780) 7fdb6f73e35605c8dbc39e9f19cd9ed84dbc87f2 a130eccef42b75a84da270411cefeed45c153e30 2024-07-09T01:36:38+03:00 Georgi Gerganov flake.lock: Update (#8342) 470939d483d1c89b7292f78bac1fd27c42c171ce 6f0dbf6ab087bcd286fb78560099ca0458316735 2024-07-08T03:26:53-04:00 Kevin Wang common : preallocate sampling token data vector (#8363) cb4d86c4d723af87d3d7e3177e9485f200391384 86e7299ef5dff0f388922dc6fcbce009e99d8005 2024-07-07T11:10:38+02:00 Bjarke Viksøe server: Retrieve prompt template in /props (#8337) 213701b51a17175d0d326b566efc03f30ec7fbe6 be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d 2024-07-05T19:01:35+02:00 jaime-m-p Detokenizer fixes (#8039) d0a7145ba99ed3a8bc3145aa785b5c86ffe65020 9ef07800622e4c371605f9419864d15667c3558f 2024-07-01T02:09:34+03:00 Georgi Gerganov flake.lock: Update (#8218) ab3679112d4c49a215a3d31550a7720b202e9015 97877eb10bd8e7f8023420b5b5300bcbdadd62dc 2024-06-27T18:37:29+03:00 Georgi Gerganov flake.lock: Update (#8071) 9b31a40c6ddabe552875b811d7127aa039ca9703 c70d117c37cc7876e775d1e2722208a50c52edb3 2024-06-27T01:50:09+02:00 Daniel Bevenius clip : suppress unused variable warnings (#8105) e6bf007744eb06336a231ef39cf08146dd16d2ce 84631fe1504de40427dc4b4cdac92fa7ebf65955 2024-06-25T21:07:28+02:00 Daniel Bevenius llama : return nullptr from llama_grammar_init (#8093) 3791ad219323389106dc3fd80814eb5bbb7b80de f702a90e245499283d6de0b287701c723cda2a87 2024-06-25T16:57:35+05:30 HanishKVC SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950) 95f57bb5d5b18ef0beb2702a0d6c06e46804075c e112b610a1a75cb7fa8351e1a933e2e7a755a5ce 2024-06-24T03:07:59+02:00 slaren ggml : remove ggml_task_type and GGML_PERF (#8017) e112b610a1a75cb7fa8351e1a933e2e7a755a5ce 6a2f298bd784403c5c33eebb822217ec5d9b5590 2024-06-24T02:27:57+08:00 Eddie-Wang llama : add support for BitnetForCausalLM (#7931) b6b9a8e606da7764bd3649c2ea574979c85abd43 45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc 2024-06-23T13:14:45+02:00 slaren fix CI failures (#8066) ba5899315283eb1df3902363daf79bdc5eefe426 a7854743c5e6216a6178824a603aa9479728ddd5 2024-06-19T23:57:10Z sasha0552 server : fix smart slot selection (#8020) 9c77ec1d74874ee22bdef8f110e8e8d41389abf2 a04a953cab583f0229e7b4b506346e3e9a85c8d0 2024-06-19T15:04:15+02:00 slaren ggml : synchronize threads using barriers (#7993) 6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f79 21be9cab94e0b5b53cb6edeeebf8c8c799baad03 2024-06-17T16:10:15+02:00 Markus Tavenrath Implement non-mapped async IO for CUDA on Windows. (#7896) bc6c457fa35f6791e9a2bb61108e7d49e8fc98bd 52399254b3bceda279b4ea9111a983e32310166e 2024-06-16T19:16:21+03:00 Georgi Gerganov flake.lock: Update (#7951) cddaf028adc738b5a7ecc60809cb78e0ba0f97c1 c8a82194a888f68f259e0d0fa96f3332ac7c5cb6 2024-06-16T14:50:12+03:00 Georgi Gerganov ggml : fix handling of zero blocks in IQ quants (#7955) 0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514) 76d66ee0be91e2bec93206e821ee1db8d023cff5 66ef1ceedf983773c8ceb4d925285d41d4e50e2a 2024-06-14T18:41:49+02:00 Johannes Gäßler CUDA: faster q2_K, q3_K MMQ + int8 tensor cores (#7921) f578b86b2123d0f92afbaa98a031df4d4464e582 1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 2024-06-13T03:11:35+02:00 slaren move BLAS to a separate backend (#6210) 10ceba354a3b152ff425e9fa97f9caaef99a46b1 e95beeb1fc4621826ddd616776dbdf717366bf5c 2024-06-10T02:04:50+03:00 Georgi Gerganov flake.lock: Update (#7838) 7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f da799b41891e34aac86ce4e173f9c4c0afd4fab3 2024-06-08T07:50:31Z sasha0552 server : smart slot selection using Longest Common Prefix (#7728) 27615f5ab21060d96953c9c1e223051ab2188f57 7027b27d765db95d4ac6b569d976e387a8715881 2024-06-07T05:15:07-07:00 intelmatt cmake : fix BUILD_SHARED_LIBS=ON build (#7784) ee459f40f65810a810151b24eba5b8bd174ceffe f83351f9a62a6262f1fc3d08f320033089cddfb5 2024-06-06T19:19:59+03:00 Georgi Gerganov server : fix --threads-http arg (#7801) ad675e1c67a05b16e4e12abe30dbecfc808e7b7e a143c04375828b1f72eb1a326115791b63e79345 2024-06-06T06:08:52-07:00 Clint Herron Added support for . (any character) token in grammar engine. (#6467) 9973e81c5ccf4f31b3980f5aa73f5cfea8699860 c90dbe026b456a233f8f0fbe752212e6a0503ca2 2024-06-04T23:40:49-07:00 arch-btw readme : remove -ins (#7759) 6d1616944d9efd342ed2a4fd318722adfc9febcd bde7cd3cd949c1a85d3a199498ac98e78039d46f 2024-06-04T10:01:09+03:00 Georgi Gerganov ggml : prevent builds with -ffinite-math-only (#7726) a5735e4426b19a3ebd0c653ad8ac01420458ee95 0b832d53ba0ffcc759c8d62ede3772dd62321f8e 2024-06-04T00:14:15+09:00 Masaya, Kato ggml : use OpenMP as a thread pool (#7606) 6f28a333c1e3fdfdc7b4f9d0367f2b41a9b7e9d4 549279d8049d78620a2b081e26edb654f83c3bbd 2024-06-03T15:49:30+08:00 zhangkaihuo llama : MiniCPM support tied embeddings (#7664) 1669810d7c2446af8425aa54ff6611bf6f14646c 7c4e5b7eae26581869e782015d9deca947c34997 2024-06-03T00:13:12+03:00 Georgi Gerganov flake.lock: Update (#7686) 2ac95c9d5678d05e253691fb1f26471675bff5ad 750f60c03e4d3f53fa51910551ce87a3d508d2d7 2024-06-01T21:50:18+05:30 HanishKVC SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548) 972b555ab935705f3437abd5909a5c46852811f6 3854c9d07f67de7f8cd6d86117bfaef47549b05a 2024-05-30T09:52:39+02:00 Johannes Gäßler README: explain parallel build [no ci] (#7618) 87bdf2a199acd62e19814d7a4d0500a04a7f09f3 00281b7be32462754618c42ed93f95743af46627 2024-05-29T13:36:39+02:00 slaren ggml : use atomic_flag for critical section (#7598) ee3dff6b8e39bb8c1cdea1782a7b95ef0118f970 edc29433fa08b4e5aeb67649a29fc7713af13d04 2024-05-28T17:07:05+02:00 fairydreaming Add support for DeepseekV2ForCausalLM (#7519) c41767154eb82aa3fe7568fc816c3402b78eae94 74b239b3d5f067470d7ef5e26e2e059720572e32 2024-05-28T00:41:14-04:00 Nathan Epstein Markdownish code block fix (#7571) dff451cfa1f297348751ce6b538670e1ae9a7d5b d298382ad977ec89c8de7b57459b9d7965d2c272 2024-05-26T18:54:56+03:00 Georgi Gerganov flake.lock: Update (#7540) d041d2ceaaf50e058622d92921b3e680ffa4e9e7 27891f6db03de6e3fd5941983838c29bef253352 2024-05-24T18:59:06+03:00 Georgi Gerganov flake.lock: Update (#7232) fbca2f27fc7fa9aa4a8ad0357478fdb908472908 0df0aa8e43c3378975269a51f9b876c8692e70da 2024-05-24T14:31:13+02:00 fairydreaming Add support for ArcticForCausalLM (#7020) 3015851c5ac7334fb544a23a70a284c117b87044 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 2024-05-23T14:29:26+02:00 Daniel Bevenius llama : add getters for n_threads/n_threads_batch (#7464) 1e374365d170b7f692fd7753c145e21bc14486c8 197ff91462dd05bb9a3be03578114abf0c355536 2024-05-22T23:23:21+05:30 HanishKVC SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350) 3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821 6bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb 2024-05-20T15:10:03+03:00 Georgi Gerganov server : fix temperature + disable some tests (#7409) cb42c294279bc4a0a4e926a7b5a5568049f12fa7 d233b507cd19fcc2d8d8963ecc6a3eb7a33f2ecc 2024-05-18T11:10:47+02:00 Johannes Gäßler server: correct --threads documentation [no ci] (#7362) d273c1402b25086fd91aef2467ac13f2e49fa0ea 27b040691cbe45314147c2745e891a38e9c048d4 2024-05-17T15:11:45+03:00 Aarni Koskela py : convert-hf-to-gguf-update improvements (#7340) e1b40ac3b94824d761b5e26ea1bc5692706029d9 dc020985b8755dd6aa93a2f002f43c3ede808cce 2024-05-15T12:59:12-05:00 kunnis ggml : use dynamic thread scheduling for matrix multiplication (#6915) f308ea705974dff62a1fe5367d776ad9d5109239 c3c88f296a72432edb697ac8026dbf2ec18f2b21 2024-05-13T11:01:07+03:00 Georgi Gerganov metal : tune soft_max number of threads (whisper/0) 541600201e6480f54ae09e58d16b154d4b4b331d efc8f767c8c8c749a245dd96ad4e2f37c164b54c 2024-05-14T09:33:42+02:00 slaren llama : disable pipeline parallelism with nkvo (#7265) 988631335a20d06497f58be0b8ba13adb4323a22 f99e1e456eaf69cc38c1982a2693ce41c0f897ef 2024-05-11T04:13:02-04:00 Steve Grubb server : free llama_batch on exit (#7212) bc4bba364fb96d908f2698e908648df5e6f55e02 c12452c7aec8a02264afc00196a13caa591a13ac 2024-05-08T21:55:49+01:00 agray3 Introduction of CUDA Graphs to LLama.cpp (#6766) b3a995b416e13ae3123a117a743e11d0ede0ca4c bcdee0daa7c5e8e086b719e5eb4073b00df70e01 2024-05-06T18:36:06+03:00 Georgi Gerganov flake.lock: Update (#7079) 9c67c2773d4b706cf71d70ecf4aa180b62501960 952d03dbead16e4dbdd1d3458486340673cc2465 2024-04-30T12:16:08+03:00 Georgi Gerganov ggml : add Flash Attention (#5021) b8c1476e44cc1f3a1811613f65251cf779067636 5539e6fdd1b97e0c37c54d34df67f334fc344a26 2024-04-29T14:40:14-04:00 Clint Herron Extending grammar integration tests (#6644) 6e472f58e40cd4acf6023e15c75a2700535c5f0b 4dba7e8114d84241c842b986e008af8b88d1a019 2024-04-28T00:18:27Z github-actions[bot] flake.lock: Update 7d641c26ac73956a54b204cabefe85c764823678 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 2024-04-26T09:26:59+02:00 Pierrick Hymbert ci: fix concurrency for pull_request_target (#6917) 28103f4832e301a9c84d44ff0df9d75d46ab6c76 c0d1b3e03e27634ac2871761f5033cf9324d472d 2024-04-24T11:08:36+02:00 Johannes Gäßler Server: fix seed for multiple slots (#6835) e9b4a1bf68c18beff4e33f23ea62c1245b296915 5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb 2024-04-21T00:17:47Z github-actions[bot] flake.lock: Update 8cc91dc63c0df397d644a581b2cbeea74eb51ae0 dbceec87c0221ec952e69448df6a71f1372a7487 2024-04-16T14:55:30-04:00 Justine Tunney ggml : add llamafile sgemm (#6414) f184dd920852d6d372b754f871ee06cfe6f977ad 422c2aff1c9735853c9d8f5162104e41a364adc4 2024-04-14T16:55:30+03:00 Georgi Gerganov flake.lock: Update (#6669) b804b1ef77351d2a11be945462c6c251710476cb 8228b66dbc16290c5cbd70e80ab47c068e2569d8 2024-04-11T14:51:07+02:00 Pierrick Hymbert eval-callback: Example how to use eval callback for debugging (#6576) 5dc9dd7152dedc6046b646855585bd070c91e8c8 e11a8999b5690f810c2c99c14347f0834e68c524 2024-04-09T09:16:13+01:00 Carolinabanana llama : add Command R Plus support (#6491) beea6e1b16e783a0886e78dec01002a8c00db24d 87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0 2024-04-08T20:43:30+08:00 Jan Boon llama : save and restore kv cache for single seq id (#6341) b909236c0bf0b6e872af95df9490492ecec310ac e0717e751e12af13f4eedaae8bbbd608e40d7e54 2024-04-07T21:25:30+03:00 Georgi Gerganov flake.lock: Update (#6517) 8120efee1d9931b514aeb5a047209d576f23286c a74401f0e5ebb15fa4d8b6619d1baa6ea9179123 2024-04-04T16:59:04+02:00 Pierrick Hymbert ci: bench fix concurrency for workflow trigger dispatch with sha1 (#6478) 7a2c92637ae265654a68f62e6a7610b358255d3f 4bcd6b959ca3991084ad1d8464caf2a734e29b1d 2024-04-04T11:57:58+02:00 Pierrick Hymbert ci: bench: add more ftype, fix triggers and bot comment (#6466) 08a0c0206075556e82aca0feafad530dcc5f1426 52604860f93063ef98863921da697576af1c7665 2024-04-03T15:07:05+02:00 slaren ggml : mul_mat_id use the same tensor for all the experts (#6387) f87f7b898651339fe173ddf016ca826163e899d8 33a52448061cfd2ea44da9e6cb30b2ec22e2f6d0 2024-04-01T19:05:57+03:00 Georgi Gerganov flake.lock: Update (#6402) b75c38166cf0c66793a32d5c3d6cb69929dd083d bfe7dafc9cf96b9a09ead347fed9a547930fc631 2024-03-29T08:15:00+01:00 Pedro Cuenca convert : allow conversion of Mistral HF models (#6144) 6902cb7f2e3479f364ee177118200fb7e4e9fc92 d2d8f389960a106b66313ff1621bdb1aaaaaa285 2024-03-28T16:50:48+08:00 Eric Zhang server : stop gracefully on SIGTERM (#6348) 557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122) 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 e097633f63fdd26d492844f7eff056e4083fd9eb 2024-03-26T15:21:27+01:00 Kawrakow IQ1_M: 1.75 bpw quantization (#6302) 43139cc528909c3de8c144ed174e09a1f7912a80 2f34b865b62b1d2b5eb8a27885e4de220deeacbd 2024-03-25T17:22:27+02:00 Georgi Gerganov flake.lock: Update (#6266) f482bb2e4920e544651fb832f2e0bcb4d2ff69ab 1997577d5e121568ae39f538021733ccd4278c23 2024-03-23T18:07:00+01:00 Pierrick Hymbert common: llama_load_model_from_url split support (#6192) 1997577d5e121568ae39f538021733ccd4278c23 476b0251b27fb64c575507024a671e639d675594 2024-03-23T18:00:38+01:00 Pierrick Hymbert server: docs: `--threads` and `--threads`, `--ubatch-size`, `--log-disable` (#6254) ee804f6223777019cf921e0d99cc24669313ab98 80bd33bc2c4be352697dc8473339f25e1085d117 2024-03-23T02:15:06+09:00 Minsoo Cheong ci: apply concurrency limit for github workflows (#6243) be07a03217376c53b1d95e5f658adbbbb2831555 d0a71233fbf8ade8ef06ad8e6b81d1d7b254895f 2024-03-22T06:41:24+08:00 Jan Boon server : update readme doc from `slot_id` to `id_slot` (#6213) 2d15886bb092c3b780c676b5cc57ff3337af9c83 d199ca79f279e84ebe27caafe0aa59c461d88969 2024-03-17T06:37:44Z github-actions[bot] flake.lock: Update dc0f6125487dcfbff913360f9d877bc0ccf6aa57 c47cf414efafb8f60596edc7edb5a2d68065e992 2024-03-18T01:12:22+08:00 GainLee ggml:fix finding transfer queue family index error (#6094) 12247f4c69a173b9482f68aaa174ec37fc909ccf 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 2024-03-15T16:41:22-04:00 Andrew Canis llama : add Command-R support (#6033) f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017) 8030da7afea2d89f997aeadbd14183d399a017b9 184215e783dfad76aded2c68244c327a5c507df5 2024-03-12T14:27:20+02:00 Georgi Gerganov ggml : reuse quantum structs across backends (#5943) 05b06210c954491cf0f12034b0a62bd4d69ce78b 83796e62bc9f6caae6228168e359890f51e60fee 2024-03-11T17:49:47+02:00 Georgi Gerganov llama : more consistent names of count variables (#5994) caa106d4e05a0ab94225c220b81f9e2cd522339b 3202361c5b1ba15e695b31209567ef42c22c5c32 2024-03-11T10:56:41+01:00 Xuan Son Nguyen Server: format error to json (#5961) be858f620508385ad12d0e5e862010e666ca729c ef3ced26a3817d92890b97b83acaeb018ade02d0 2024-03-11T07:51:49+01:00 Kawrakow Better 1.5 bit quantization (#5971) fa8a809a9119411bc9c3f00026550d0343f4d9b7 bcebd7dbf62fd7b293d5ed089023e4e733269c71 2024-03-10T18:17:47+01:00 Pierrick Hymbert server: ci: windows build and tests (#5968) c78541479cf835dd9eb568ccd9a2083198a7203d 621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 2024-03-10T16:43:08+02:00 Georgi Gerganov nix: update flake.lock (#5969) d894f352bf433157232dc8dc54eacd50014e898e 098dbaab449f5309a54871ba7e5acef72ae696de 2024-03-09T19:55:54+01:00 slaren perplexity : support using multiple sequences to allow larger batch sizes (#5946) c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328) 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882) 21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862) 67be2ce1015d070b3b2cd488bcb041eefb61de72 231ae28f078c3148d097b301f2145f1e3e816cc1 2024-03-03T14:26:18+01:00 slaren cuda : fix data race in soft max (#5853) 8ef969afcec1645d2d9c3ab1fc82263bba968989 fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 2024-03-03T08:48:36+01:00 Pierrick Hymbert server : init http requests thread pool with --parallel if set (#5836) fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 9731134296af3a6839cd682e51d9c2109a871de5 2024-03-03T06:11:31+02:00 Georgi Gerganov flake.lock: Update (#5842) bbde6eb2561153aabbdfac5001c690fe00cad639 ef2cd694c4155fbf25bae61c5178c47eb3676dba 2024-03-02T17:00:51+02:00 Kawrakow ggml : IQ3_S improvements (#5829) c29af7e2252d288f2ea58a7d437c1cb7c0abf160 38d16b142624bdd7c41d9955752b7f7b59c5e048 2024-03-02T01:00:46+05:30 Sourab Mangrulkar llama : add StarCoder2 support (#5795) 5cb02b4a012bb16c6c699c0c62c05ffa653eee0f 6ea0f010ff6967034528d9e0b8330b9b0f0b7c13 2024-03-01T10:08:08+01:00 Pierrick Hymbert server: allow to override threads server pool with --threads-http (#5794) 5f706718566e3a5147916dc381f3b99de0ffad47 a693bea1e6762a17b78b6ddf4611e54136941ea2 2024-02-24T11:27:36-05:00 UEXTM.com Introduce backend GUIDs (ggml/743) a693bea1e6762a17b78b6ddf4611e54136941ea2 adcb12a9bad87bc96f2f158c95892b3d04aa7ffb 2024-02-28T09:55:37+01:00 Xuan Son Nguyen server : hit Ctrl+C twice to exit (#5734) 7c4263d4261d6ee6f0539d53eb9e1b4d120ba8af cb49e0f8c906e5da49e9f6d64a57742a9a241c6a 2024-02-28T10:37:02+02:00 Kawrakow ggml : make i-quants work with super-blocks of 64 (CPU,Metal) (#5760) 0becb22ac05b6542bd9d5f2235691aa1d3d4d307 c24a2a6e6005e5d424301525a42ba45a4a362d30 2024-02-27T16:34:24+02:00 Kawrakow IQ4_XS: a 4.25 bpw quantization (#5747) c39373398803c669056304090050fe3f44b41bf9 e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 2024-02-25T00:17:11Z github-actions[bot] flake.lock: Update 930b1780269a69948d106e2d1b838ab7661f679a d52d7819b8ced70c642a88a59da8c78208dc58ec 2024-02-25T13:50:32+01:00 Pierrick Hymbert server: logs - unified format and --log-format option (#5700) d52d7819b8ced70c642a88a59da8c78208dc58ec 12894088170f62e4cad4f8d6a3043c185b414bab 2024-02-25T13:49:43+01:00 Pierrick Hymbert server: concurrency fix + monitoring - add /metrics prometheus compatible endpoint (#5708) 9e359a4f47c1b2dceb99e29706c9f7403d32ab5e 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 2024-02-24T19:16:04+01:00 Pierrick Hymbert server: continue to update other slots on embedding concurrent request (#5699) 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 525213d2f5da1eaf4b922b6b792cb52b2c613368 2024-02-24T16:23:52+02:00 Kawrakow IQ3_S: a much better alternative to Q3_K (#5676) 525213d2f5da1eaf4b922b6b792cb52b2c613368 fd43d66f46ee3b5345fb8a74a252d86ccd34a409 2024-02-24T12:28:55+01:00 Pierrick Hymbert server: init functional tests (#5566) 1ecea255ebb70750b52688393f37a63606b90e3f a00a35cef93e057eace8351a667d14d152a91ebc 2024-02-21T15:47:48+01:00 Pierrick Hymbert server: health: fix race condition on slots data using tasks queue (#5634) a14679cc30c785e75d38028bae6ec39c6209ddef 6560bed3f066c876682464762cad90f1e28e3f1b 2024-02-21T11:39:52+02:00 Kawrakow IQ4_NL: 4-bit non-linear quants with blocks of 32 (#5590) c0a8c6db371cb3e4379900867b948879f5842201 b9111bd209c7b11b0592450a6ed2e0ca545b2c84 2024-02-20T08:48:19+01:00 Pierrick Hymbert server : health endpoint configurable failure on no slot (#5594) f0d1fafc029a056cd765bdae58dcaa12312e9879 a0c2dad9d43456c677e205c6240a5f8afb0121ac 2024-02-18T23:38:32-08:00 bmwl ggml : android and old glibc NUMA incompatibility bugfixes (#5557) c145f8a132b2fe1d1e65987faddbd9a40bef7a12 689a091bbe0537ee9abff3e15a1d74f5f3561165 2024-02-18T18:39:57+01:00 Pierrick Hymbert server : slots monitoring endpoint (#5550) e75c6279d1c8e7abb82a331f5de7124eed402de2 36376abe05a12a8cb3af548a4af9b8d0e2e69597 2024-02-18T17:31:28+01:00 Pierrick Hymbert server : enhanced health endpoint (#5548) 66c1968f7a2e895675425e875b6589f1233a1b52 1dcc3fde004787e6fc4d84c9de0bb34cd2901a3e 2024-02-18T08:23:16-08:00 Daniel Hiltgen server : graceful server shutdown (#5244) c8e0d7efeb7634ecc2e9832e879ab9fca4510e71 8f1be0d42f23016cb6819dbae01126699c4bd9bc 2024-02-18T00:17:07Z github-actions[bot] flake.lock: Update f486f6e1e5e9d01603d9325ab3e05f1edb362a95 60ed04cf82dc91ade725dd7ad53f0ee81f76eccf 2024-02-16T01:31:07-08:00 bmwl ggml : add numa options (#5377) 0d4177126b0556e202efb85bf3f768be81076400 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 2024-02-15T09:01:57+01:00 Elbios llava : fix memory management bug (#5491) cf45252a7cfcb998bade46a886e20477cecc538a 03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc 2024-02-13T15:14:22+02:00 Georgi Gerganov tests : multi-thread the tokenizer tests (#5474) 97a336507ed9b971d72262bec7e2b8b7016a054a c88c74f967028ae3d5ebade40ae586d20a961abc 2024-02-11T00:17:31Z github-actions[bot] flake.lock: Update f026f8120f97090d34a52b3dc023c82e0ede3f7d cd9aea63b577a83def84dbd6dcd90a6fa02af745 2024-02-10T02:53:28-08:00 Ian Bull metal : use autoreleasepool to avoid memory leaks (#5437) 4b7b38bef5addbd31f453871d79647fbae6bec8a e00d2a62dd1441e3b089570ec06d05c18800d368 2024-02-10T05:30:19+11:00 Neuman Vong vulkan: Set limit for task concurrency (#5427) e5ca3937c685d6e012ac4db40555d6ec100ff03c e4124c24775f2cb5b3d7acc93bf9dc5471c172ef 2024-02-09T10:48:06Z Paul Tsochantaris llama : do not cap thread count when MoE on CPU (#5419) f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d f68664ac241a6b5c233d8f1051eef20929b06008 2024-02-07T01:15:19-05:00 Justin Parker server : update `/props` with "total_slots" value (#5373) 8a79c591de9b7ff3242a94f68b7fb5a17ed8c2be 31e790322133a4b1d0684527ea446e765e8a96cf 2024-02-06T04:20:59-05:00 Justin Parker server : include total "num_slots" in props endpoint (#5349) 4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb 906cff55c2848fda091d888a1585915ec0c9ea9e 2024-02-06T08:16:23Z Niall Coates server : various fixes for the prompt field in /completion (#5300) 6fdfa2ecc684000a25a4ad91823bc82a6652b645 a2d60c9158435ae9a6f14632f07f1acf7a3becef 2024-02-05T10:46:06+02:00 Kawrakow iq2_xxs: tune quantization (#5320) 9392ebd49ea5ae236a55b47cbf6a13247e8a3b8c 5ed26e1fc9fab4ce96ecf2d84183fe45bdcab0d4 2024-02-04T00:17:24Z github-actions[bot] flake.lock: Update e920ed393d989ed35625ddaf182ebb52cda07fcd 52bb63c7082c859c3f1dfc527227e6a95b299c7c 2024-02-03T18:15:00+01:00 0cc4m Vulkan Intel Fixes, Optimizations and Debugging Flags (#5301) 15606309a05ccf7fadbaad5538cb7c32acb1e06b b2b9f025e7821e78bd501d75d01838c26de07a57 2024-01-31T21:10:15+08:00 JidongZhang-THU llava : add MobileVLM support (#5132) dabcc5b471348e4ae03ddacc41e19ad75fb2f041 f8e9140cb46eebaa867e1184a9946e4840eec772 2024-01-31T13:43:03+01:00 slaren ggml : limit n_threads to the max n_tasks (#5238) 2aed77eb06a329f0d82bb1c467f4244904d4073f c82d18e863fcde91b4b1109b1d0c73ea4470c405 2024-01-29T15:45:41+01:00 divinity76 fix typo "RLIMIT_MLOCK" (#5175) 2307523d322af762ae06648b29ec5a9eb1c73032 0f648573dde61c510560f68244f70ece7e60d8c1 2024-01-28T18:03:59+01:00 0cc4m ggml : add Vulkan backend (#2059) 0f648573dde61c510560f68244f70ece7e60d8c1 b764b8f1d079ba44d912801ce6d29bd0d94d51cf 2024-01-28T21:26:23+05:30 Abhilash Majumder ggml : add unified SYCL backend for Intel GPUs (#2690) b764b8f1d079ba44d912801ce6d29bd0d94d51cf 9241c3a2ace544aef708334e54bbdddb90208ee8 2024-01-28T16:54:54+02:00 Georgi Gerganov flake.lock: Update (#5162) b2b2bf988c098851b4f3831f0cf38394bff75121 af4980bfedfd8df43b9e4cd1442895e85fee37bc 2024-01-28T09:35:14+01:00 Johannes Gäßler Tests for min_p, sampling queue (#5147) 7032f4f6349c17a8352f9f93f7d2122f45469e59 5f1925a8cef81eb9b372faaae34b0dd76d5361d4 2024-01-26T11:17:59-06:00 snadampal ggml : update softmax n_task calculation (#5126) 48c857aa10aea73210a4a72da3f1a6f99269e75d 413e7b0559f922bd4de5e9eec548829d111651b1 2024-01-26T13:42:20+01:00 Xuan Son Nguyen server : refactored the task processing logic (#5065) 5eaf9964fc797d4585c214db32a463d557f3ed33 d292f4f2047963f558dd516f1baaa71793e9acf2 2024-01-26T05:06:22+09:00 l3utterfly llama : dynamic temperature sampling (#4972) bf63d695b804b1c995c7ae4427a8a86936ea6d25 1387ea21178f9f154944013d4dd9764b54c69deb 2024-01-22T03:17:05-07:00 Michael Hueschen nix: add cc to devShell LD_LIBRARY_PATH 780e24a22eb595b705cbe8284771e9ceff1c4dd2 3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea 2024-01-22T21:15:08+08:00 Reinforce-II ggml : parallelize FP32 conversion when using BLAS (#5045) f7276f7500f7ea588836dd1fc6f126334c517878 15bceec2d73d4166340b46b27677c45ac1b4cdad 2024-01-13T17:10:19Z Someone Serge workflows: nix-ci: rebuild on flake.lock updates 7dcbe39d36b76389f6c5cd3b151928472b7e22ff 726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5 2024-01-21T14:42:44+02:00 Kawrakow Add ability to evauate multiple choice tasks (#5047) 942c0107a7301434c0a5e7da46bc4cf2393aa556 b43ebde3b0ccbc42d9dd782b32e2fd8eb35b43b5 2024-01-21T05:17:27+02:00 Georgi Gerganov flake.lock: Update (#5054) 7051aacfac0057fa5fac9ea46c55bffc3892d810 2b3b999cacc7ad1207c32fbdf3479a19c06e1a34 2024-01-19T11:39:11+02:00 Kawrakow winogrande: evaluate log-probs in parallel (#5036) 821f0a271e7c9ee737945245dd7abfa22cc9b5b0 96d7f56d2918ffde1995dbb32392571deb76d7fc 2024-01-18T21:33:05+01:00 Xuan Son Nguyen server : defer tasks when "slot unavailable" (#5018) 96d7f56d2918ffde1995dbb32392571deb76d7fc 2d5419d08ab1131623e6a1d554607b7663435e87 2024-01-18T21:12:15+01:00 slaren llama : fix mlock with no-mmap with Metal (#5025) 3e945cc1e9c06d2001031360e4e303e9548fb02c ad19812cda4062c9f154ef16315df41fbe6a770a 2024-01-18T19:18:21+02:00 Kawrakow HellaSwag: speed up by parallelizing log-prob evaluation (#5020) ad19812cda4062c9f154ef16315df41fbe6a770a 682986a08eb5cb04865d2e713449f17304d266d8 2024-01-18T15:33:01+02:00 Georgi Gerganov perplexity : faster HellaSwag via batching (#5017) 4feb4b33eeb1756e46084a4db9230b279af1a480 959ef0c0df725c013c7f712eaa7790b8e38a8e20 2024-01-16T18:41:42+01:00 Maximilian Winter examples : add complete parallel function calling example (#4974) c37b3474e61d609d43cccc3bde5d559e80e4f5d1 158f8c9e21302114bac3c646f80ea85b52ffa0bd 2024-01-16T19:13:54+02:00 Georgi Gerganov flake.lock: update flake-parts, flake-parts/nixpkgs-lib, and nixpkgs (#4920) 158f8c9e21302114bac3c646f80ea85b52ffa0bd 862f5e41ab1fdf12d6f59455aad3f5dd8258f805 2024-01-16T17:05:19Z Paul Tsochantaris metal : localized logic in `ggml_metal_graph_compute` (#4924) 3a48d558a69c88ac17efcaa5900cd9eb19596ac4 7c8d3abd1a17c28fc56b1a4814bc4b29f91d7454 2024-01-16T14:41:27+01:00 Alex Azarov metal : replace loop of dispatch_async with dispatch_apply (#4934) e0324285a569d0583cf2f4a07a2402221ee25f58 3e5ca7931c68152e4ec18d126e9c832dd84914c8 2024-01-16T12:04:32+01:00 stduhpf speculative : threading options (#4959) bb0c1392479398f9aba86d9ec98db0b95ede6e6d 9408cfdad6b1c090a7e1419d4434edc260b7e47e 2024-01-14T13:26:53+02:00 Georgi Gerganov llama : check LLAMA_TRACE env for extra logging (#4929) df845cc982e7e2ea7b9900e29d55b15338faa78d 6b48ed089377330cdb362970a51c1c89b6d857a8 2024-01-13T17:29:43+01:00 David Friehs llama : minimize size used for state save/load (#4820) 356327feb3f66980ab687040495d722696d98970 ee8243adaa9a9f51ff449213383874e49efe368f 2024-01-13T09:20:46-05:00 Ziad Ben Hadj-Alouane server : fix deadlock that occurs in multi-prompt scenarios (#4905) e7e4df031b9e29d4b55a4e0b0295187f6b213db1 584d674be622fbf1578694ada6e62eebedbfd377 2024-01-12T20:07:38+01:00 slaren llama : ggml-backend integration (#4766) eab67950068e4b125007d027232c47d2a5831cd0 d8d90aa343c22fe01429d3540e47ded87e9dcb9d 2024-01-11T12:41:39-05:00 Behnam M server : add `LOG_INFO` when model is successfully loaded (#4881) 7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b 2024-01-11T02:12:05-05:00 Behnam M server : update readme to document the new `/health` endpoint (#4866) cd108e641dbdedd8c5641c4cec1762f751f38136 57d016ba2d46a6e22517a31a75cebb48f9e234b6 2024-01-10T14:56:05-05:00 Behnam M server : add a `/health` endpoint (#4860) f2eb19bd8bc9f5730d6e05d7a52a9e19bf5ac099 f3f62f0d835d559e80714bbeb05d03125574e3dd 2024-01-03T03:43:19-05:00 Justin Parker server : throw an error when `slot unavailable` (#4741) 5d7002d4372ebf107cfaf46fcd90df27b204f330 26f3071d714f0b27ad7f021a46a66a1085480258 2024-01-02T04:38:15-06:00 minarchist server : add --override-kv parameter (#4710) edd1ab7bc34c10a780ee7f9a4499f7689cdad36d 198ed7ebfc89b8f2b35a8b1655d57bfb57530c1a 2023-12-31T17:42:22Z Someone Serge flake.lock: update 68eccbdc5b56f2a2450f9a8463f9934388cafabf 97bbca6e8522d18041fcde6c3d0907a52ce36446 2023-12-29T06:42:26-08:00 Philip Taron flake.nix : rewrite (#4605) 441f51dca004debf8b275f1bdc08e0f1af7fd8f8 38b3de4658292582a8941a2be5c77b40ce6ac0f2 2023-12-29T19:23:27+09:00 Tamotsu Takahashi ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576) dc68f0054cd279cddddb0cae0c9ef4f9cbaa512a de8e496437c59e7d1cc84109e3e49a3478aee25a 2023-12-26T21:23:59+01:00 slaren cuda : fix vmm pool with multi GPU (#4620) d232aca5a73b290e218a2e48b91023d5e994203f 31f27758faf4a4bd08101a57c7ec3a473f771f86 2023-12-21T21:07:46+01:00 slaren llama : initial ggml-backend integration (#4520) 880e352277fc017df4d5794f0c21c44e1eae2b84 66f35a2f48e1965a13835a523e677223dbf148be 2023-12-21T18:07:34+01:00 howlger py : open merges file as 'utf-8' (#4566) 799a1cb13b0b1b560ab0ceff485caed68faa8f1f fecac45658a99eddc4d6e36ba0310ca8f87a77f0 2023-12-13T13:04:25+01:00 slaren llama : add Mixtral support (#4406) da5eaef1f34d0a1f584cd4a092e7691ea46a9d91 5f6e0c0dff1e7a89331e6b25eca9a9fd71324069 2023-12-06T09:08:17+01:00 stduhpf speculative : support `--color` (#4343) 52c8bc3cf312e1caf02d37bfb9d9d865cbe33594 e4b76bbe316ee50fb17d9ac29e654c0edf830eba 2023-12-05T15:05:51+05:00 MaggotHATE sampling : custom samplers order (#4285) 23b5e12eb5a76489b4c3ee22213a081da68b1809 d208995c6da66f252d4054c1c5a90eb8ccb7a2f7 2023-12-04T17:04:21+01:00 Daniel Bevenius simple : update error message for KV cache check (#4324) 880f57973b8e0091d0f9f50eb5ab4cd4e31582ca 8d6d9f033b8101f929e445cf45b39e1557ca7934 2023-12-01T18:42:11+02:00 Georgi Gerganov llama : fix integer overflow during quantization (#4284) 8d6d9f033b8101f929e445cf45b39e1557ca7934 ef47ec18da469423c276b683dd9b5741cee7023e 2023-12-01T10:41:56+01:00 Daniel Bevenius py : add requirements file for convert-hf-to-gguf.py (#4277) ef47ec18da469423c276b683dd9b5741cee7023e 1d144112c0fbbb4ecc07dbcf4f05a380148bd6de 2023-12-01T10:51:24+02:00 Georgi Gerganov ggml : add ggml_soft_max_ext (#4256) f43f09366dfd018e4568e23a232aaa8c4f7cfc78 d2809a3ba2780e00fce5a6149a7eda09f1c0e906 2023-11-30T17:25:04-05:00 Ziad Ben Hadj-Alouane server : add single-client multi-prompt support (#4232) e2bd725f4b39bc5c6234858d158e01248f5ab5bd 1f5cd83275fabb43f2ae92c30033b384a3eb37b4 2023-11-30T20:50:40Z rhjdvsgsgks py : fix oai proxy (#3972) 8406b0924bf323f37d536dee8b8165c1f3d9d11d b38a16dfcff88d547f78f52d1bea31b84a05aff7 2023-11-28T10:32:03+02:00 Georgi Gerganov ggml : re-enable BLAS for CPU when src0 != F32 + remove redundant full offload checks in llama.cpp (#4240) 9d5949f04b1f8b76184818abbd99938c2020803f ff8238f71d56245f4a6dbea693f4ebd81263464d 2023-11-23T12:34:20+01:00 Daniel Bevenius examples : fix typo in parallel example doc comment (#4181) f23c0359a32871947169a044eb1dc4dbffd0f405 40a34fe8d034bd484efd79ccbb95059ca6308dcb 2023-11-20T11:35:47+01:00 Galunid ci : add flake8 to github actions (python linting) (#4129) 532dd74e38c29e16ea1cfc4e7eedb4f2fab3f3cd e86fc56f7521ca4b18d1d9939e82abd40c2f1c01 2023-11-11T22:04:58-08:00 Richard Kiss Fix some documentation typos/grammar mistakes (#4032) 48ade94538fa509465d71023e49d07aab0ec8cd5 f28af0d81aa1010afa5de74cf627dcb04bea3157 2023-11-05T08:12:13+01:00 slaren cuda : revert CUDA pool stuff (#3944) d6069051de7165a4e06662c89257f5d2905bb156 4ff1046d75e64f0e556d8dcd930ea25c23eb8b18 2023-11-02T18:10:39+01:00 Oleksii Maryshchenko cuda : use CUDA memory pool with async memory allocation/deallocation when available (#3903) 0e40806c1cb3bdf9955ed807ffbe212be85b4c67 a2758d08e44ce3624d233af4d23c6843e2e735b5 2023-11-01T14:42:01-03:00 bandoti common : allow caller to handle help/argument exceptions (#3715) ff3bad83e29e3009010cbc923bebd769055eaa7f 82a6646e0221216c41edcdf99f5a44bb051391f5 2023-10-28T16:41:07+02:00 Erik Scholz flake : update flake.lock for newer transformers version + provide extra dev shell (#3797) 34b2a5e1ee4fe6295fb4420eb91131d743694c65 6961c4bd0b5176e10ab03b35394f1e9eab761792 2023-10-26T22:53:37+03:00 Georgi Gerganov server : do not release slot on image input (#3798) ad939626577cd25b462e8026cc543efb71528472 1717521cdb976a2219888b0e5cba36e210eee9df 2023-10-24T16:10:43-04:00 cebtenzzre server : add parameter -tb N, --threads-batch N (#3584) (#3768) 1717521cdb976a2219888b0e5cba36e210eee9df b2f7e04bd312eaf97eee0523aa09d950d585626b 2023-10-24T23:08:20+03:00 Georgi Gerganov server : do not block system prompt update (#3767) 438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677) 0e89203b517c95ec6675eda75d200a60d1e8921d c67fe68e417f766970fb1feaf2e66458aa24116a 2023-10-18T16:21:57+03:00 Georgi Gerganov speculative : add tree-based sampling example (#3624) c67fe68e417f766970fb1feaf2e66458aa24116a 1117d06607d2d885640ac501f05f0aae5494e2c5 2023-10-18T07:21:48-05:00 Jhen-Jie Hong metal : implement q5_0 and q5_1 kernels (#3648) 2a4bcbacead886996f175f33479d1d874a3e577f 424b6381c4daeed62e6600e0402e72f39845b58d 2023-10-13T12:33:16+02:00 Daniel Bevenius llama : remove n_threads from llama_decode_internal (#3614) a8bdd65525ae86dea905e9866ad369b53e30ac14 70c29da118cdb02bfcbd0376c32b5b2236e48e48 2023-10-11T15:42:22-04:00 Michael Coppola server : add parameter -tb N, --threads-batch N (#3584) a1202a31ed8c35705bd09fe91c3e7410c619bd70 94e502dfb79430870b42b8e8ee132b4aaa93e4a8 2023-10-08T12:21:19+02:00 Johannes Rudolph k-quants : fix comments about block sizing (#3499) 9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 0c731ca4039ccff86ffab90eaae4ca98037c4496 2023-10-06T10:10:13-06:00 Kerfuffle kv cache slot search improvements (#3493) a8777ad84e00cda0399e827cdf971e2c3fab1da2 97af49fa395df77e4c18af0e1655b2fee67c9686 2023-10-06T14:16:38+01:00 pudepiedj parallel : add option to load external prompt file (#3416) e2583cbc29cd7d6d1403f338842c07dfc0467e6c e8b8d32e8663ffc55a02c9721af3a5190382cbb0 2023-10-05T15:57:03+04:00 shibe2 CLBlast: Fix handling of on-device tensor data 7f1a0fe709ea1a861da2f3759f58a28bf8953c12 16bc66d9479edd5ee12ec734973554d4493c5dfa 2023-09-29T03:51:52+08:00 Qu Zongfu ggml : release the requested thread pool resource (#3292) 16bc66d9479edd5ee12ec734973554d4493c5dfa 0512d66670de3f650c579519833c085014b0f200 2023-09-28T21:42:38+02:00 slaren llama.cpp : split llama_context_params into model and context params (#3301) 0512d66670de3f650c579519833c085014b0f200 0e76a8992c8200237bbc6471a53fb8796b3872f7 2023-09-28T19:31:04Z Eve ci : multithreaded builds (#3311) 0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632) ec893798b7a2a803466cc8f063051499ec3d96f7 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 2023-09-28T19:04:36+03:00 Georgi Gerganov llama : custom attention mask + parallel decoding + no context swaps (#3228) 8185710a80531e9ee0c0cb99d3a9c9af1019ab67 7eb41179edc56083ef4eb2df7967ac9ff38b34fb 2023-09-21T10:43:53+02:00 Johannes Gäßler CUDA: use only 1 thread if fully offloaded (#2915) a51b68765799e75e17c7622f376bfbeb66f1bd70 76164fe2e65c058e9ee2c3afd0ad6b182ca57e25 2023-09-15T11:09:24+03:00 Georgi Gerganov metal : relax conditions on fast matrix multiplication kernel (#3168) 4c8643dd6ea1a163bc5979cb69c1e7ab0975bc93 35f73049af6c676a106a5a990a819ae0bc3fcd7d 2023-09-15T00:32:10+08:00 jameswu2014 feature : support Baichuan serial models (#3009) cb6c44c5e045709b6bb5cc9bb8c9be107c771a78 a21baeb12202a9020b48c53beaaf4b355228e8ba 2023-09-08T14:09:21+02:00 Przemysław Pawełczyk build : do not use _GNU_SOURCE gratuitously (#2035) be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af be6beeb8d75294552c4918fce06d7b84eebf3d79 2023-09-07T15:45:01+02:00 Kawrakow metal : parallel RoPE on Metal (#3024) d59bd97065cd7ded6c4ecab54b1d5e0b1b11e318 35938ee3b0c16f1fbbf240dae21e0228864b938c 2023-09-05T09:55:33+02:00 Kawrakow Guard against all weights in a super-block being zero (#3010) 35938ee3b0c16f1fbbf240dae21e0228864b938c 921772104ba2219bfdc2b2980d05ebc0aa0c92a4 2023-09-05T10:46:39+03:00 Georgi Gerganov llama : update logic for number of threads when using BLAS e8d91589258f9204397a7ac5f9b3c857835c98f8 bce1fef328941499dc0acb76cc7fd7ac90449c2f 2023-09-01T11:15:57+03:00 Kawrakow metal: somewhat faster f16 x f32 matrix multiply kernel (#2951) 8341a25957b319a03d4a811176cd5ad7f2b0fbd4 849408957c687cde4ab32c147107f643fc55130b 2023-08-30T08:29:32+02:00 staviq main : log file (#2748) 44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439) 92b1bbd2ec43c82ec0530ba3c8758846c5790c75 dd0dc366dab10e8df28d3924e7f313b5c695e908 2023-08-28T13:23:55+02:00 Johannes Gäßler CUDA: fix RoPE asserts, block sizes (#2833) f55538c3ccba9b926846ef862fa830cea08c433e ebcee207b6058b7f695bb5c203ad87b1066a9790 2023-08-28T10:59:08+03:00 Georgi Gerganov metal : fix memory leak (#2762) c10704d01e21e3dbe4d6ca1026ebff85349dd239 230d46c723edf5999752e4cb67fd94edb19ef9c7 2023-08-27T18:55:41+03:00 Georgi Gerganov llama : fix MPI threads (close #2827) 789c8c945a2814e1487e18e68823d9926e3b1454 c1ac54b77aaba10d029084d152be786102010eb2 2023-08-27T09:03:27+02:00 slaren ci : add LoRA test to CI (#2650) 730d9c681e339b76407659344e5a2cd50af7d7d5 c7d92e6dfec3f54849f3a0ba373054d29f321ea2 2023-08-26T14:13:36-06:00 Kerfuffle convert.py : advanced option (#2753) 38b16dfca6e5032e6cfb90c1653bf1ba4cf647b4 8f8c28e89cb9531211783da697d6e7c445e2af1d 2023-08-24T12:27:25-04:00 Shouzheng Liu metal : bug-fix when enable ggml-alloc (#2757) cf658adc832badaaa2ca119fe86070e5a830f8f6 a192860cfec89a38d59a943623bf595b1fe4495b 2023-08-23T23:08:04+03:00 Georgi Gerganov llm : add Falcon support (#2717) 6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 dadbed99e65252d79f81101a392d0d6497b86caa 2023-08-21T23:07:43+03:00 Georgi Gerganov gguf : new file format with flexible meta data (beta) (#2398) a872a2b28eaefc8d464eaa535c94deeb501666f9 0919a0f73d95cfb93a1646a1d1741a0615fe2c5e 2023-08-17T03:35:53-04:00 Shouzheng Liu ggml-alloc : fix discrepency between measure&eval (#2639) fc8ef549e50087762a0b4f901cd74b2defcc6ae3 bf83bff6742c0f1795b4c18695a13a34ac7adf62 2023-08-16T16:08:28-04:00 Shouzheng Liu metal : enable ggml-alloc (#2627) 9ca4abed893685692f90413e4d43153af12342d9 e59fcb2bc129881f4a269fee748fb38bce0a64de 2023-08-10T13:11:36-07:00 DannyDaemonic Handle `ENABLE_VIRTUAL_TERMINAL_PROCESSING` more gracefully on earlier versions of Windows. 93356bdb7a324a8f6570f99d02af392cd4c45796 60baff7c8584ec369e53469cad5f92e102b1efe4 2023-08-07T14:25:58+03:00 Georgi Gerganov ggml : mul mat tweaks (#2372) f6f9896ac3d2ff207e18f87dab85d126ceef5236 34a14b28ff7f3c98730339bacee035091b2a812a 2023-08-07T10:52:57+03:00 Georgi Gerganov metal : fix out-of-bounds access + inc concurrency nodes (#2416) 5f631c26794b6371fcf2660e8d0c53494a5575f7 415e99fec27be5a2e4283f1937afd17eb33fbd66 2023-08-04T06:37:24-05:00 Stephen Nichols Fixing race condition in server and partial stream handling in frontend. (#2391) 1a941869cbef8e9cc351a6c6987e4ae3b0f021f7 b5472ea0ada081a6e1c06998ebbc9a24aa2cd4a4 2023-07-27T11:00:54+03:00 Georgi Gerganov metal : disable graph concurrency optimization due to bug (#2413) 1aa18ef994a6a2b531434eb13251ef48e56d345b 9a08eaf3c4010962d0126e9e5bfbe9af64b2ac90 2023-07-25T08:00:19-04:00 Shouzheng Liu metal : concurrently dispatch commands (#2358) 57921ca6db53e08eb90010fba99add85be28b5a1 3602ac4255fd4cd589821346290b464a64b955d1 2023-07-23T21:33:02+08:00 wzy common : n_threads == -1 uses std::thread::hardware_concurrency() (#2347) e76d630df17e235e6b9ef416c45996765d2e36fb 1d0824b2476e7fda09751a0235c9e571b76d6f2c 2023-07-23T15:09:47+03:00 Georgi Gerganov llama : grouped-query attention + LLaMAv2 70B support (#2276) 417a85a0010519224cf154eb85d383ffeafeeead 294f424554c1599784ac9962462fc39ace92d8a5 2023-07-20T06:32:22-04:00 Shouzheng Liu metal: minor q4 optimization and reduce code size (#2248) 32c54116318929c90fd7ae814cf9b5232cd44c36 ff5d58faecf1f02b05bd015bdfc6a394cf2bc9ba 2023-07-13T21:58:25+08:00 Howard Su Revert "Support using mmap when applying LoRA (#2095)" (#2206) a7e20edf2266169ccd97a4eb949a593d628fbd64 1d656d6360359cfdaaf5d64ed9690047b600dbcb 2023-07-07T21:23:57+03:00 Georgi Gerganov ci : switch threads to 1 (#2138) 72421402834141df6cbdcf595fe46dbd11874dce 3e08ae99ceb143d67f9273fda47541e9d98ff23f 2023-07-07T18:36:37+03:00 Georgi Gerganov ggml : remove sched_yield() call in ggml_graph_compute_thread() (#2134) 7ee76e45afae7f9a7a53e93393accfb5b36684e1 acc111caf93fc6681450924df9f99679c384c59e 2023-07-04T10:05:27-04:00 Tobias Lütke Simple webchat for server (#1998) 9d23589d638dc74577d5ff880e6d4248b795f12e 0be54f75a6c3e9a09ea71bdfcdabf9a996a0549b 2023-06-27T19:06:33+02:00 Erik Scholz fix pthreads setaffinity usage on android (#2020) b853d456018b10820686362af41b2f2f75f1eec6 9225baef71407d799a6f7f563b77fd7f82791416 2023-06-26T13:57:59-04:00 zrm ggml : add NUMA support (#1556) 6769e944c727c63612dcafbef52009d21ae00fff cbebf61ca7584e9709265395f0127ae7fc0f1882 2023-06-26T19:43:07+03:00 Kawrakow k-quants : support for super-block size of 64 (#2001) 2c9380dd2f77e41149340f3ecb09764d793b16db 051e1b0e6a6e3aee7d989b47760980e6fda5861c 2023-06-17T19:15:02+02:00 Johannes Gäßler Only one CUDA stream per device for async compute (#1898) 794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570) 4bfcc855abdb2c9fcc3c5a84747974521909fa41 6b8312e7979b852f6b6ac9d29cd51fda16c17948 2023-06-15T20:29:48+03:00 Georgi Gerganov metal : parallel command buffer encoding (#1860) e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652) 74a6d922f12ccfe16b0c265f43be8978c6f25e98 e4caa8da59c1c97dc23fa336f4d726984a20560f 2023-06-12T22:39:21+03:00 Kawrakow Metal implementation for all k_quants (#1807) 4f0154b0bad775ac4651bf73b5c216eb43c45cdc ef3171d16241c18581d4d08374f0b9e396ade6b7 2023-06-10T01:59:17-06:00 Kerfuffle llama : support requantizing models instead of only allowing quantization from 16/32bit (#1691) 245fc3c37da5ac5963f9f11a9f4f2ac08d96afc6 72ff5282bf0388c60821f504c4c8cc2b1f491aa6 2023-06-09T10:39:59+03:00 Kawrakow metal : faster q4_0 (#1775) 17366df842e358768c0df7024484fffecfc7865b 44f906e8537fcec965e312d621c80556d6aa9bec 2023-06-06T21:33:23+02:00 Johannes Gäßler Multi GPU support, CUDA refactor, CUDA scratch buffer (#1703) d5b111f53d14972669eb52055f9df2567663ad8b 2d43387dafe9c60f15f57aa23ee0b37864b98b32 2023-06-07T01:00:01+08:00 LostRuins Clblast fixes + enhancements to save VRAM and offload more layers (#1675) ecb217db4fcfa3880300ad08531a5fb6bb142d45 dcb2ed48268e421baf25adc00d602dad0f415564 2023-06-04T23:34:30+03:00 Georgi Gerganov llama : Metal inference (#1642) dcb2ed48268e421baf25adc00d602dad0f415564 d8bd0013e8768aaa3dc9cfc1ff01499419d5348e 2023-06-04T08:12:05+02:00 0cc4m OpenCL: Fix duplication of layers in VRAM and RAM, add GPU mul kernel (#1653) 1fcdcc28b119a6608774d52de905931bd5f8a43d ac7876ac20124a15a44fd6317721ff1aa2538806 2023-05-25T23:07:29+02:00 Johannes Gäßler cuda : performance optimizations (#1530) 7d873811f31d4d8c909015c946a862c0089cda7d 2e6cd4b02549e343bef3768e6b946f999c82e823 2023-05-23T18:01:15+02:00 Maarten ter Huurne Fix handling of "invalid property" when creating OpenCL command queue (#1565) 79b2d5b69d80be0bf29312fb9a95854876b0a8a5 13c351ad7292c5b5ab35db25c7a4f993e75d9cfd 2023-05-14T17:55:02+02:00 xaedes ggml : alternative fix for race condition bug in non-inplace ggml_compute_forward_diag_mask_f32 (#1454) 13c351ad7292c5b5ab35db25c7a4f993e75d9cfd 60f8c361ca26328ef8523dfb08077fe2f1034490 2023-05-14T18:22:50+03:00 Georgi Gerganov ggml : various fixes (#1450) 66841fdb0eaf0cc210757cc7f683d0f4eebadc21 905d87b70aa189623d500a28602d7a3a755a4769 2023-05-13T16:48:03+03:00 Georgi Gerganov ggml : multi-thread mul and diag_mask ops (#1428) 905d87b70aa189623d500a28602d7a3a755a4769 f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b 2023-05-13T15:38:36+02:00 Johannes Gäßler ggml : GPU-accelerated token generation (#1412) f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b f048af0230ad5381bb20b9e3c1467ec6fc7debdf 2023-05-13T14:56:40+02:00 xaedes ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360) b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1 b608b55a3ea8e4760c617418538465449175bdb8 2023-05-12T00:23:08+03:00 Georgi Gerganov ggml : remove bit shuffling (#1405) 58b367c2d757c0ea12aec672382462b42204c724 ea3a0ad6b6b5ca4693b94acd4cb32e2803f66fae 2023-05-01T18:11:07+02:00 slaren cuBLAS: refactor and optimize f16 mat mul performance (#1259) ea3a0ad6b6b5ca4693b94acd4cb32e2803f66fae 2bdc09646d8c6cb74a6f573e9081586b4b83b9d1 2023-05-01T08:58:51-04:00 xloem llama : update stubs for systems without mmap and mlock (#1266) a5d30b1f53677cb50791fec41c43e93274347303 76a884920aa1d2fc0dc7a7ac12dfc5ec5816377c 2023-04-30T14:41:35-04:00 jon-chuang common : better default number of threads (#934) 7296c961d9303010a2b98379f738da2a8a55aa1b 78ec543733d10a1629f984fd0302fdaa4e87fe66 2023-04-28T16:57:16+02:00 0cc4m ggml : add CLBlast support (#1164) 7a32fcb3b29f4db8aed8a85dc58eb958fb118153 dd0eabc049fb1efc631cab8eb0a646808d704e18 2023-04-25T23:40:51+03:00 Georgi Gerganov ggml : add Q8_0 quantization format (rename the old one to Q8_1) (ARM NEON) (#1179) 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 25d7abbd1f73582b7e0fdc422a936e8541c0780b 2023-04-21T21:59:17+02:00 slaren Improve cuBLAS performance by using a memory pool (#1094) 018f2279f5fe3ef743bd8254b23ea8f0efae7e73 9411288271ab548216902a029f42a0a38ebcedb7 2023-04-22T02:27:06+08:00 源文雨 cmake : link threads publicly to ggml (#1042) 1bfc153e2f35ddd9d64b084e8d1a5e6fa57ad1c9 3d59769c3bb7e72c915646ddb1e239b1face19f5 2023-04-21T17:18:26+02:00 Kawrakow ggml : a faster version for Q4_1 x Q8_0 dot products (#1083) 38de86a7114c97ecf3644e3a60159f1ed893e1b0 e0305ead3a072db9c08b35c9600c49273b38a4b5 2023-04-20T19:42:27+02:00 Kawrakow llama : multi-threaded quantization (#1075) f7d05095b404b5500b4a702ea16f67fc22446e49 884e7d7a2bfd7325b107442d6758983f5886ed3d 2023-04-19T20:20:14+02:00 Kawrakow Q4_2 quantization with rmse-optimized scale and quants (#1062) 66674012389f9537140044290f8517bc4a5e0b74 77a73403ca8eaced2590559d0f9cebd2b3649d32 2023-04-19T00:53:24+02:00 slaren Multi-threaded ggml_cpy (#1035) 77a73403ca8eaced2590559d0f9cebd2b3649d32 50a8a2af97cb92e53e7a3195aa201c3d87da5415 2023-04-18T23:54:57+03:00 Georgi Gerganov ggml : add new Q4_2 quantization (ARM only) (#1046) 723dac55fa2ba7adc6e3fc8609781d1ad0378906 0f07cacb05f49704d35a39aa27cfd4b419eb6f8d 2023-04-14T00:03:03-07:00 comex py : new conversion script (#545) a3a2a0eda8828b60436e9f69d9ac2c1060d03e7a d990e3fffc5b0f5448e90a16c79a4f2675100af0 2023-04-13T18:36:40+03:00 Georgi Gerganov ggml : add GGML_DEFAULT_N_THREADS 95ea26f6e92d620a5437f576b80868aee7f808d6 82d146df9b43cf677e0dbce20b03cf864958a0cc 2023-04-13T14:46:23+02:00 SebastianApel benchmark : add tool for timing q4_0 matrix multiplication (#653) 2663d2c6784ad7b77998c6874df25648d597f74b a0caa34b162449b5c13b8d604573053300ff54a1 2023-04-11T06:19:54-07:00 comex Windows fixes (#890) f963b63afa0e057cfb9eba4d88407c6a0850a0d8 aaf3b23debc1fe1a06733c8c6468fb84233cc44f 2023-04-08T12:24:37-07:00 comex Rewrite loading code to try to satisfy everyone: eeaa7b0492fc79baab8bb1fe195d6c87159f2bd3 986b6ce9f99503c51ec5afd8a10baa32359434c6 2023-04-05T22:11:03+03:00 Georgi Gerganov ggml : multi-thread ggml_rope() (~3-4 times faster on M1) (#781) 6f23ba5ee235cbcb1eedd63b98422dd8d4392a78 78ca9838ee36660a776e97e3391b6fb5dcaacf7f 2023-03-30T01:53:36-07:00 Justine Tunney Ensure --mlock works properly with mmap() support 78ca9838ee36660a776e97e3391b6fb5dcaacf7f a017390358cdb23fffb30988dc84bb190d0403ca 2023-03-29T13:51:37-07:00 Justine Tunney Make loading weights 10-100x faster 41318d708ed196ff727dce14d263a64b23c7333d a6956b25a1c783e5e96fe06c9c00438f846ef047 2023-03-29T18:10:07+02:00 Maël Kerbiriou llama : use the same threshold for OpenBLAS and ggml thread limiting (#577) c1f885067c61191a07a1aedf684168dda62f3f71 e0670260fb50a882b37074112b1881fb0820cf77 2023-03-28T15:56:03Z Stephan Walter ggml : introduce structs for the q4 data blocks (#356) ecbe466a364876927994e2f1ec14f4d82301d201 502a400192013d3e95ed87b777e8fa3bec45713c 2023-03-25T19:47:21+02:00 Georgi Gerganov Retire the ggml_mul_mat() branch for transposed src0 (#500) 4640eff23d341a0273587800e17ff4a378132d60 ab77d7631211b299cb734bea6ad1f74324154150 2023-03-25T17:03:10+02:00 Georgi Gerganov Don't interefe with BLAS for large prompts by running only 1 thread 563cdc391dde140f1084d1012234e8e6f57f881f 8d4a855c241ecb0f3ddc03447fe56002ebf27a37 2023-03-24T08:19:05-07:00 comex Support calling mlock() on loaded model data on Linux and macOS (#453) 483bab2e3d4a868fe679d8bb32827d2a4df214dc 404e1da38ec8025707031a8027da14dc1590f952 2023-03-23T23:22:01+02:00 Georgi Gerganov Avoid the transposed X branch in the Z = X * Y matrix multiplication (#439) ae44e23ee36c02da0e37ab508a4b473ace724f8e 928480ef5b7b03d7a07e98286aebe3d8b24457d9 2023-03-22T07:47:15+02:00 Georgi Gerganov When seed <= 0 - use the clock to generate one 2e664f1ff413995506c9a54f3a8d5b8c64e37a91 8cf9f34eddc124d4ab28f4d2fe8e99d574510bde 2023-03-21T07:35:42-07:00 Casey Primozic Add initial AVX512 support for dot product on Linux (#320) 7392f1cd2cef4dfed41f4db7c4160ab86c0dfcd9 ad5fd5b60cfdfbfb22b0f2bc9e9f6c9692768f8d 2023-03-19T12:38:44-06:00 Suaj Carrot Improved quantize script (#222) 4f546091102a418ffdc6230f872ac56e5cedb835 e81b9c81c101f64531ef0fa1ee6b77d562635652 2023-03-17T21:46:46+02:00 Georgi Gerganov Default to 4 threads (#243) 367946c668757532deed929e1d78673c6ac6bcb8 6b0df5ccf360fe5c015f6607f0375bfc6849005e 2023-03-17T17:47:35Z Stephan Walter Don't tell users to use a bad number of threads (#243)