108 KiB
108 KiB
| 1 | f131bf1908b8c5dd1f49d7ae7f616506fc471666 | 33d96dae28e17208ef61a71dba40cda3c04f135a | 2026-05-27T09:38:51+08:00 | wangbomeng | fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE | |
|---|---|---|---|---|---|---|
| 2 | 2716130010c58f1cdd9d94f0e2f8e047bc92dc66 | b35bda124ccd4ed581dd6088d3ffa4931c2809b6 | 2026-05-18T08:40:54+08:00 | Yunzhe Jia | fix n_ctx_slot error by adding runtime capacity loading for cal-llm | |
| 3 | ecf01a17651cd7b1e8b85fd6075e83831463ee23 | 99d2078e89305035d87d966cee7987c7d50b3925 | 2026-04-09T09:47:55+08:00 | Yunzhe Jia | fix n_parallel problem | |
| 4 | 1f5accb8d0056e6099cd5b772b1cb787dd590a13 | 2759ccdb4adc8568add4316780d5e675519b0775 | 2025-11-04T05:04:59Z | Noah | Fix garbled output with REPACK at high thread counts (#16956) | |
| 5 | bcfa87622ae46be6345a8e3dfdbdc5ba5414042b | a2054e3a8ff0da3978a4acc18c349ff58554d336 | 2025-11-03T00:41:08+01:00 | Sascha Rogmann | feat(webui): improve LaTeX rendering with currency detection (#16508) | |
| 6 | cd5e3b57541ecc52421130742f4d89acbcf77cd4 | 87c9efc3b297b8a498716b1db3d061842e6fc85b | 2025-11-02T18:14:04+02:00 | Georgi Gerganov | server : support unified cache across slots (#16736) | |
| 7 | 2f68ce7cfd20e9e7098514bf730e5389b7bba908 | e4a71599e5846110159955dec0008eb4aa24222b | 2025-11-01T19:49:51+01:00 | Pascal | webui: auto-refresh /props on inference start to resync model metadata (#16784) | |
| 8 | d3dc9dd898be805c23a408cc36daed5b3bf29221 | bea04522ff1a0d8559ccfd353aa018dcfbb608cc | 2025-11-01T06:13:26+01:00 | Oliver Simons | CUDA: Remove unneded bias/gate dims in fused mmvq (#16858) | |
| 9 | 0de0a01576772032008a689afc4d7c80685074c4 | e58d585604bbbbbc24f8149effe444621b5191c6 | 2025-10-31T21:20:47+01:00 | Piotr Wilkin (ilintar) | model : Minimax M2 (#16831) | |
| 10 | b52edd25586fabb70f0c21b274473b307cf14499 | 517b7170e1a4d733583c4b07c5b7a49acc05911c | 2025-10-30T18:42:57+02:00 | Georgi Gerganov | server : remove n_past (#16818) | |
| 11 | 8b11deea4663f29d3e042ce1056ba643264cd5f1 | b9ce94017729465895402cbcfffb51fa926c15e3 | 2025-10-30T04:34:15+01:00 | Oliver Simons | Hide latency of bias and gate-loading (#16847) | |
| 12 | b9ce94017729465895402cbcfffb51fa926c15e3 | 3464bdac37027c5e9661621fc75ffcef3c19c6ef | 2025-10-29T15:13:10-05:00 | Jeff Bolz | vulkan: Fuse rope+set_rows (#16769) | |
| 13 | bcf5bda6f5df559565d11d7c8e8295c1159a85ec | 3eb2be1ca5f37480aeb16102970d9e65f43347fe | 2025-10-29T14:39:03+01:00 | Ruben Ortlam | Vulkan MMQ Integer Dot Refactor and K-Quant support (#16536) | |
| 14 | 3eb2be1ca5f37480aeb16102970d9e65f43347fe | e41bcce8f0b53032a1fed275cd253e931c041cf6 | 2025-10-29T06:29:12-07:00 | Max Krasnyansky | Hexagon Op queue & dispatch optimizations (#16820) | |
| 15 | 338074c383c81366320d176d83b94b0a567ee0c2 | 851553ea6b24cb39fd5fd188b437d777cb411de8 | 2025-10-29T08:14:39+02:00 | YaelLogic | sycl: add RMS_NORM_BACK operation support (#16808) | |
| 16 | 85a7d8677bf2200981e52f744a21d5267964ffcf | a8ca18b4b815a2abdbecb958ee5f4c542d69aac7 | 2025-10-28T20:19:44+02:00 | Georgi Gerganov | memory : remove KV cache size padding (#16812) | |
| 17 | 1c1409e13169d0ced4b1b4d39fb5b268b7525091 | 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e | 2025-10-28T03:51:41-07:00 | Sam Malayek | embedding: add raw option for --embd-output-format (#16541) | |
| 18 | 3479efd112b3910d2d008ad08fe4cb4895605903 | 463bbf20bfbe0da10ac58984d4d62bed5a49362a | 2025-10-28T10:54:53+08:00 | Chenguang Li | CANN: Improve device ID handling and aclnnArange checks (#16752) | |
| 19 | ad8d36beffd791db10c94eb9e964afb891e3ca55 | c053e18a66dd95dc340aa61317877c2a41d4e3cf | 2025-10-28T03:50:33+02:00 | tamarPal | sycl: add SSM_CONV operation support (#16800) | |
| 20 | 5a4ff43e7dd049e35942bc3d12361dab2f155544 | 10640e31aab0819f31c1e1f2d008b019ee737232 | 2025-10-27T13:51:28-07:00 | Diego Devesa | llama : disable pipeline parallelism if compute buffer allocation fails (#16748) | |
| 21 | 55945d2ef51b93821d4b6f4a9b994393344a90db | 0bcb40b48c6fc6f17ba9672625e526ab2574344b | 2025-10-25T03:39:37+08:00 | leejet | ggml: fix CUDA grid launch condition for large block_nums.y in binbcast (#16742) | |
| 22 | fe6a9882acf5c02f96624ed8f80144100d7006cb | 061f0eff02dc9a82f7bd850db3bd70b8a0b5e87a | 2025-10-23T17:07:31+05:30 | Prajwal B Mehendarkar | Manually link -lbsd to resolve flock symbol on AIX (#16610) | |
| 23 | 9de9672adb0f4ca4e39483ac3ffed52b3f70a55d | 63d2fc46e17a06be5b4b5823a5ada088317f1f0a | 2025-10-22T20:05:15-05:00 | Matthew Michel | sycl: use async memory allocation to fix crashes during graph recording (#16644) | |
| 24 | d8eaa26e4d9228df3aa46a930db60c8eaab67c1b | 9285325ce0174631c3cd6121d56084adc4ef2d8f | 2025-10-22T12:01:22+02:00 | Acly | tests : fix test-thread-safety when compiling with multiple backends (#16699) | |
| 25 | 6de8ed75196c7cd98c1f34bbf3a7452451ba8ac2 | 84bf3c677857279037adf67cdcfd89eaa4ca9281 | 2025-10-21T01:21:12+03:00 | YehuditE | sycl : add PAD_REFLECT_D1 operator support (#16145) | |
| 26 | 13f2cfad4170c096c51a02c24a6a158cb47f1480 | 06332e28672356b964d6dfc2ba4657e20581cd43 | 2025-10-20T12:41:13+02:00 | Aleksander Grygier | Enable per-conversation loading states to allow having parallel conversations (#16327) | |
| 27 | 06332e28672356b964d6dfc2ba4657e20581cd43 | 72d53e6c4decee8b339e49aed8cc0e234b9639dc | 2025-10-20T16:27:09+08:00 | takuya kodama | llama-batch: fix build fails with `-Werror=missing-braces` (#16614) | |
| 28 | 342c728d031d50673feded797520a44127d73379 | ababae7e1ec3e9cfdab0322ee55ea3389e82a4d5 | 2025-10-17T18:01:23+08:00 | muggle-stack | ggml : fix SpaceMit IME array out-of-bounds in task assignment (#16629) | |
| 29 | 9ad4f1931ee0f3b41d9355245ef744786aaae0aa | 79967ec596c0dacfd2251b085a57e79df292b1cc | 2025-10-17T02:33:58-04:00 | Ilia Ilmer | metal : add `CONV_TRANSPOSE_2D` (#16542) | |
| 30 | 683fa6ba4ed3a23b939d3e11e6dc860bd47a0ccf | b22572e97dc51757d3ebe917a5a283385010ec68 | 2025-10-16T16:28:41+02:00 | Pascal | fix: added a normalization step for MathJax-style \[\] and \(\) delimiters (#16599) | |
| 31 | 6f5d924637a15abedb111cbbffd7da5f31c81855 | adc9b60f190c1016a09f439862fa1cbb302262ac | 2025-10-16T01:11:33-04:00 | takasurazeem | common : Update the docs on -t --threads (#16236) | |
| 32 | adc9b60f190c1016a09f439862fa1cbb302262ac | ee50ee1eadff58777ae746827b04de7ba0befc55 | 2025-10-16T13:10:32+08:00 | takuya kodama | ggml-cpu: replace putenv with setenv for const-correctness (#16573) | |
| 33 | 7ea15bb64c81e3813eb0babf9a57e1bc5697f569 | 9c7185dd28416cf67f5e3b268381f311b5e3da56 | 2025-10-14T07:51:36-05:00 | Jeff Bolz | vulkan: Improve build time for MSVC (#16545) | |
| 34 | 1fb9504eb744969a990bfe4cfcf1d3d7a479541c | 3f750f8d760ab5a61491e6a9409072dfeee4b4d7 | 2025-10-13T10:55:32+02:00 | Pascal | fix: add remark plugin to render raw HTML as literal text (#16505) | |
| 35 | f9bc66c3ebcfddb5f09e4b21253623caeb8e414a | a31cf36ad946a13b3a646bf0dadf2a481e89f944 | 2025-10-13T08:52:22+08:00 | hipudding | CANN: Update several operators to support FP16 data format (#16251) | |
| 36 | d00cbea63c671cd85a57adaa50abf60b3b87d86f | 8328fd4bae76fc027f8ca0e9a05acd3788dabe3f | 2025-10-09T18:54:51+03:00 | Georgi Gerganov | server : host-memory prompt caching (#16391) | |
| 37 | e08db4259521de493b7aeb49dadf29ebd1ee966a | 12bbc3fa50b6df03318a4451c9a2210200a0b28d | 2025-10-09T08:39:18+02:00 | Saba Fallah | model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367) | |
| 38 | 12bbc3fa50b6df03318a4451c9a2210200a0b28d | 9d0882840e6c3fb62965d03af0e22880ea90e012 | 2025-10-08T22:18:41+02:00 | Pascal | refactor: centralize CoT parsing in backend for streaming mode (#16394) | |
| 39 | b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e | 7fdd16b432d247121fe5fe7b21f8805f85266c85 | 2025-10-08T10:57:53+03:00 | Georgi Gerganov | metal : mark FA blocks (#16372) | |
| 40 | 74b8fc17f92ada295a648e3c5eb28f46bca7d892 | aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e | 2025-10-07T13:48:56-07:00 | Reese Levine | ggml webgpu: profiling, CI updates, reworking of command submission (#16452) | |
| 41 | 1d6092fc72f4d10f4486ac95edfd414bc08b62b8 | 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f | 2025-10-07T08:22:35+03:00 | Georgi Gerganov | tests : add -INF blocks to the KQ mask in the FA tests (#16380) | |
| 42 | ca71fb9b368e3db96e028f80c4c9df6b6b370edd | 35266573b968e1c947b367782fb4b3eddbb4f3c0 | 2025-10-05T06:57:47-06:00 | Gabe Goodhart | model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206) | |
| 43 | 35266573b968e1c947b367782fb4b3eddbb4f3c0 | 86df2c9ae4f2f1ee63d2558a9dc797b98524639b | 2025-10-04T20:59:31-07:00 | Reese Levine | ggml webgpu: actually add softmax, fix rms_norm offset (#16400) | |
| 44 | 86df2c9ae4f2f1ee63d2558a9dc797b98524639b | f39283960b58a92ecc0c72567711318b20e22b55 | 2025-10-04T20:04:27Z | Eve | vulkan: use a more appropriate amount of threads when generating shaders (#16418) | |
| 45 | 0e1f83855609d73beaf05d818640b6cfd39d287b | ad126479c25cf983a0f994a08ba0911cf49ed62b | 2025-10-03T04:52:46-05:00 | Jeff Bolz | vulkan: Fix FA coopmat1 invalid array indexing (#16365) | |
| 46 | d64c8104f090b27b1f99e8da5995ffcfa6b726e2 | ef07a4090672a3438d7f64f197795d7dc1c18957 | 2025-10-02T20:10:12+02:00 | Sigbjørn Skjæret | test-barrier : do not use more threads than physically available (#16389) | |
| 47 | 2a9b63383a448ec18c754dfdc6e95cb853940a52 | 1104ca1a1c926b832274694a2773a17066982ad0 | 2025-10-01T15:54:42+02:00 | Aleksander Grygier | Improve code block color theming (#16325) | |
| 48 | f1eb1cb1eba042b2d583234e80f65e2e225d8995 | de41f2b7bffab7582944b213ce12b605f8cf6e0f | 2025-09-30T09:07:20+02:00 | Charles Xu | kleidiai : fix work size and threads sync for fp16 (#16246) | |
| 49 | 5f7e166cbf7b9ca928c7fad990098ef32358ac75 | d72f5f7ba260b546190338b0b76f2f152581424f | 2025-09-29T18:49:47+02:00 | Pascal | Fix thinking blocks with quotes + add handling `[THINK]...[/THINK]` blocks (#16326) | |
| 50 | c0bfc57af421f8fd63c946c13b7666aed82560e2 | 75a3a6c2cd0002ba40e2dcc92007bc9fdbc69f1a | 2025-09-28T00:49:32+08:00 | Aman Gupta | CUDA: mul_mat_id for mmf for bs <= 64 for f16 and bs <= 32 for f32 (#16277) | |
| 51 | 624207e676ab5eb3ce7af631902bb45fb73a8359 | 807e8c6d310952f2f5656afc63dab9d7083dcb5c | 2025-09-27T02:03:33+08:00 | Aaron Teo | devops: add s390x & ppc64le CI (#15925) | |
| 52 | 9b26511857ac09ae69ab485168fe2d3ee5fb1d6e | 00217cd41388328c93e9e9644921c4319bb03bcc | 2025-09-26T18:27:25+08:00 | Aaron Teo | ggml-cpu: implement MXFP4 SIMD for s390x (#16193) | |
| 53 | a86a580a6692edd1da076d5422f944c344b4fe5e | 0f7c69689f4e681948a6005adea9bee9c08ff903 | 2025-09-26T08:56:38+08:00 | R0CKSTAR | musa: upgrade musa sdk to 4.3.0 (#16240) | |
| 54 | 0f7c69689f4e681948a6005adea9bee9c08ff903 | 835b2b915c52bcabcd688d025eacff9a07b65f52 | 2025-09-26T08:56:10+08:00 | R0CKSTAR | musa: fix build warnings (#15611) | |
| 55 | f2a789e33490deb483a2694b066b37e45524bb79 | 3a599719673c850647e3bb911ed6d91109bb91d2 | 2025-09-24T16:17:49+02:00 | Acly | ggml : split graph allocations according to backend max buffer size (#15815) | |
| 56 | 3a599719673c850647e3bb911ed6d91109bb91d2 | 63b54c81a620981be020184ab99e63a8e50e47cb | 2025-09-24T13:42:26+02:00 | Tarek Dakhran | model : add label for LiquidAI LFM2-2.6B model (#16204) | |
| 57 | 1eeb523c3e0c7ffbd59469f5463dcbdecba3535e | 5bb4a3edec297e74b0f7bd4ed5d0fdd12e28d858 | 2025-09-21T08:31:55+02:00 | Giuseppe Scrivano | vulkan: optimize UMA buffer operations and fix driver hangs (#16059) | |
| 58 | 69ffd891631befa9e6b485fd646a16dab4f2c007 | 246c0d9c795fb25da8268625d597580155a3672f | 2025-09-18T23:07:26+02:00 | Adrien Gallouët | ggml-amx : fix ggml_amx_init() on generic Linux (#16049) | |
| 59 | d304f459d8619399eb232b1e3689379306f439d3 | 0320ac5264279d74f8ee91bafa6c90e9ab9bbb91 | 2025-09-17T13:09:40-07:00 | Reese Levine | GGML WebGPU: Support for ADD, MUL, RMS_NORM, GET_ROWS operators (#16018) | |
| 60 | cd08fc3ecc0264b4414b68af3874a6c689ed60c1 | cb5bb6cc05119c24e7711ca2956cd0e6d409d396 | 2025-09-17T01:08:02-07:00 | David Ribeiro Alves | common : Fix corrupted memory error on json grammar initialization (#16038) | |
| 61 | d5fabe3682de515fd09d6c981f7a0d1b75614455 | 8ff206097c2bf3ca1c7aa95f9d6db779fc7bdd68 | 2025-09-17T14:33:08+08:00 | Chenguang Li | CANN: Optimize ggml_cann_set_device (#15935) | |
| 62 | f161463a54d9f93d41246286aa4a9569a91d804d | 84d7b2fca11d1be118ce776f6d72a486c4883b74 | 2025-09-13T13:54:28+03:00 | Georgi Gerganov | metal : allow ops to run concurrently (#15929) | |
| 63 | 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 | 33daece86b65607451d0d4378d2d04ba6a20ad55 | 2025-09-10T17:52:35+03:00 | Georgi Gerganov | metal : make the backend async (#15906) | |
| 64 | a972faebed5fdc4a3d2a844d92d476058c02e02d | 550cf726e133fd0a069d991287fd3a2a3e3e1cbd | 2025-09-09T14:38:02+08:00 | Aman Gupta | CUDA: Add mul_mat_id support for the mmf kernel (#15767) | |
| 65 | e68aa10d8f3d26fdad5b912540362d79de5460e3 | 0a16bf52e6874369cb4fd2bdc4863ef984b688e7 | 2025-09-08T13:10:07-05:00 | Jeff Bolz | vulkan: sort graph to allow more parallel execution (#15850) | |
| 66 | b0d52998b962bd2681c34bf52af993af79f178b8 | f28d4f4ac963f182ea9d0fe9e269f3f5f3782aaf | 2025-09-08T13:56:51+03:00 | Georgi Gerganov | cuda : fix supports_op condition for get_rows when number of blocks is too large (#15868) | |
| 67 | fd621880f3fd908424e675a41715a2dc760247a2 | 4281c7b315f8a904549fe527039b976e08098d1a | 2025-09-05T17:32:39-06:00 | Gabe Goodhart | aLoRA Support (#15327) | |
| 68 | d1e2adba65208d6de3d7f6f23b00c562ff5bb777 | c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 | 2025-09-04T15:40:44+02:00 | Daniel Bevenius | llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791) | |
| 69 | c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 | a68d9144262f1d0ef4f6ba7ad4a7e73e977ba78c | 2025-09-04T20:20:14+08:00 | Chenguang Li | CANN: Refactor ND to NZ workspace to be per-device (#15763) | |
| 70 | 661ae31c9c68201577e70278285b349a5a662caf | 407c23786dd0d3a503e9429eead96e611d3950c9 | 2025-09-03T19:59:16+02:00 | Oliver Simons | CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715) | |
| 71 | 02c1813517412f3e00aa6ca7c0273fea64edb492 | 77dee9de97be75b7143a213bc48893e0c0b29af7 | 2025-09-01T16:19:07+02:00 | Ruben Ortlam | Vulkan: Add Integer Dot Product mul_mat_vec shader for legacy quants (#14903) | |
| 72 | 0d161f021aa33ec0e90cce96f5d1a88925557327 | 4efd5a83163ff383285b3a4c2106feabf5c69557 | 2025-08-31T20:11:58+03:00 | Georgi Gerganov | server : enable /slots by default and make it secure (#15630) | |
| 73 | c37052ab4d6d1ae73c0e90bc6e560cc6409e1311 | 5c16b9c87d840e4d5d55fa83c732c6b693346f40 | 2025-08-31T02:06:43-05:00 | Jeff Bolz | vulkan: mul_mat_id coopmat2 optimizations (#15546) | |
| 74 | 792b44f2ed9668cce7f267ff0ae4950ed9b4a5de | 81017865ee444cf49ce0136f2be1e41a0270ff91 | 2025-08-29T19:25:40+02:00 | ExtReMLapin | server : add documentation for `parallel_tool_calls` param (#15647) | |
| 75 | e8d99dd0b67f2ecc1e45fca8074a3a18c3e036d2 | a8bca68f727844e7dcf24a956003b3c2039ea563 | 2025-08-28T18:39:31-06:00 | Gabe Goodhart | nvidia nemotron nano v2 (nemotronh) (#15507) | |
| 76 | c8d0d14e77c3c45df5cbbddde9c2b4c377ec4e7a | 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 | 2025-08-28T17:09:05+03:00 | Georgi Gerganov | kv-cache : fix find_slot to not search for continuous slot (#15638) | |
| 77 | 64387f6e95434b393ac3df285864692b7fd9c4d2 | d35a1e8c41f747548775225973a99507896a8c61 | 2025-08-28T10:56:41+02:00 | Aleksei Nikiforov | gguf-py: byteswapping improvements (#12851) | |
| 78 | a6a58d64785cb458ed9de52f391aa38142d38d64 | 0373486dbc0dccbdcb3b5fdd65759d88cec06196 | 2025-08-26T21:05:25+05:30 | shalinib-ibm | llamafile: PowerPC Sgemm Optimization (#15558) | |
| 79 | 0115cfb7c1dec0753aecb34f3af4338bf9de8eeb | 3a617cb18121a85eed17ac5585788810c5d9c1e0 0d5a470223fc90b6b6807921d68011ff06ae7f9e | 2025-08-26T15:19:56+08:00 | Yunzhe Jia | Merge branch 'master' into dev | |
| 80 | 5eff6ec9b1220b599a43b594b1110487ab6aca08 | dfd9b5f6c7586c88588f06a644c131bec071a0a1 | 2025-08-25T17:23:40+02:00 | Johannes Gäßler | CUDA: MoE helper in device code, better tile sizes (#15525) | |
| 81 | 611f419cff11e4952228162a1c44cb35dff2274a | b1afcab804e3281867a5471fbd701e32eb32e512 | 2025-08-23T13:16:17-05:00 | Jeff Bolz | vulkan: optimize rms_norm, and allow the work to spread across multiple SMs (#15281) | |
| 82 | b55f06e1aa67fb10e89f53e31bbccf37eb2678ea | 0a9b43e507a359ca392c037cf341f55137ad0b69 | 2025-08-23T14:58:57+08:00 | R0CKSTAR | vulkan.Dockerfile: install vulkan SDK using tarball (#15282) | |
| 83 | 330c3d2d21b55bca5517db7d2eea2ea8f131df4a | e92734d51bcb82cc35f0a6b5a14928f0036b2c90 | 2025-08-23T01:31:54-05:00 | Jeff Bolz | vulkan: optimize mul_mat_id loading row ids into shared memory (#15427) | |
| 84 | 8ad038c0fdc719ced9fbf921a02cbae9ad79287f | 5682a3745f2b653dcb855d5766d8edc318fb3336 | 2025-08-21T11:06:05+08:00 | R0CKSTAR | musa: add GGML_UNUSED_VARS (#15446) | |
| 85 | a094f381432d92c4bf92d2d6167284316ba73a62 | fb22dd07a639e81c7415e30b146f545f1a2f2caf | 2025-08-20T10:17:37+08:00 | R0CKSTAR | musa: fix build warnings (#15258) | |
| 86 | 67f09a3a27db443f9870aac87e163dba0d08131e | 6424594c56f4dbd0573455d89a0d89a0ac093d13 | 2025-08-19T18:33:47+08:00 | R0CKSTAR | musa: handle __hgt2_mask, available starting from MUSA SDK rc4.3.0 (#15413) | |
| 87 | 00f35d509e5367bf19ccaf4b4adddc38db4811c6 | 6028bf74351d35a06bd98498624f8c2f029f7d1a | 2025-08-13T11:09:39+03:00 | Georgi Gerganov | ggml : repack block_iq4_nlx8 (#14904) | |
| 88 | 6028bf74351d35a06bd98498624f8c2f029f7d1a | bc5182272c373267352bc689e5fca276934bea2d | 2025-08-13T10:04:46+02:00 | Oliver Simons | CUDA: Optimize `reduce_rows_f32` kernel, leading up to 25x perf improvement on kernel-level and 10% perf increase for Gemma3n (#15132) | |
| 89 | 25ff6f7659f6a5c47d6a73eada5813f0495331f0 | be48528b068111304e4a0bb82c028558b5705f05 | 2025-08-12T10:02:51+08:00 | R0CKSTAR | musa: fix failures in test-backend-ops for mul_mat_id op (#15236) | |
| 90 | cd3069dfcbeee8e0e96cffb93b0ebb9e595e273a | 50e81bdf5db563ab57a9a722b08f96fa8a76c927 | 2025-08-11T11:21:19+02:00 | Daniel Bevenius | kv-cache : log (debug) all streams in find_slot (#15176) | |
| 91 | 79c1160b073b8148a404f3dd2584be1606dccc66 | 34c9d765bf173c551398f1e7fa4595019bc53bab | 2025-08-09T13:29:43-05:00 | David Zhao | cuda: refactored ssm_scan and use CUB (#13291) | |
| 92 | 34c9d765bf173c551398f1e7fa4595019bc53bab | e54d41befcc1575f4c898c5ff4ef43970cead75f | 2025-08-09T20:00:24+08:00 | Aman Gupta | CUDA: add attention sinks for tile and wmma (#15178) | |
| 93 | 9515c6131aecaccc955fdedcfe16c3e030aaefcb | fd1234cb468935ea087d6929b2487926c3afff4b | 2025-08-05T16:26:38-07:00 | Reese Levine | ggml: WebGPU disable SET_ROWS for now (#15078) | |
| 94 | 587d0118f50b7e8f4bafbcdd218aefd9da0272e1 | 5aa1105da24a8dd1661cea3db0582c9b2c2f54d3 | 2025-08-04T08:52:43-07:00 | Reese Levine | ggml: WebGPU backend host improvements and style fixing (#14978) | |
| 95 | 3025b621d12a6931ff5e9775d4f644719980ad91 | ec0b18802c91badd3ff1388ffd09ee163251bd72 | 2025-08-02T17:20:40+08:00 | R0CKSTAR | llama-bench: rename DB table name from test to llama_bench (#15003) | |
| 96 | baad94885df512bb24ab01e2b22d1998fce4d00e | ba42794c9ead96ad52311ba1b23eefcbf3d6f63d | 2025-08-01T11:50:33+05:30 | Srihari-mcw | ggml : Q2k interleaving implementation - x86/x64 SIMD (#14373) | |
| 97 | 484b2091ce5017901483b5204c07878f171d1441 | daf2dd788066b8b239cb7f68210e090c2124c199 | 2025-08-01T08:47:27+08:00 | R0CKSTAR | compare-commits.sh: support both llama-bench and test-backend-ops (#14392) | |
| 98 | 8a4a85627702b569d7d2810f2de06a4321656e9d | 11490b36723d511d75fb601995c79b5c363ba3a2 | 2025-07-31T19:49:09+08:00 | Aman Gupta | Add LLaDA 8b Diffusion model (#14771) | |
| 99 | 00131d6eaf4df029e1ec84de868c2c5957503007 | 1e15bfd42c3938506e0da5939bf7f42780965f01 | 2025-07-30T15:12:02+03:00 | Georgi Gerganov | tests : update for LLAMA_SET_ROWS=1 (#14961) | |
| 100 | cd1fce6d4f9c191f1c7429cc96f61281c3b63ffc | 00fa15fedc79263fa0285e6a3bbb0cfb3e3878a2 | 2025-07-28T20:32:15+05:30 | Akarshan Biswas | SYCL: Add set_rows support for quantized types (#14883) | |
| 101 | 9b8f3c6c776d77045ee4f7f13fdf7863dfe59e5b | c7f3169cd523140a288095f2d79befb20a0b73f4 | 2025-07-26T10:36:02+08:00 | R0CKSTAR | musa: fix build warnings (unused variable) (#14869) | |
| 102 | 793c0d7f46384001738c337d7afa46b45ae32745 | ce111d39d666f4a3b6a561ad020f6feb8cc67790 | 2025-07-25T10:47:39-06:00 | Gabe Goodhart | metal: SSM_SCAN performance (#14743) | |
| 103 | c12bbde37258c6d053322d1cedd4a9672109ae58 | 3f4fc97f1d745f1d5d3c853949503136d419e6de | 2025-07-25T01:07:26-07:00 | Diego Devesa | sched : fix multiple evaluations of the same graph with pipeline parallelism (#14855) | |
| 104 | 3f4fc97f1d745f1d5d3c853949503136d419e6de | 2df255da3cea108de0ae9b302ffdd31674b6d88d | 2025-07-25T03:05:37+08:00 | R0CKSTAR | musa: upgrade musa sdk to rc4.2.0 (#14498) | |
| 105 | cb4a63aad6650c2b536a7578403935388cb2920e | 86f5623d904cfd392fdeb14a143097b4074660f6 | 2025-07-24T11:09:57+01:00 | Alberto Cabrera Pérez | sycl: fixed semantics of block offset calculation (#14814) | |
| 106 | 48b86c4fdb1b1246d9fe17d2d53e3a1c2a0c3245 | 38d3af1b73302377111e88ddd725257638339286 | 2025-07-22T07:45:26+08:00 | R0CKSTAR | cuda: remove linking to cublasLt (#14790) | |
| 107 | 6c9ee3b17e19dcc82ab93d52ae46fdd0226d4777 | cd465d823c378853f1f6570eebfb77f69c7e1d39 | 2025-07-21T19:03:19+02:00 | rmatif | opencl: add conv2d kernel (#14403) | |
| 108 | 90083283ec254fa8d33897746dea229aee401b37 | d4b91ea7b2da253e1355b503f0fcb7b428ce005d | 2025-07-19T12:51:22-04:00 | compilade | imatrix : use GGUF to store importance matrices (#9400) | |
| 109 | 2adf8d83acdb9b1bf58db6c9729ac9dc6847a58b | 021cc28bef4dd7d0bf9c91dbbd0803caa6cb15f2 | 2025-07-18T17:33:41+03:00 | Georgi Gerganov | parallel : add option for different RNG seeds (#14757) | |
| 110 | 086cf81e88fb75287b71ff19c08a206b7bc2e02f | d9b691081c04ec5fb0daa9d2b979f915c142963d | 2025-07-17T09:22:11+02:00 | Tarek Dakhran | llama : fix parallel processing for lfm2 (#14705) | |
| 111 | 21c021745d781edf9c44b4972ef6cbbf53b0ecff | b0f0ecc3dce806c68609d375a2b3edc430d8db18 | 2025-07-16T08:18:51-07:00 | Reese Levine | ggml: Add initial WebGPU backend (#14521) | |
| 112 | 225e7a1438f4ea85eaa7b5ef3ab3b266ee4d9c06 | ab140198211385b85eeeb0abd549a4bbe259e10d | 2025-07-16T16:35:42+03:00 | Georgi Gerganov | llama : add high-throughput mode (#14363) | |
| 113 | e4841d24d3485ea4af54f8b65a19ec3123f0ff3c | 538cc77f7f44dfa047dba6a06d90c86dda69cf1d | 2025-07-16T19:12:22+09:00 | Shunta Saito | llama : fix parallel processing for plamo2 (#14716) | |
| 114 | cbc68be51d88b1d5531643b926a4b359c3cff131 | bdca38376f7e8dd928defe01ce6a16218a64b040 | 2025-07-15T15:28:53+08:00 | R0CKSTAR | cuda: fix build warnings in set-rows.cu (unused variable) (#14687) | |
| 115 | 7de5c7cab61d4da4387ed9b216f88b96297bcc2d | 8eff95544e817704d44bec20f9fc956ce76a33be | 2025-07-12T21:31:38+08:00 | Aman Gupta | CUDA: add set rows for f32 and f16 (#14551) | |
| 116 | b3ad3a0191994d6c47b2bd389d5c7431526ecd2c | 98197e5c98388470030d908f355ec5937dcccaaa | 2025-07-12T05:12:26-05:00 | Jeff Bolz | vulkan: support SET_ROWS (#14587) | |
| 117 | 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 | 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 | 2025-07-10T18:20:13-06:00 | Gabe Goodhart | model : Granite Four (#13550) | |
| 118 | 704bb7a71c01dc07c1478b85f6322bf5dfde1eaf | 435a6d10d618a015060e45a38c7e9f27f4243316 | 2025-07-10T13:59:38+05:30 | Akarshan Biswas | SYCL: Initial set_rows kernel implementation (#14562) | |
| 119 | 4a5686da22057867c23bd4a6be941ddc8c51e585 | 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a | 2025-07-09T14:59:57-04:00 | compilade | llama : support Jamba hybrid Transformer-Mamba models (#7531) | |
| 120 | 6efcd65945a98cf6883cdd9de4c8ccd8c79d219a | 699f4392a33f57c3352cf8d60bdc53db7ca235e7 | 2025-07-08T13:11:42-05:00 | Jeff Bolz | vulkan: optimize flash attention split_k_reduce (#14554) | |
| 121 | 68155c66f0e76680f34442247e589a090add22d3 | e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e | 2025-07-08T07:58:30+08:00 | R0CKSTAR | musa: fix build warnings (unused variable) (#14561) | |
| 122 | a0374a67e2924f2e845cdc59dd67d9a44065a89c | ddef99522d1ba74193b7394e803fab8db5c78bae | 2025-07-05T02:26:04-05:00 | Jeff Bolz | vulkan: Handle updated FA dim2/3 definition (#14518) | |
| 123 | a70c8a0c4b4c1606cd9a0ba889ce61aa88610095 | 9067487c4411efb20400103fcccfdd389c80d428 | 2025-07-03T10:53:35+03:00 | Georgi Gerganov | kv-cache : use ggml_set_rows (#14285) | |
| 124 | 5d46babdc2d4675d96ebcf23cac098a02f0d30cc | e17991c466ac835b2c71bd813c1ca7ff8dd97b94 | 2025-07-02T13:10:24-04:00 | compilade | llama : initial Mamba-2 support (#9126) | |
| 125 | 55a1c5a5fdefef808e95aabd3d5563af1068cc80 | 12a81af45f0dbbab24bd819a15f57c03ceb1be90 | 2025-07-02T20:34:24+08:00 | Aman Gupta | CUDA: add softmax broadcast (#14475) | |
| 126 | a0535ffa0d35fccfec3e1a0a3bfc9dbb6054d7c0 | bd9c981d7226107f18deb8344c3301450311bb8b | 2025-06-29T11:04:10+02:00 | Sigbjørn Skjæret | ggml : implement REGLU/GEGLU/SWIGLU ops (#14158) | |
| 127 | bd9c981d7226107f18deb8344c3301450311bb8b | 27208bf657cfe7262791df473927225e48efe482 | 2025-06-29T02:43:36-05:00 | Jeff Bolz | vulkan: Add fusion support for RMS_NORM+MUL (#14366) | |
| 128 | 00d5282c7f2a0bb05bb315fb81ca3b0f42cf9f07 | 566c16fcce44876a167c37f159085afe6f84b28c | 2025-06-28T10:17:09-05:00 | Jeff Bolz | vulkan: lock accesses of pinned_memory vector (#14333) | |
| 129 | b25e92774e2fa4ee3820e458d5cf43f40190f8d2 | 6609507a910aa7437aaa53fd999447de3947d998 | 2025-06-28T17:35:41+08:00 | Xinpeng Dou | fix async_mode bug (#14432) | |
| 130 | 5783ae43599400b723b5da0569c1f848419ff3c7 | bf5bcd0b857db420235e03639f0a5f218a7f8cf8 | 2025-06-26T15:50:15+03:00 | Georgi Gerganov | metal : batch rows copy in a single threadgroup (#14384) | |
| 131 | 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 | d2f325130c4ed77a3dcff2c23a926587fb08e2cc | 2025-06-26T15:10:45+08:00 | Yunzhe Jia | Squashed commit of the following: | |
| 132 | 716301d1b03c31875ec3b24526c48c8b1bd0fd8c | 60ef23d6c14d325d83eae5752e5de39ad268e9b0 | 2025-06-26T12:11:59+08:00 | R0CKSTAR | musa: enable fp16 mma (all) and cublas on qy2 (#13842) | |
| 133 | 73e53dc834c0a2336cd104473af6897197b96277 | 62af464227dafa1c55e0535bcb24346326748f46 | 2025-06-24T11:46:25-07:00 | lhez | opencl: ref count `ggml_backend_opencl_context` and refactor profiling (#14254) | |
| 134 | fa4a9f2a1ccda2573189a9d4995bdf0bceb41156 | 238005c2dc67426cf678baa2d54c881701693288 | 2025-06-22T22:16:26+01:00 | Ed Addario | quantize : handle user-defined pruning of whole layers (blocks) (#13037) | |
| 135 | bb16041caef45cd4348cd6f84906b5dfec7a1f6a | 58cba76a9aab728717509d62b67c13afd8dc227a | 2025-06-21T08:17:12+02:00 | Markus Tavenrath | Add support for VK_EXT_debug_utils to add labels to Vulkan objects. (#13792) | |
| 136 | 67ae5312e255ae97852a4a216e2245580bfafd72 | 692e3cdd0a069ab56411b64506a67537d767683e | 2025-06-21T08:04:18+03:00 | Georgi Gerganov | metal : fix thread-safety (#14300) | |
| 137 | 8308f98c7fb778e54bf75538f5234d8bd20915e9 | 6369be07359d03723f38c0a4a014ff0f698a0738 | 2025-06-20T15:07:21+02:00 | Nicolò Scipione | sycl: add usage of enqueue_functions extension (#14244) | |
| 138 | e28c1b93fd7d3f8faf9551d962e8a65fe2122e38 | d27b3ca1758dfb1718e333d497ef4b68ad109bc2 | 2025-06-20T04:57:36-07:00 | Diego Devesa | cuda : synchronize graph capture and cublas handle destruction (#14288) | |
| 139 | edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 | ed3290ab34493fd3d2e0f925f816a401da4f2dfd | 2025-06-19T00:08:14-05:00 | Gabe Goodhart | memory : Hybrid recurrent cache (#13979) | |
| 140 | 8d947136546773f6410756f37fcc5d3e65b8135d | 50d2227953ca9024f04255b4f116d06fcc0db74c | 2025-06-19T01:10:26+08:00 | Aaron Teo | docs: add s390x build documentation (#14264) | |
| 141 | fe9d60e74a6cb71bcaed2029377bfa2872b4abb0 | e434e69183fd9e1031f4445002083178c331a28b | 2025-06-17T17:48:08+08:00 | R0CKSTAR | musa: fix build warning (unused variable) (#14231) | |
| 142 | 6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 | 0dbcabde8c006d5cf781ca0fe071c41559572a72 | 2025-06-16T08:11:43-07:00 | Diego Devesa | llama : add thread safety test (#14035) | |
| 143 | c89c2d1ab94b11845240b7d3313c87691ea18d88 | 3555b3004ba7687be3d734acade52a3345758aa4 | 2025-06-16T00:21:08-06:00 | Jeff Bolz | vulkan: mutex around vkQueueSubmit (#14127) | |
| 144 | c311ac664d68d10781a3e7b9f02d9d9520837d80 | b9912ac570de8945ae9383c9ca8291027bf287dd | 2025-06-15T10:08:58+03:00 | Georgi Gerganov | cparams : rename LLAMA_MAX_PARALLEL_SEQUENCES to LLAMA_MAX_SEQ (#14188) | |
| 145 | c61285e7396c8e526fe7794c19e8d4f1c99bfc51 | 09cf2c7c655c90e53e100f29b830a788bab0653d | 2025-06-13T08:45:37+01:00 | Ewan Crawford | SYCL: Bump oneMath commit (#14152) | |
| 146 | bd248d4dc7265437e1918dc53ae3f49a0c592e5f | 7781e5fe99f2a4fc1c8af0a8488eedac4644cb72 | 2025-06-11T09:48:52-05:00 | Jeff Bolz | vulkan: Better thread-safety for command pools/buffers (#14116) | |
| 147 | dad5c44398b78467943ed0a603ea427fe9f6fc62 | 55f6b9fa6563f6ae49113f9abdc980c12348cc1c | 2025-06-10T18:20:14-04:00 | compilade | kv-cache : avoid modifying recurrent cells when setting inputs (#13834) | |
| 148 | e21d2d4ae26d6c5daf1602a1061aa4f8e722ca57 | dc0623fddb661926e0998538895155e4f081ff09 | 2025-06-09T19:47:39+08:00 | Xinpeng Dou | CANN: Simplify the environment variable setting(#13104) | |
| 149 | dc0623fddb661926e0998538895155e4f081ff09 | 87d34b381d5868e75586210ec17b5ef5deddc276 | 2025-06-09T18:01:17+08:00 | R0CKSTAR | webui: fix sidebar being covered by main content (#14082) | |
| 150 | 228f34c9ceefa3ea4f4d6933edd858121e8106cb | 0974ad7a7cd4bca846b15c484ff3be890135a52c | 2025-06-07T18:58:20+05:30 | Akarshan Biswas | SYCL: Implement few same quantized type copy kernels (#13739) | |
| 151 | a7b8d35f780ab3e7639ae5345442fb1ad10f0163 | 6eba72b71c677ce9aae33c422a6e67008137987a | 2025-05-29T13:29:50+03:00 | Georgi Gerganov | sync : whisper.cpp (ggml/1250) | |
| 152 | fedf034a98378059274e4243d2a370a243335e73 | 8726392d3d927fe3e504868d3548d694496ee37e | 2025-05-27T20:58:46-04:00 | Daniel Tang | ggml : Print backtrace on uncaught C++ exceptions (ggml/1232) | |
| 153 | c04621711a893cbd09cff6c927cb005bc6749e36 | 0fc16b42e8793364918e830c234c1f3caec29dae | 2025-06-01T11:42:16+03:00 | Georgi Gerganov | parallel : fix n_junk == 0 (#13952) | |
| 154 | 053b1539c02617eff744f89525ee57497c3c1fbe | b3a89c3d9e34c28c5be70d8b687a84775746d4a0 | 2025-05-31T15:39:19-07:00 | Max Krasnyansky | threading: support for GGML_SCHED_PRIO_LOW, update thread info on Windows to avoid throttling (#12995) | |
| 155 | 12d0188c0dc6146ffde6d277a93f232ccbe699f8 | eb3949938e82a128855bc0676220bb2ce6e4228d | 2025-05-31T10:24:04+03:00 | Georgi Gerganov | kv-cache : refactor + add llama_memory_state_i (#13746) | |
| 156 | dd665cc9d4b378626cde11ea0c4c91f514fdc994 | df0c0c7d02f951dc639d48fd536f79200460ac83 | 2025-05-30T19:38:07+03:00 | Georgi Gerganov | parallel : increase the variability of the prompt lengths (#13927) | |
| 157 | 952f3953c1b61cc70e79e536c42ddce6a5ea5ea7 | 81713121ee56755ba4a147d1a1e3fa248ec31a66 | 2025-05-27T04:05:18-07:00 | Diego Devesa | ggml : allow CUDA graphs when using pipeline parallelism (#13814) | |
| 158 | 6f180b915c9ed9ec0c240b5dcd64644988fb5e82 | 03f582ae8fccecff225c30a2802461b44761e822 | 2025-05-26T21:10:36+05:30 | Akarshan Biswas | SYCL: Add non contiguous support in RMS_NORM and NORM kernels (#13611) | |
| 159 | de2ef53a4b2c0d703749a309d19fe68fd8f1b9ac | c508256db2de2b032e19c8ed833f4683c827c9a1 | 2025-05-25T16:34:36+03:00 | Georgi Gerganov | kv-cache : rework kv_cell (#13706) | |
| 160 | ffd0eae60b7642e942c8245b89642527e36099e6 | b775345d788ac16260e7eef49e11fe57ee5677f7 | 2025-05-24T11:46:19+02:00 | Johannes Gäßler | CUDA: fix race condition in FA vector kernels (#13742) | |
| 161 | d394a9aedc50a13b7f6373416f7c1ccabfe79c32 | 6b56a64690a318fcabcd7739ac7e314d44785ea8 | 2025-05-22T13:54:43+02:00 | Nicolò Scipione | sycl : Remove waits from function calls (#13702) | |
| 162 | 6b56a64690a318fcabcd7739ac7e314d44785ea8 | a4e8912dfd4604be1e39bc86ba4c0b02969967ef | 2025-05-22T09:24:09+01:00 | Ewan Crawford | SYCL: Avoid using with SYCL-Graph for unsupported nodes (#13587) | |
| 163 | a4e8912dfd4604be1e39bc86ba4c0b02969967ef | edbf42edfdabb9cea72ae12137570cf48f5d8076 | 2025-05-22T02:21:45+03:00 | Henry Linjamäki | opencl: Add support for multiple devices (#12622) | |
| 164 | c76532e7ba128bb097bf6836bf0f5592e1b56b76 | 2aa777d86d3f7bb80b93e226f1c25e47825f6a83 | 2025-05-21T19:40:35+03:00 | antichristHater | convert : add qwen2vl support for unsloth merges (#13686) | |
| 165 | 33983057d0f578aca74ba15eccc3de9c267a5ff6 | fb1cab201c6c4cd36731f100df74eece2f4706fa | 2025-05-21T09:58:49+08:00 | R0CKSTAR | musa: Upgrade MUSA SDK version to rc4.0.1 and use mudnn::Unary::IDENTITY op to accelerate D2D memory copy (#13647) | |
| 166 | e298d2fbd082a52c0f6ed02729f94e9bf630cf17 | f0adb80bf7c2c0d80abb04f4533b5513622d9964 | 2025-05-20T08:05:46+03:00 | Georgi Gerganov | kv-cache : add SWA support (#13194) | |
| 167 | 8b5e19aea6ce9fe4452598663924373234041440 | 60aea028b575ab54e0dfbb31db641bb93d2ae8c4 | 2025-05-18T18:30:13-07:00 | Diego Devesa | ggml : fix apple OS check in ggml_print_backtrace (ggml/1229) | |
| 168 | 60aea028b575ab54e0dfbb31db641bb93d2ae8c4 | 9c55e5c5c24990dd17fd6c8f4f2159052d2b06f1 | 2025-05-17T19:06:26-04:00 | Daniel Tang | ggml : Fix missing backtrace on Linux (ggml/1228) | |
| 169 | 518329b2d4434d0683c30b741b4f4cf5734b5f99 | 2f5a4e1e09567e09be8b84a5f976334de9539d17 | 2025-05-17T12:58:55+03:00 | Georgi Gerganov | parallel : add option for non-shared and larger prompts (#13598) | |
| 170 | 09232370fc6426aa5dd9be01a8271b9c28f5af3a | 7474e00b34629e9cd8b06bc87ad935584ea30f8e | 2025-05-11T16:20:39+02:00 | Sigbjørn Skjæret | scripts : exit compare-llama-bench.py gracefully when there's nothing to compare (#13451) | |
| 171 | 0208355f42bdab88a08507ead4a6302790a08323 | d2a4ef05c60506ee48e7375eb36f2257de7ab0d2 | 2025-05-10T22:22:48+02:00 | Johannes Gäßler | CUDA: fix race conditions FlashAttention kernels (#13438) | |
| 172 | 33eff4024084d1f0c8441b79f7208a52fad79858 | 17512a94d636c4b6c1332370acb3e5af3ca70918 | 2025-05-09T19:29:37+02:00 | Xuan-Son Nguyen | server : vision support via libmtmd (#12898) | |
| 173 | 0527771dd80bd18479dfaaa0a98be297fc3592bf | 2189fd3b6327a1d17893694125da8edcf74a6468 | 2025-05-09T17:25:50+08:00 | R0CKSTAR | llama-run: add support for downloading models from ModelScope (#13370) | |
| 174 | 1f73301b63668d61b5f3109489050a27dc3f65be | 4773d7a02ffdb05ba9e673ff21ce95351836e33a | 2025-05-07T15:48:23+08:00 | R0CKSTAR | cuda : remove nrows_x in mul_mat_q_process_tile (#13325) | |
| 175 | 93c4e23905987949b714b21ae918ff6bfb55fe36 | 8afbd968182909cf93fb15959fc867b6dd3adb53 | 2025-05-04T14:16:39+02:00 | Johannes Gäßler | CUDA: fix race condition in MMQ stream-k fixup (#13299) | |
| 176 | 8afbd968182909cf93fb15959fc867b6dd3adb53 | 8ae5ebcf859b05a2ea3bbd930133a2fe4a89ed3c | 2025-05-04T13:58:38+02:00 | Johannes Gäßler | CUDA: fix race condition in MMQ ids_dst (#13294) | |
| 177 | 8efbdadc616fa717c369059b9b388160958d886c | f057808ffadce213f54c1884ab5096e60140f358 | 2025-05-01T17:32:11-04:00 | Justin Santa Barbara | rpc : avoid uninitialized memory in serialize_tensor (#13210) | |
| 178 | 3e168bede4d27b35656ab8026015b87659ecbec2 | ceda28ef8e310a8dee60bf275077a3eedae8e36c | 2025-04-30T16:56:24+02:00 | Xuan-Son Nguyen | convert : improve model arch handling (#13122) | |
| 179 | 43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 | 1831f538f720d1d99fba146f24f0a8e970838cc4 | 2025-04-28T21:00:20+03:00 | Ville Vesilehto | fix(rpc): Improve input validation and error handling (#13069) | |
| 180 | 5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 | a4c340f974f9b7ac0c1aae897aabaa54549a97e5 | 2025-04-28T12:18:59+02:00 | Xuan-Son Nguyen | clip : refactor set input for cgraph + fix qwen2.5vl input (#13136) | |
| 181 | a4c340f974f9b7ac0c1aae897aabaa54549a97e5 | d0a417f3c7a5a22ef05b3b76d91dbe1d3362bf0c | 2025-04-28T15:03:25+05:30 | Akarshan Biswas | SYCL: Add all missing unary kernels (#13074) | |
| 182 | f0dd6a1926cdb2f4183a937deee40db26ef8f1da | 69699be48a6b94570773532850667f1591dc5bbe | 2025-04-28T15:33:28+08:00 | R0CKSTAR | musa: fix typo in cc control (#13144) | |
| 183 | e291450b7602d7a36239e4ceeece37625f838373 | 59e991c23cc44cb5fb657e7b9358cac21fb79828 | 2025-04-27T19:22:49+08:00 | R0CKSTAR | musa: fix build warning (#13129) | |
| 184 | ca2bb89eac2097ab4620448737e58af8452e444b | 2d451c80590b9ac250322769ac13d3b4870dbcf7 | 2025-04-27T16:10:34+08:00 | HimariO | clip : Add Qwen2.5VL support (#12402) | |
| 185 | 2cca6c01e46d2fc1124d15730273ed2acdad1016 | 658987cfc9d752dca7758987390d5fb1a7a0a54a | 2025-04-23T10:32:49+03:00 | Radoslav Gerganov | rpc : add command line option for number of threads for the CPU backend (#13060) | |
| 186 | 7a395f67a7a02bb361d944b816d6e933889e28e1 | 971f245b3b5f3f55991bb779cb541b00f82eea1d | 2025-04-17T20:34:16+08:00 | hipudding | CANN: Add support for async operator submission (#12864) | |
| 187 | b0c75ac9f93322b45e3766e149417334b4fd1ed9 | d6d2c2ab8c8865784ba9fef37f2b2de3f2134d33 | 2025-04-15T10:04:24+08:00 | Xinpeng Dou | CANN: Optimize CANN buffer pool memory management (#12875) | |
| 188 | 8ac9f5d765f2b1b7f821873618c0cff68ca59bc8 | 12e9158f25cb47e97ca9b8083e1ec7415f262260 | 2025-04-11T15:26:17+08:00 | R0CKSTAR | ci : Replace freediskspace to free_disk_space in docker.yml (#12861) | |
| 189 | 64eda5deb9859e87a020e56bab5d2f9ca956f1de | fe5b78c89670b2f37ecb216306bed3e677b49d9f | 2025-04-10T17:24:44+02:00 | Xuan-Son Nguyen | convert : ability to lazy-load safetensors remotely without downloading to disk (#12820) | |
| 190 | d9a63b2f2e91cdcb0eda211b7f49fadcdea0f664 | 8ed71242f464dc0a3fb3cffcfe064e55bdec72f9 | 2025-04-09T17:22:30+08:00 | R0CKSTAR | musa: enable freediskspace for docker image build (#12839) | |
| 191 | 0090950f679475c5ecaac2f7bca5049cca96492b | 7ecd780b1a1d5214b8d04c25ebfc194d310816ed | 2025-04-09T00:25:08-05:00 | Jeff Bolz | vulkan: In coopmat2 mmq, load q4_k/q5_k scales through shared memory (#12833) | |
| 192 | 78a1ba0a4f2bfed5b8b8e312592143d22e531698 | 2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 | 2025-04-08T18:37:06+02:00 | Xuan-Son Nguyen | server : fix thread.join() on exit (#12831) | |
| 193 | 916c83bfe7f8b08ada609c3b8e583cf5301e594b | 0c74b04376b0b9efc096480fe10f866afc8d7c1c | 2025-04-06T21:23:54+08:00 | R0CKSTAR | musa: fix compilation warnings in mp_22/31 (#12780) | |
| 194 | 5f696e88e0eb490c8028421d3c5419df9dcf5385 | 193c3e03a63ccda3ac3d6a2999e41e6d1414fe23 | 2025-04-03T19:51:35+08:00 | R0CKSTAR | sync : minja (inclusionAI/Ling) and update tests (#12699) | |
| 195 | a10b36c91a091f4606710fba4e9327fd71e0e738 | 83a88bd6affbe148a622ac730952ac5b8b585979 | 2025-04-02T14:32:59+03:00 | Georgi Gerganov | llama : refactor kv cache guard (#12695) | |
| 196 | a6f32f0b3437ac79827ffb55521cb839343324ab | 2bb3597e426ce092c3e10ae0bdd876963765e6ed | 2025-04-01T19:12:53+08:00 | R0CKSTAR | Fix clang warning in gguf_check_reserved_keys (#12686) | |
| 197 | c80a7759dab10657b9b6c3e87eef988a133b9b6a | 250d7953e829ff0e16074510fef0e7cec696461b | 2025-03-31T18:40:56+02:00 | Daniel Bevenius | vocab : add special infill tokens for CodeLlama (#11850) | |
| 198 | 6c02a032fa21d69e881ef9a5c94ba28ebaf1d749 | f52d59d771dc231fc2ac39adacf157ddefc97730 | 2025-03-31T14:55:24+05:30 | Akarshan Biswas | SYCL: Remove misleading ggml_sycl_op_flatten function (#12387) | |
| 199 | 492d7f1ff77e116e44962b832cc3db24cfc46d24 | d3f1f0acfbf8aaafd2ce494309a10a7cc92042c8 | 2025-03-30T16:59:38+08:00 | R0CKSTAR | musa: fix all warnings, re-enable `-DLLAMA_FATAL_WARNINGS=ON` in ci and update doc (#12611) | |
| 200 | c7b43ab60855f752ae79937fb93d561bc30b69a4 | 24feaec05792b972d5ff3e2b12d9237ebd50d1ac | 2025-03-27T12:21:47+05:30 | amritahs-ibm | llamafile : ppc64le MMA implementation for Q4_0. (#12489) | |
| 201 | f17a3bb4e8b0aa24c0f86636d234aca7dc2cfa01 | bd40678df768ab189b26b8b03e3de4062e3b71a3 | 2025-03-27T07:16:00+05:30 | Akarshan Biswas | SYCL: implement memset ggml backend buffer interface (#12580) | |
| 202 | fd7855f8f522ab26681b25ae506ff99c654e2dd5 | 53af4dba425768fd507ce6b45873cfbb3df2295f | 2025-03-26T15:09:48+08:00 | R0CKSTAR | doc: [MUSA] minor changes (#12583) | |
| 203 | 3cd3a395323fa9cdf6ecfa1fea290bf228d4e856 | 2d77d88e70d017cd82c3f1a4517e3102e2028ac4 | 2025-03-25T15:45:08+08:00 | R0CKSTAR | ci: [MUSA] add CI and update doc (#12562) | |
| 204 | 7ea75035b67f44c22ed7039967f718011fd35ce5 | c54f6b7988b63714b87b0390e01a1e69aee79a12 | 2025-03-24T18:28:34+08:00 | R0CKSTAR | CUDA: Fix clang warnings (#12540) | |
| 205 | fac63a3d786b2a0f97876c30add02cb525a9648e | eddfb438502bd5d1014d63a812e9b6d03d326f8c | 2025-03-22T17:11:37+08:00 | R0CKSTAR | musa: refine compute capability (#12493) | |
| 206 | 3d82dbcbce2c677fc35fbf99574ccd107d95a1f8 | 732b5fbf5e7f9cf069942f0c5850ee959ef321ba | 2025-03-20T17:05:34+05:30 | Srihari-mcw | ggml : block interleaving support for Q4_K quantization for x86 AVX2 architecture (#12332) | |
| 207 | 517b5ddbf002b91fd6d6daf5d8db8c88a0173039 | a9b59288e222f39fc0311dc66944ed5a86c815fa | 2025-03-20T01:22:06+05:30 | Gaurav Garg | CUDA: Improve flash decoding kernel GPU occupancy for BS=1 case (#12183) | |
| 208 | d84635b1b085d54d6a21924e6171688d6e3dfb46 | 75422e8bc42646005be0754f7aa438b97a5e777e | 2025-03-18T12:54:55-07:00 | lhez | opencl: improve profiling (#12442) | |
| 209 | bb115d2bf7ed2cdd7dccd7ae74cc9cfe4b0adb71 | 29fff308c704c1c752cdb5153361e545e2bac09d | 2025-03-19T02:28:26+08:00 | R0CKSTAR | musa: override warp_size of musa device to 32 (#12445) | |
| 210 | 7dfad387e3f6ac98d383ded2d175eb59736a3993 | 60c902926c928f9c2cd6390ce411876f92feeaf3 | 2025-03-18T07:27:50+08:00 | Molly Sophia | llama: Add support for RWKV v7 architecture (#12412) | |
| 211 | 9f2250ba722738ec0e6ab684636268a79160c854 | 774973b8f3d5e375b0b74d58638eeb1817e950a8 | 2025-03-14T16:41:20Z | Eric Curtin | Add CLI arg to llama-run to adjust the number of threads used (#12370) | |
| 212 | 10f2e81809bbb69ecfe64fc8b4686285f84b0c07 | ba7654380a3c7c1b5ae154bea19134a3a9417a1e | 2025-03-11T20:16:03+01:00 | uvos | CUDA/HIP: refractor mmqv to unify the calculation of nwarps and rows per block between host and device code. (#12177) | |
| 213 | 251364549fe4a78d4e2e66f1adfaf2bd53041d2c | 8acdacb3ea00697477eb019efbb6fc183371055c | 2025-03-11T01:18:25+08:00 | R0CKSTAR | musa: support new arch mp_31 and update doc (#12296) | |
| 214 | 05e6f5aad0a4bb48fb2775f2a78505540fdbc47d | 673cfef9aa8daad09966208909f346eb996628a4 | 2025-02-28T13:06:12+05:30 | Prashant Vithule | ggml: aarch64: implement SVE kernels for q2_k_q8_k vector dot (#12064) | |
| 215 | f777a73e18c218848bca0748581c043987348a5d | af7747c95ae71a5db4184947f837179e82c70b77 | 2025-02-23T13:14:32Z | Eric Curtin | Some llama-run cleanups (#11973) | |
| 216 | 0b3863ff9576872855b0265da2cab2ce7e25c4d9 | ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe | 2025-02-21T15:46:23+08:00 | Bodhi | MUSA: support ARM64 and enable dp4a .etc (#11843) | |
| 217 | c5d91a74006c49376590ef2b67420bc7ce206397 | 4806498bf15ef767de3776b00856e56c373dd1b1 | 2025-02-20T14:06:51+01:00 | Charles Xu | ggml-cpu: Add CPU backend support for KleidiAI library (#11390) | |
| 218 | 73e2ed3ce3492d3ed70193dd09ae8aa44779651d | f7b1116af102bcac450c1a522e9c59db241c6767 | 2025-02-17T14:03:24+01:00 | Johannes Gäßler | CUDA: use async data loading for FlashAttention (#11894) | |
| 219 | c48f630d1c1942fce08aa7cb18a53ace443cd611 | bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 | 2025-02-13T14:46:59+01:00 | Daniel Bevenius | llama : add --completion-bash option (#11846) | |
| 220 | bd6e55bfd3f3af3e5705cf87a10e5178cef7c3c1 | c7f460ab882065ec5696e3d51e24dbf67b539287 | 2025-02-13T20:28:18+08:00 | R0CKSTAR | musa: bump MUSA SDK version to rc3.1.1 (#11822) | |
| 221 | e4376270d971cff7992bdb6c5412a739195b1459 | 3e693197724c31d53a9b69018c2f1bd0b93ebab2 | 2025-02-13T01:25:34-05:00 | Oleksandr Kuvshynov | llama.cpp: fix warning message (#11839) | |
| 222 | a394039db004c6ee00098250d160b5aa018c2314 | be3bbd62153820ff6d358c817360927f429105c4 | 2025-02-13T01:02:38+01:00 | Diego Devesa | ggml-cpu : add chunking support to mul_mat_id (#11666) | |
| 223 | 748ee9fe9312acb8755ee4bf46fd9de2e6a45f29 | 198b1ec611a2c551ea40e5b9c0b862f37555a4cc | 2025-02-12T13:57:33Z | Richard | ggml : fix multi-threaded clamp_f32 (#11824) | |
| 224 | 4d3465c5aeca8be29cac77f1535c35f4fb274eca | d80be897acdca45f8f7ea2e52c930b1d0e738a14 | 2025-02-08T15:30:53+01:00 | Karol Kontny | ggml: Fix data race in ggml threadpool (#11736) | |
| 225 | 2fb3c32a1634488a5265d1304ab37628eeb5480d | 9ab42dc722ad19a12af80f38a06474d498f96da3 | 2025-02-06T17:32:29+01:00 | Xuan-Son Nguyen | server : (webui) migrate project to ReactJS with typescript (#11688) | |
| 226 | 3ec9fd4b77b6aca03a3c2bf678eae3f9517d6904 | 3962fc1a7956dd0afacfbce10fd1a3ffd3ad857e | 2025-02-05T02:18:38+08:00 | fxzjshm | HIP: force max threads per block to be 1024 (#11621) | |
| 227 | a83f528688324a21484a97af1d1be5e1bc8d4c8e | b1bcd309fc8ac929cbd4a6207b3a19886bda031f | 2025-01-31T14:15:25Z | Olivier Chafik | `tool-call`: fix llama 3.x and functionary 3.2, play nice w/ pydantic_ai package, update readme (#11539) | |
| 228 | 4314e56c4f8c5091f45732f39bd94c0c6c323798 | 496e5bf46bab757d05e18227cb4e17055ae42f42 | 2025-01-30T11:05:00+01:00 | Daniel Bevenius | server : use lambda instead of std::bind (#11507) | |
| 229 | e0449763a4f335cca374254a72892141f41eaa59 | eb7cf15a808d4d7a71eef89cc6a9b96fe82989dc | 2025-01-30T05:48:14+01:00 | Daniel Bevenius | server : update json snippets in README.md [no ci] (#11492) | |
| 230 | 1a0e87d29152cb9d4ce13b4ad64b0382c9ba1ab6 | d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d | 2025-01-23T11:59:08-08:00 | William Tambellini | ggml : add option to not print stack on abort (ggml/1081) | |
| 231 | d2e518e9b4231077013ffb0e5c4cc24a0c4c1b7d | b636228c0ad0db95bf73008094c6145a05615cf6 | 2025-01-17T21:29:08+09:00 | issixx | ggml-cpu : fix ggml_graph_compute_thread did not terminate on abort. (ggml/1065) | |
| 232 | 5245729e3317064959faefc5e5cbc63f4e9cfbea | 6152129d05870cb38162c422c6ba80434e021e9f | 2025-01-23T01:01:17-06:00 | Jeff Bolz | vulkan: fix diag_mask_inf (#11323) | |
| 233 | 6171c9d25820ccf676b243c172868819d882848f | e28245f35f2faaf249dd352998b3693a8cc28c51 | 2025-01-21T13:18:51Z | Olivier Chafik | Add Jinja template support (#11016) | |
| 234 | adc5dd92e8aea98f5e7ac84f6e1bc15de35130b5 | f11cfdfd7fe29436fce512d934c2ff6b94bd89d2 | 2025-01-15T19:50:13Z | Eve | vulkan: scale caching for k quants + misc fixes (#11081) | |
| 235 | 6369f867a410416239d9f20ec27c2b1d6a9fee52 | 47182dd03fe04a4ffda5d7f4c8a109ae0056cf56 | 2025-01-06T10:28:17+01:00 | Daniel Bevenius | llama : rename missed batch params/vars to ubatch (#10059) | |
| 236 | 0da5d860266c6928b8c9408efbd264ae59fedda6 | a45433ba209ee0b33d02c7dc4c31f29894ad83a6 | 2025-01-02T15:05:18+01:00 | Xuan Son Nguyen | server : allow using LoRA adapters per-request (#10994) | |
| 237 | a813badbbdf0d38705f249df7a0c99af5cdee678 | fdd21889123bec62b1db3b2fc22b5a4abab32174 | 2024-12-29T03:16:34-06:00 | Jeff Bolz | vulkan: im2col and matmul optimizations for stable diffusion (#10942) | |
| 238 | 227d7c5a7f4cc7734fde8a4ef4382d613486d3c8 | 7b1ec53f56bb72c49e4c8434157895f94d3709c2 | 2024-12-17T09:52:09+01:00 | Xuan Son Nguyen | server : (UI) fix missing async generator on safari (#10857) | |
| 239 | 7b1ec53f56bb72c49e4c8434157895f94d3709c2 | 160bc039c862c10b9938269a90ddb09d794a7b0d | 2024-12-17T05:52:55Z | Eve | vulkan: bugfixes for small subgroup size systems + llvmpipe test (#10809) | |
| 240 | 5478bbcd173e7027af7689493c7421719f5c43df | b5ae1ddff93403300fc79c7ab5ee73b8cfbb3457 | 2024-12-15T05:55:54-06:00 | Vinesh Janarthanan | server: (UI) add syntax highlighting and latex math rendering (#10808) | |
| 241 | a76c56fa1a3d27467eb97468d8c3b2fe1243b61a | c27ac678dd393af0da9b8acf10266e760c8a0912 | 2024-12-13T12:23:52-08:00 | lhez | Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693) | |
| 242 | 11e07fd63bac1cb642380a7a3eac03fd8703e948 | 4601a8bb6784d2ab8b4b605354b51979fbeea1d3 | 2024-12-13T18:23:50+01:00 | Corentin REGAL | fix: graceful shutdown for Docker images (#10815) | |
| 243 | 83ed24a97b500ccdb32b90b94e6f9621ad8db79e | d583cd03f663701858ba152a334cbb467fabe342 | 2024-12-13T12:12:15+05:30 | Akarshan Biswas | SYCL: Reduce most of the compiler warnings (#10748) | |
| 244 | 3573fa8e7b7f0865638b52b4e9b4d2006f0558a2 | d9c3ba2b7749c00df477599aa141a98b4521aa2c | 2024-12-07T20:21:09+01:00 | Xuan Son Nguyen | server : (refactor) no more json in server_task input (#10691) | |
| 245 | ce4a7b849388b67d45ad420bdd82d5efcd55647a | 19d8762ab61df8286367588a80b9c7db4cb568db | 2024-12-07T18:02:05+02:00 | Georgi Gerganov | server : various fixes (#10704) | |
| 246 | e9e661bd59364e5d4fce035834b6cadcadf8c2ef | efb6ae963031709fc331e6e48cc4606ac8f9c3a7 | 2024-12-03T21:11:43+08:00 | mahorozte | CUDA: remove unnecessary warp reduce in FA (ggml/1032) | |
| 247 | efb6ae963031709fc331e6e48cc4606ac8f9c3a7 | 667d70d1704dfa6977505f5d01d4638669b90dce | 2024-12-02T19:27:24+01:00 | PAB | feat: add `GGML_UNARY_OP_ARGMAX` Metal kernel (ggml/1019) | |
| 248 | 0533e7fb3842a523f64dc533bd7bd7147ec2c63a | 7cc2d2c88908fc92b97b28acafb82f7d6e425b85 | 2024-11-30T07:00:02Z | Eve | vulkan: Dynamic subgroup size support for Q6_K mat_vec (#10536) | |
| 249 | 6c595676899013102fdb0aa4b06a49954300c94a | 890719311b6535e572f15965c6d7ec4ac2537f60 | 2024-11-28T19:17:49+01:00 | Xuan Son Nguyen | server : (tests) don't use thread for capturing stdout/stderr, bump openai client library (#10568) | |
| 250 | 249cd93da3df9c8fa78869b0522526d1625aca91 | 904109ed0d97c9b656a5e8bf612925f739bb8166 | 2024-11-27T00:00:41+08:00 | R0CKSTAR | mtgpu: Add MUSA_DOCKER_ARCH in Dockerfiles && update cmake and make (#10516) | |
| 251 | 45abe0f74ee281aea6e5283c1e738061256cfcae | 0bbd2262a3263f37385297b30de37941836e57f7 | 2024-11-26T16:20:18+01:00 | Xuan Son Nguyen | server : replace behave with pytest (#10416) | |
| 252 | 84e1c33cde9e0a7aafcda2d4f21ba51c300482d7 | 811872a59daefb25fc0c4326bcb6d8ae893c2f7c | 2024-11-26T13:36:40+02:00 | Georgi Gerganov | server : fix parallel speculative decoding (#10513) | |
| 253 | 9ca2e677626fce759d5d95c407c03677b9c87a26 | 5931c1f233c616083d64e41a228249d58e039aa5 | 2024-11-25T16:31:38+02:00 | Georgi Gerganov | server : add speculative decoding support (#10455) | |
| 254 | cce5a9007572c6e9fa522296b77571d2e5071357 | dc39012cbaf8752fabecaeb60af78ccdd1dfb73b | 2024-11-24T18:03:25+02:00 | Georgi Gerganov | flake.lock: Update (#10470) | |
| 255 | 2eb76b2a5e4ea395b971a419c95b473ab6f253e4 | 9b75f03cd2ec9cc482084049d87a0f08f9f01517 | 2024-11-18T16:08:20+02:00 | Georgi Gerganov | flake.lock: Update (#10346) | |
| 256 | cf32a9b93ad859ea592c31785b6bd3b4b2121463 | a43178299c2f74f14bcfc659bfd9fd32d931d1f4 | 2024-11-17T11:23:01+02:00 | Georgi Gerganov | metal : refactor kernel args into structs (#10238) | |
| 257 | f0204a0ec70d50ca60e07bc0096ec1d6508ab0c7 | 57f8355b29a8c7dfcd1fb6094758ad85644f8535 | 2024-11-15T19:47:25+08:00 | R0CKSTAR | ci: build test musa with cmake (#10298) | |
| 258 | 9901068ac78838745e604fffb4601d315a610456 | 231f9360d94446cd083b6b116f63991b1328c484 | 2024-11-15T05:48:49-04:00 | Xuan Son Nguyen | server : (web UI) add copy button for code block, fix api key (#10242) | |
| 259 | ae8de6d50a09d49545e0afab2e50cc4acfb280e2 | 4a8ccb37ad9c9027cbcfd5548c19cdffe48d5197 | 2024-11-14T18:04:35+01:00 | Diego Devesa | ggml : build backends as libraries (#10256) | |
| 260 | fb4a0ec0833c71cff5a1a367ba375447ce6106eb | 5ea926dad7f62ebccff7b24784bd1e01a06d13ae | 2024-11-13T20:00:35+02:00 | Michael Podvitskiy | llama : propagate the results of `graph_compute` (#9525) | |
| 261 | 54ef9cfc726a799e6f454ac22c4815d037716eda | b0cefea58a20020754b7431e3c725625274372a5 | 2024-11-11T11:13:51-06:00 | Jeff Bolz | vulkan: Throttle the number of shader compiles during the build step. (#10222) | |
| 262 | 4b3a9212b602be3d4e2e3ca26efd796cef13c55e | 505f33274d60676320216b662a97672a76ec600e | 2024-11-10T21:45:25+02:00 | Georgi Gerganov | flake.lock: Update (#10243) | |
| 263 | 3bcd40b3c593d14261fb2abfabad3c0fb5b9e318 | 5c333e014059122245c318e7ed4ec27d1085573c | 2024-11-07T18:19:10+11:00 | Zhiyuan Li | Optimize RWKV6 Operator Naming and Implement Multi-core CPU/ SYCL Acceleration (#10133) | |
| 264 | b11f9ba9b8ce319f04b88afe40d264e6b7f4ba46 | 94d8cb8be13b7c4d04eeca5a2b956b9148e6f222 | 2024-11-06T13:29:01+02:00 | Georgi Gerganov | server : remove hack for extra parallel slot (#10187) | |
| 265 | 9e0ecfb697d297355e43c20559d29bcc71beb0c3 | 6a066b9978533e2ab9890b7f4f8c0262d91798b3 | 2024-11-04T16:33:29+01:00 | Xuan Son Nguyen | server : clarify /slots endpoint, add is_processing (#10162) | |
| 266 | 1839f69130151ceeac4d01c0ef8964e1fb43bba6 | 9830b6923b61f1e652a35afeac77aa5f886dad09 | 2024-11-03T15:14:15+02:00 | Georgi Gerganov | flake.lock: Update (#10146) | |
| 267 | 42cadc74bda60afafb45b71b1a39d150ede0ed4d | 45950415ed985830c59bf42cf9c9216b20cf08ef | 2024-11-02T16:34:56Z | sasha0552 | server : fix slot selection by lru (#10126) | |
| 268 | d865d1478cd4e403f82d793c2afcd0f943412f05 | 1804adb0cfee4811eaf633741503d683a46e4c77 | 2024-11-01T13:33:14Z | sasha0552 | server : fix smart selection of available slot (#10120) | |
| 269 | 07028f9d74d895da2ca4a1956624e3f07e04e620 | 524afeec9dad7d765ce91f5cf30c73703867cb47 | 2024-10-28T17:41:24+02:00 | Georgi Gerganov | flake.lock: Update (#10063) | |
| 270 | 524afeec9dad7d765ce91f5cf30c73703867cb47 | 8125e6cbfcf2b3b9066e4d923aca9295526730f5 | 2024-10-28T17:02:48+08:00 | R0CKSTAR | musa: workaround for Guilty Lockup in cleaning src0 (#10042) | |
| 271 | 8c60a8a46261ffb92b6d23a78acfac2fcb6fe233 | 9e4a2563eadf34e9432d248224d4f43e8495e8fe | 2024-10-23T14:34:00-04:00 | bssrdf | increase cuda_cpy block size (ggml/996) | |
| 272 | bc5ba007b2c83ac95875e68724dabfc12159fc61 | 958367bf530d943a902afa1ce1c342476098576b | 2024-10-25T10:13:46+03:00 | Georgi Gerganov | server : check that the prompt fits in the slot's context (#10030) | |
| 273 | 958367bf530d943a902afa1ce1c342476098576b | 40f2555797f97314de749873cdc29dc102be66e2 | 2024-10-24T21:51:22+02:00 | Xuan Son Nguyen | server : refactor slot input data, move tokenizer to HTTP thread (#10023) | |
| 274 | 873279b1592e433c4d9eb5065091cc98473c7bee | c8c07d658a6cefc5a50cfdf6be7d726503612303 | 2024-10-20T00:22:59Z | github-actions[bot] | flake.lock: Update | |
| 275 | 60ce97c9d809f4b040e90b597468b839df5728d0 | 8901755ba328643c9ab071c20e1939ea52951a0e | 2024-10-18T13:34:36+08:00 | Ma Mingfei | add amx kernel for gemm (#8998) | |
| 276 | fbc98b748e7b075e327bcf13237057f647678049 | dcdd535302fc9702a4709be25f56540d65163a44 | 2024-10-15T15:54:55+05:00 | MaggotHATE | sampling : add XTC sampler (#9742) | |
| 277 | 92be9f12164f18ce845a5bab60cefa5f7fec6836 | edc265661cd707327297b6ec4d83423c43cb50a5 | 2024-10-13T06:11:26+03:00 | Georgi Gerganov | flake.lock: Update (#9870) | |
| 278 | 1bde94dd024b632f98428f4bf2ce483295130779 | 95c76e8e92ecc93f784b185eafae36a0e7ad2fa3 | 2024-10-12T16:06:31+03:00 | Georgi Gerganov | server : remove self-extend features (#9860) | |
| 279 | 11ac9800aff532715a5bc7991062c68ba3472e6e | 943d20b4111c746bcd9dbc7e4771de313b08b50c | 2024-10-12T08:21:51+03:00 | Georgi Gerganov | llama : improve infill support and special token detection (#9798) | |
| 280 | 943d20b4111c746bcd9dbc7e4771de313b08b50c | 96776405a17034dcfd53d3ddf5d142d34bdbb657 | 2024-10-12T13:09:53+08:00 | R0CKSTAR | musa : update doc (#9856) | |
| 281 | cf8e0a3bb9c0e93e371773b282054cdbbb231038 | c7499c557cc1efafaf0a6bc12963c39826299703 | 2024-10-11T02:10:37+08:00 | R0CKSTAR | musa: add docker image support (#9685) | |
| 282 | 6279dac039ddeb6d5ebd125a6274fd3c37a77ba8 | d5ac8cf2f2e30459489e6721a17d15b92a0c42a6 | 2024-10-07T19:35:42+03:00 | Georgi Gerganov | flake.lock: Update (#9753) | |
| 283 | 96b69121033d2b6b951d1b6b1b43f8b4f97dac99 | d5cb86844f26f600c48bf3643738ea68138f961d | 2024-10-07T13:26:31+01:00 | Paul Tsochantaris | metal : single allocation of encode_async block (#9747) | |
| 284 | ace4f4be37abed4801fbd54a94cf38a7ae462416 | 8277a817f18967581b02b2248989d773e8e99998 | 2024-09-30T17:48:49+03:00 | Georgi Gerganov | flake.lock: Update (#9680) | |
| 285 | 641002fba8d2a0c0269027e23d2ef58e90546028 | 0de8b203f1d31cf5ee0d2a3560a0ad78d44f4d4c | 2024-09-29T11:50:17-05:00 | Jeff Bolz | vulkan : multithread pipeline creation (ggml/963) | |
| 286 | 544f409b4bd8fc98a3e87820f0ac934e00402de7 | 6084bfb261b03f812de2255b05b6b5bb8d1c7171 | 2024-09-26T08:59:42+02:00 | Salvatore Mesoraca | vulkan : argsort barriers must be under uniform control flow (ggml/951) | |
| 287 | 6084bfb261b03f812de2255b05b6b5bb8d1c7171 | faac0bae265449fd988c57bf894018edc36fbe1e | 2024-09-24T13:23:59+03:00 | Georgi Gerganov | ggml : fix GGML_MAX_N_THREADS + improve formatting (ggml/969) | |
| 288 | 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 | 739842703e32cd43443c45e0b4f6647cc4e6b3d6 | 2024-09-28T14:32:46+02:00 | slaren | test-backend-ops : use flops for some performance tests (#9657) | |
| 289 | 739842703e32cd43443c45e0b4f6647cc4e6b3d6 | 6102037bbb55521880ae78a6ee6c2a0c00c901df | 2024-09-28T15:13:21+03:00 | Georgi Gerganov | llama : add comment about thread-safety [no ci] (#9449) | |
| 290 | 7691654c68aa5316108f881136c59f815ccb6809 | ea9c32be71b91b42ecc538bd902e93cbb5fb36cb | 2024-09-26T09:27:40+08:00 | R0CKSTAR | mtgpu: enable VMM (#9597) | |
| 291 | 3d6bf6919f7b10726421779cd344f2da05421c68 | 904837e0cb2f5f01bf5d5901b7aa57a026860ae4 | 2024-09-25T01:06:52-06:00 | Gabe Goodhart | llama : add IBM Granite MoE architecture (#9438) | |
| 292 | c087b6f11d3385f4293b6841ebfb755063479490 | 116efee0eef09d8c3c4c60b52fa01b56ddeb432c | 2024-09-23T21:18:48-07:00 | Max Krasnyansky | threads: fix msvc build without openmp (#9615) | |
| 293 | f0c7b5edf82aa200656fd88c11ae3a805d7130bf | 1d48e98e4f3316bd2f6b187d288c7b6cb88d5cb3 | 2024-09-23T11:42:43-07:00 | Max Krasnyansky | threads: improve ggml_barrier scaling with large number of threads (#9598) | |
| 294 | f3979df762b75a2b1c0f622a2cd15d1bc60f037f | 1e7b9299c6ccb5bbc55d3db7cfa9b51f3ab09b59 | 2024-09-23T18:43:40+03:00 | Georgi Gerganov | flake.lock: Update (#9586) | |
| 295 | c35e586ea57221844442c65a1172498c54971cb0 | 912c331d3dba3a079815844208dc36164baa8cc7 | 2024-09-22T22:55:49+08:00 | R0CKSTAR | musa: enable building fat binaries, enable unified memory, and disable Flash Attention on QY1 (MTT S80) (#9526) | |
| 296 | 424c5d00a9b97dd5559635872db9b57f87c23b02 | a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 | 2024-09-20T19:04:44+03:00 | Johannes Gäßler | ggml/examples: add backend support for numerical optimization (ggml/949) | |
| 297 | a6809c6a2e8163cba296d4cc0c5cd4bbc8073638 | 5cb12f68395a5ec00b357e408883ce124a11dcdb | 2024-09-08T11:10:43+03:00 | Georgi Gerganov | examples : add null threadpool args where needed (ggml/0) | |
| 298 | 64c6af3195c3cd4aa3328a1282d29cd2635c34c9 | 0d2f22e45c3c3b6f8222acb6284d0c8c93443ba1 | 2024-09-18T19:13:08+02:00 | slaren | ggml : fix n_threads_cur initialization with one thread (#9538) | |
| 299 | 8b836ae731bbb2c5640bc47df5b0a78ffcb129cb | 8344ef58f8cdb8ebd6faf4463ca32ae91c374c81 | 2024-09-17T09:35:38-04:00 | Bert Wagner | arg : add env variable for parallel (#9513) | |
| 300 | 0226613853133c081b55bb892a41bb5eacc0bc94 | 503147a9f9d195d6a14e7c998df23b6eb61f2bae | 2024-09-17T01:19:46-07:00 | Max Krasnyansky | threadpool : skip polling for unused threads (#9461) | |
| 301 | 5c3d0f1824714e9a97fc9b06e046eefcb6ecc721 | 0aadac10c7dd704f8285ddf5a63d6f764cb340aa | 2024-09-16T06:48:24Z | Eve | ggml : IQ4_NL sgemm + Q4_0 AVX optimization (#9422) | |
| 302 | 90a2fff0e7f80c6fea3fc6cf9a7b482744f3f164 | 6262d13e0b2da91f230129a93a996609a2f5a2f2 | 2024-09-16T05:14:23+03:00 | Georgi Gerganov | flake.lock: Update (#9488) | |
| 303 | befaf1197fa447f61714de041828852a270659d2 | feff4aa8461da7c432d144c11da4802e41fef3cf | 2024-09-14T09:50:12+02:00 | Daniel Bevenius | llama : make cell_id const in inp_s_mask block (#9470) | |
| 304 | 5af118efdaf1098798a06b24fd8a557760e99631 | d2b496bff4f353a6429f8e833448f071bd237ba7 | 2024-09-11T10:22:40+02:00 | Johannes Gäßler | CUDA: fix --split-mode row race condition (#9413) | |
| 305 | b34e02348064c2f0cef1f89b44d9bee4eb15b9e7 | 51b603863627c4074e77b7e556e18ece86bdf9a3 | 2024-09-11T09:46:55+08:00 | R0CKSTAR | musa: remove Clang builtins mapping (#9421) | |
| 306 | cb9c933eb2a0d2b514556bdcb934b56dfe5d6771 | 6cd4e034442f71718563e600070c2b6fc389e100 | 2024-09-11T01:46:59+03:00 | Georgi Gerganov | flake.lock: Update (#9360) | |
| 307 | 5fac4d57643b1de8e9ab746f14d2fc4e319ae0c2 | 5fb5e24811cb01d48b482c15a974bfbd9f433e1d | 2024-09-09T21:07:18+05:30 | Prashant Vithule | ggml : vector length agnostic SVE support (#9290) | |
| 308 | efe6a83e3046a94cda38c8be5a7801eadc21d78d | fbb7fcffbcfc50009c275e75982b1603a6cb6b80 | 2024-08-28T10:23:02+02:00 | Salvatore Mesoraca | ggml : fix cont with transposed tensors when one dimension is 1 (ggml/934) | |
| 309 | 9b2c24c0993487d3b34a873980e292da571481f3 | 134bc38ecf3e2c5460581badce289a1ffa680453 | 2024-09-06T23:21:29+02:00 | Xuan Son Nguyen | server : simplify state machine for slot (#9283) | |
| 310 | 4a1411b4f17b6569dc0a067e5914dcc0f738b370 | 8ebe8ddebd68526757c631cd019de009697c63c2 | 2024-09-06T14:06:04+02:00 | Xuan Son Nguyen | server : fix missing lock (#9334) | |
| 311 | 7605ae7daf31c02211bcfec2f46635ef6ec4b98a | 8962422b1c6f9b8b15f5aeaea42600bcc2d44177 | 2024-09-04T02:36:43+03:00 | Georgi Gerganov | flake.lock: Update (#9261) | |
| 312 | f771d064a95d212ddadea452ad0cc1e42b2c3db3 | 6e7d133a5f9409dd257fad90d7f320721b07a1b2 | 2024-09-02T08:25:30-07:00 | yuri@FreeBSD | ggml : add pthread includes on FreeBSD (#9258) | |
| 313 | 6e7d133a5f9409dd257fad90d7f320721b07a1b2 | b60074f1c26d8354053a952844ef3f7ebefd8803 | 2024-09-02T17:11:51+02:00 | Xuan Son Nguyen | server : refactor multitask handling (#9274) | |
| 314 | 8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c | a47667cff41f5a198eb791974e0afcc1cddd3229 | 2024-09-01T22:38:17+08:00 | Molly Sophia | llama : support RWKV v6 models (#8980) | |
| 315 | 42c76d1358021ccdbe8ba89109c143dd7ae166df | 9f7d4bcf5c27d37b0c7da82eeaf9c1499510554b | 2024-08-29T19:20:53-04:00 | Faisal Zaghloul | Threadpool: take 2 (#8672) | |
| 316 | 1d1ccce67613674c75c9c7e3fa4c1e24e428ba48 | 9fe94ccac92693d4ae1bc283ff0574e8b3f4e765 | 2024-08-29T07:28:14+03:00 | Georgi Gerganov | flake.lock: Update (#9162) | |
| 317 | a1631e53f6763e17da522ba219b030d8932900bd | fc54ef0d1c138133a01933296d50a36a1ab64735 | 2024-08-21T17:58:11-04:00 | compilade | llama : simplify Mamba with advanced batch splits (#8526) | |
| 318 | 8455340b874aa90d5f70104c99ed2778d9e31c36 | 2f3c1466ff46a2413b0e363a5005c46538186ee6 | 2024-08-21T09:32:58+02:00 | Daniel Bevenius | llama : std::move llm_bigram_bpe from work_queue (#9062) | |
| 319 | 554b049068de24201d19dde2fa83e35389d4585d | 2339a0be1c8e31fcf4531427183b94f2ef019e56 | 2024-08-18T17:43:32+03:00 | Georgi Gerganov | flake.lock: Update (#9068) | |
| 320 | 8b3befc0e2ed8fb18b903735831496b8b0c80949 | d565bb2fd5a2a58b9924a7a34e77a87c78c52137 | 2024-08-16T17:19:05+02:00 | Xuan Son Nguyen | server : refactor middleware and /health endpoint (#9056) | |
| 321 | 5fd89a70ead34d1a17015ddecad05aaa2490ca46 | 98a532d474c73d3494a5353024cb6a4fbbabbb35 | 2024-08-14T18:32:53+02:00 | 0cc4m | Vulkan Optimizations and Fixes (#8959) | |
| 322 | 98a532d474c73d3494a5353024cb6a4fbbabbb35 | 43bdd3ce188cd247bda7c1bd1ad01fa64e566690 | 2024-08-14T02:51:02-04:00 | compilade | server : fix segfault on long system prompt (#8987) | |
| 323 | 8cd1bcfd3fc9f2b5cbafd7fb7581b3278acec25f | a21c6fd45032a20180e026773582d21294c85619 | 2024-08-11T16:58:58+03:00 | Georgi Gerganov | flake.lock: Update (#8979) | |
| 324 | 272e3bd95e620d285b2fb9faaa7b6b1b8edbbf3a | 45a55b91aa87958a75d691be64b070266d4fbb94 | 2024-08-09T18:24:30+03:00 | Georgi Gerganov | make : fix llava obj file race (#8946) | |
| 325 | be55695eff44784a141a863f273661a6bce63dfc | 0478174d5959b66096ae6609fcb0df14cab66b51 | 2024-08-07T13:29:02+02:00 | slaren | ggml-backend : fix async copy from CPU (#8897) | |
| 326 | db20f50cf4710c46e3a996919a26858cae8c80ed | efda90c93a62274ec0b0bfa80c4eee4bdb6966d0 | 2024-08-06T17:21:47+04:00 | Jaeden Amero | cmake : Link vulkan-shaders-gen with pthreads (#8835) | |
| 327 | 064cdc265fb63590c7c8f04a609d36ef200d55a7 | 5587e57a76630651752031223cc7024cb32cf308 | 2024-08-05T07:52:55+02:00 | 0cc4m | vulkan : fix Qantized Mat-Vec Mul on AMD GPUs for ncols < 64 (#8855) | |
| 328 | ecf6b7f23e664afd7ff856ec39034240ce438daa | 01aae2b4975b57a265ce8194928fd87f2d71027e | 2024-08-04T03:55:03-07:00 | Brian Cunnie | batched-bench : handle empty `-npl` (#8839) | |
| 329 | 4b77ea95f56a4c49bc995f08eac62a6416875ccc | 76614f352e94d25659306d9e97321f204e5de0d3 | 2024-08-04T05:53:20+03:00 | Georgi Gerganov | flake.lock: Update (#8847) | |
| 330 | b7a08fd5e0e7c898c68d1743066ea495202d9608 | 7a11eb3a260915aee16101808f291a244e2facc7 | 2024-08-01T12:53:46-04:00 | Alex O'Connell | Build: Only include execinfo.h on linux systems that support it (#8783) | |
| 331 | ed9d2854c9de4ae1f448334294e61167b04bec2a | 398ede5efeb07b9adf9fbda7ea63f630d476a792 | 2024-07-31T15:51:06-04:00 | Clint Herron | Build: Fix potential race condition (#8781) | |
| 332 | 7c27a19b2eb91bb0f43c7f7aec0386cec2dddc33 | 140074bb8647df41840d6f32f4409fa8959bcf9f | 2024-07-30T23:40:18+09:00 | l3utterfly | added android implementation of ggml_print_backtrace_symbols (#8751) | |
| 333 | 140074bb8647df41840d6f32f4409fa8959bcf9f | 6e2b6000e5fe808954a7dcef8225b5b7f2c1b9e9 | 2024-07-30T15:58:57+03:00 | Georgi Gerganov | flake.lock: Update (#8729) | |
| 334 | 439b3fc75a8deb42899ac47a8f52aae75e0339fe | 0832de723695ab400316a6c49b9f712380e3a731 | 2024-07-29T20:56:12+08:00 | R0CKSTAR | cuda : organize vendor-specific headers into vendors directory (#8746) | |
| 335 | 6eeaeba126ff701f3e8f79f246805b7023709972 | 4730faca618ff9cee0780580145e3cbe86f24876 | 2024-07-28T22:32:44+02:00 | Johannes Gäßler | cmake: use 1 more thread for non-ggml in CI (#8740) | |
| 336 | 4c676c85e59ef8f771f3a129e6eb217552139231 | e54c35e4fb5777c76316a50671640e6e144c9538 | 2024-07-28T00:42:05-04:00 | compilade | llama : refactor session file management (#8699) | |
| 337 | e54c35e4fb5777c76316a50671640e6e144c9538 | 5e2727fe0321c38d1664d26173c654fa1801dc5f | 2024-07-28T07:41:25+08:00 | R0CKSTAR | feat: Support Moore Threads GPU (#8383) | |
| 338 | 45f2c19cc57286eead7b232ce8028273a817aa4d | 22f281aa16f44d8f6ec2c180a0685ff27e04e714 | 2024-07-21T16:45:10+03:00 | Georgi Gerganov | flake.lock: Update (#8610) | |
| 339 | 22f281aa16f44d8f6ec2c180a0685ff27e04e714 | 328884f4219c0228673cf1870ac63987fb4f9fd0 | 2024-07-20T22:09:17-04:00 | M-A | examples : Rewrite pydantic_models_to_grammar_examples.py (#8493) | |
| 340 | 69c487f4ed57bb4d4514a1b7ff12608d5a8e7ef0 | 07283b1a90e1320aae4762c7e03c879043910252 | 2024-07-20T22:25:26+02:00 | Johannes Gäßler | CUDA: MMQ code deduplication + iquant support (#8495) | |
| 341 | 87e397d00bdcedd5cbf6dfda06a7b0f302462728 | 57b1d4f9eb6f2c139b31ea79626d954b261e1051 | 2024-07-19T17:17:27+02:00 | slaren | ggml : fix quant dot product with odd number of blocks (#8549) | |
| 342 | 7acfd4e8d55082c1b597dfc3ffe04fb5d530c6dc | 97bdd26eee11fe109dec00de75690ceef61c03f2 | 2024-07-15T23:13:10-04:00 | compilade | convert_hf : faster lazy safetensors (#8482) | |
| 343 | f17f39ff9cb71fa7b0eda0c649bb0ce9b2d8a6b8 | 9104bc20edf47f74dc49379b7d61d0c6e85a4882 | 2024-07-15T08:04:56-04:00 | M-A | server: update README.md with llama-server --help output [no ci] (#8472) | |
| 344 | aaab2419eaa17ab3aa38f4ba49c7eea406999e99 | 73cf442e7bc9baca7b3e213b261551812f1676c9 | 2024-07-14T18:54:02+03:00 | Georgi Gerganov | flake.lock: Update (#8475) | |
| 345 | 278d0e18469aacf505be18ce790a63c7cc31be26 | dd07a123b79f9bd9e8a4ba0447427b3083e9347a | 2024-07-10T20:08:17-04:00 | Clint Herron | Initialize default slot sampling parameters from the global context. (#8418) | |
| 346 | 0f1a39f3439825acf7e3a1663566d410be152170 | 83321c6958acf20747d288031174cc1bf8816e33 | 2024-07-10T07:14:51-05:00 | Dibakar Gope | ggml : add AArch64 optimized GEMV and GEMM Q4 kernels (#5780) | |
| 347 | 7fdb6f73e35605c8dbc39e9f19cd9ed84dbc87f2 | a130eccef42b75a84da270411cefeed45c153e30 | 2024-07-09T01:36:38+03:00 | Georgi Gerganov | flake.lock: Update (#8342) | |
| 348 | 470939d483d1c89b7292f78bac1fd27c42c171ce | 6f0dbf6ab087bcd286fb78560099ca0458316735 | 2024-07-08T03:26:53-04:00 | Kevin Wang | common : preallocate sampling token data vector (#8363) | |
| 349 | cb4d86c4d723af87d3d7e3177e9485f200391384 | 86e7299ef5dff0f388922dc6fcbce009e99d8005 | 2024-07-07T11:10:38+02:00 | Bjarke Viksøe | server: Retrieve prompt template in /props (#8337) | |
| 350 | 213701b51a17175d0d326b566efc03f30ec7fbe6 | be20e7f49d9e5c6d9e8d9b4871eeba3df7a1639d | 2024-07-05T19:01:35+02:00 | jaime-m-p | Detokenizer fixes (#8039) | |
| 351 | d0a7145ba99ed3a8bc3145aa785b5c86ffe65020 | 9ef07800622e4c371605f9419864d15667c3558f | 2024-07-01T02:09:34+03:00 | Georgi Gerganov | flake.lock: Update (#8218) | |
| 352 | ab3679112d4c49a215a3d31550a7720b202e9015 | 97877eb10bd8e7f8023420b5b5300bcbdadd62dc | 2024-06-27T18:37:29+03:00 | Georgi Gerganov | flake.lock: Update (#8071) | |
| 353 | 9b31a40c6ddabe552875b811d7127aa039ca9703 | c70d117c37cc7876e775d1e2722208a50c52edb3 | 2024-06-27T01:50:09+02:00 | Daniel Bevenius | clip : suppress unused variable warnings (#8105) | |
| 354 | e6bf007744eb06336a231ef39cf08146dd16d2ce | 84631fe1504de40427dc4b4cdac92fa7ebf65955 | 2024-06-25T21:07:28+02:00 | Daniel Bevenius | llama : return nullptr from llama_grammar_init (#8093) | |
| 355 | 3791ad219323389106dc3fd80814eb5bbb7b80de | f702a90e245499283d6de0b287701c723cda2a87 | 2024-06-25T16:57:35+05:30 | HanishKVC | SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950) | |
| 356 | 95f57bb5d5b18ef0beb2702a0d6c06e46804075c | e112b610a1a75cb7fa8351e1a933e2e7a755a5ce | 2024-06-24T03:07:59+02:00 | slaren | ggml : remove ggml_task_type and GGML_PERF (#8017) | |
| 357 | e112b610a1a75cb7fa8351e1a933e2e7a755a5ce | 6a2f298bd784403c5c33eebb822217ec5d9b5590 | 2024-06-24T02:27:57+08:00 | Eddie-Wang | llama : add support for BitnetForCausalLM (#7931) | |
| 358 | b6b9a8e606da7764bd3649c2ea574979c85abd43 | 45c0e2e4c1268c2d7c8c45536f15e3c9a731ecdc | 2024-06-23T13:14:45+02:00 | slaren | fix CI failures (#8066) | |
| 359 | ba5899315283eb1df3902363daf79bdc5eefe426 | a7854743c5e6216a6178824a603aa9479728ddd5 | 2024-06-19T23:57:10Z | sasha0552 | server : fix smart slot selection (#8020) | |
| 360 | 9c77ec1d74874ee22bdef8f110e8e8d41389abf2 | a04a953cab583f0229e7b4b506346e3e9a85c8d0 | 2024-06-19T15:04:15+02:00 | slaren | ggml : synchronize threads using barriers (#7993) | |
| 361 | 6a2f0b3474d479bda4ac2ee7cfd5dcdcf0be1f79 | 21be9cab94e0b5b53cb6edeeebf8c8c799baad03 | 2024-06-17T16:10:15+02:00 | Markus Tavenrath | Implement non-mapped async IO for CUDA on Windows. (#7896) | |
| 362 | bc6c457fa35f6791e9a2bb61108e7d49e8fc98bd | 52399254b3bceda279b4ea9111a983e32310166e | 2024-06-16T19:16:21+03:00 | Georgi Gerganov | flake.lock: Update (#7951) | |
| 363 | cddaf028adc738b5a7ecc60809cb78e0ba0f97c1 | c8a82194a888f68f259e0d0fa96f3332ac7c5cb6 | 2024-06-16T14:50:12+03:00 | Georgi Gerganov | ggml : fix handling of zero blocks in IQ quants (#7955) | |
| 364 | 0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 | 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 | 2024-06-15T18:53:40+02:00 | Xuan Son Nguyen | Add `cvector-generator` example (#7514) | |
| 365 | 76d66ee0be91e2bec93206e821ee1db8d023cff5 | 66ef1ceedf983773c8ceb4d925285d41d4e50e2a | 2024-06-14T18:41:49+02:00 | Johannes Gäßler | CUDA: faster q2_K, q3_K MMQ + int8 tensor cores (#7921) | |
| 366 | f578b86b2123d0f92afbaa98a031df4d4464e582 | 1c641e6aac5c18b964e7b32d9dbbb4bf5301d0d7 | 2024-06-13T03:11:35+02:00 | slaren | move BLAS to a separate backend (#6210) | |
| 367 | 10ceba354a3b152ff425e9fa97f9caaef99a46b1 | e95beeb1fc4621826ddd616776dbdf717366bf5c | 2024-06-10T02:04:50+03:00 | Georgi Gerganov | flake.lock: Update (#7838) | |
| 368 | 7a16ce7db2a74a223f0f3b9cee66d4539c5bce8f | da799b41891e34aac86ce4e173f9c4c0afd4fab3 | 2024-06-08T07:50:31Z | sasha0552 | server : smart slot selection using Longest Common Prefix (#7728) | |
| 369 | 27615f5ab21060d96953c9c1e223051ab2188f57 | 7027b27d765db95d4ac6b569d976e387a8715881 | 2024-06-07T05:15:07-07:00 | intelmatt | cmake : fix BUILD_SHARED_LIBS=ON build (#7784) | |
| 370 | ee459f40f65810a810151b24eba5b8bd174ceffe | f83351f9a62a6262f1fc3d08f320033089cddfb5 | 2024-06-06T19:19:59+03:00 | Georgi Gerganov | server : fix --threads-http arg (#7801) | |
| 371 | ad675e1c67a05b16e4e12abe30dbecfc808e7b7e | a143c04375828b1f72eb1a326115791b63e79345 | 2024-06-06T06:08:52-07:00 | Clint Herron | Added support for . (any character) token in grammar engine. (#6467) | |
| 372 | 9973e81c5ccf4f31b3980f5aa73f5cfea8699860 | c90dbe026b456a233f8f0fbe752212e6a0503ca2 | 2024-06-04T23:40:49-07:00 | arch-btw | readme : remove -ins (#7759) | |
| 373 | 6d1616944d9efd342ed2a4fd318722adfc9febcd | bde7cd3cd949c1a85d3a199498ac98e78039d46f | 2024-06-04T10:01:09+03:00 | Georgi Gerganov | ggml : prevent builds with -ffinite-math-only (#7726) | |
| 374 | a5735e4426b19a3ebd0c653ad8ac01420458ee95 | 0b832d53ba0ffcc759c8d62ede3772dd62321f8e | 2024-06-04T00:14:15+09:00 | Masaya, Kato | ggml : use OpenMP as a thread pool (#7606) | |
| 375 | 6f28a333c1e3fdfdc7b4f9d0367f2b41a9b7e9d4 | 549279d8049d78620a2b081e26edb654f83c3bbd | 2024-06-03T15:49:30+08:00 | zhangkaihuo | llama : MiniCPM support tied embeddings (#7664) | |
| 376 | 1669810d7c2446af8425aa54ff6611bf6f14646c | 7c4e5b7eae26581869e782015d9deca947c34997 | 2024-06-03T00:13:12+03:00 | Georgi Gerganov | flake.lock: Update (#7686) | |
| 377 | 2ac95c9d5678d05e253691fb1f26471675bff5ad | 750f60c03e4d3f53fa51910551ce87a3d508d2d7 | 2024-06-01T21:50:18+05:30 | HanishKVC | SimpleChat: Simple histogram/repeatMatching driven garbageTrimming, Settings UI, Streaming mode, OpenAi Compat (Model, Authorization Bearer), Save/Restore session, Auto Settings UI (#7548) | |
| 378 | 972b555ab935705f3437abd5909a5c46852811f6 | 3854c9d07f67de7f8cd6d86117bfaef47549b05a | 2024-05-30T09:52:39+02:00 | Johannes Gäßler | README: explain parallel build [no ci] (#7618) | |
| 379 | 87bdf2a199acd62e19814d7a4d0500a04a7f09f3 | 00281b7be32462754618c42ed93f95743af46627 | 2024-05-29T13:36:39+02:00 | slaren | ggml : use atomic_flag for critical section (#7598) | |
| 380 | ee3dff6b8e39bb8c1cdea1782a7b95ef0118f970 | edc29433fa08b4e5aeb67649a29fc7713af13d04 | 2024-05-28T17:07:05+02:00 | fairydreaming | Add support for DeepseekV2ForCausalLM (#7519) | |
| 381 | c41767154eb82aa3fe7568fc816c3402b78eae94 | 74b239b3d5f067470d7ef5e26e2e059720572e32 | 2024-05-28T00:41:14-04:00 | Nathan Epstein | Markdownish code block fix (#7571) | |
| 382 | dff451cfa1f297348751ce6b538670e1ae9a7d5b | d298382ad977ec89c8de7b57459b9d7965d2c272 | 2024-05-26T18:54:56+03:00 | Georgi Gerganov | flake.lock: Update (#7540) | |
| 383 | d041d2ceaaf50e058622d92921b3e680ffa4e9e7 | 27891f6db03de6e3fd5941983838c29bef253352 | 2024-05-24T18:59:06+03:00 | Georgi Gerganov | flake.lock: Update (#7232) | |
| 384 | fbca2f27fc7fa9aa4a8ad0357478fdb908472908 | 0df0aa8e43c3378975269a51f9b876c8692e70da | 2024-05-24T14:31:13+02:00 | fairydreaming | Add support for ArcticForCausalLM (#7020) | |
| 385 | 3015851c5ac7334fb544a23a70a284c117b87044 | 55ac3b7aeaf52f19786ed96e885d89521fc0f6c8 | 2024-05-23T14:29:26+02:00 | Daniel Bevenius | llama : add getters for n_threads/n_threads_batch (#7464) | |
| 386 | 1e374365d170b7f692fd7753c145e21bc14486c8 | 197ff91462dd05bb9a3be03578114abf0c355536 | 2024-05-22T23:23:21+05:30 | HanishKVC | SimpleChat: a simple and dumb web front end for testing /chat/completions and /completions end points and try chat (#7350) | |
| 387 | 3bc10cb485dd7efa4da6c64e73ad0c9e2bfe0821 | 6bf9b66fa3f263ca2175dcb5f6d0a658581e1dfb | 2024-05-20T15:10:03+03:00 | Georgi Gerganov | server : fix temperature + disable some tests (#7409) | |
| 388 | cb42c294279bc4a0a4e926a7b5a5568049f12fa7 | d233b507cd19fcc2d8d8963ecc6a3eb7a33f2ecc | 2024-05-18T11:10:47+02:00 | Johannes Gäßler | server: correct --threads documentation [no ci] (#7362) | |
| 389 | d273c1402b25086fd91aef2467ac13f2e49fa0ea | 27b040691cbe45314147c2745e891a38e9c048d4 | 2024-05-17T15:11:45+03:00 | Aarni Koskela | py : convert-hf-to-gguf-update improvements (#7340) | |
| 390 | e1b40ac3b94824d761b5e26ea1bc5692706029d9 | dc020985b8755dd6aa93a2f002f43c3ede808cce | 2024-05-15T12:59:12-05:00 | kunnis | ggml : use dynamic thread scheduling for matrix multiplication (#6915) | |
| 391 | f308ea705974dff62a1fe5367d776ad9d5109239 | c3c88f296a72432edb697ac8026dbf2ec18f2b21 | 2024-05-13T11:01:07+03:00 | Georgi Gerganov | metal : tune soft_max number of threads (whisper/0) | |
| 392 | 541600201e6480f54ae09e58d16b154d4b4b331d | efc8f767c8c8c749a245dd96ad4e2f37c164b54c | 2024-05-14T09:33:42+02:00 | slaren | llama : disable pipeline parallelism with nkvo (#7265) | |
| 393 | 988631335a20d06497f58be0b8ba13adb4323a22 | f99e1e456eaf69cc38c1982a2693ce41c0f897ef | 2024-05-11T04:13:02-04:00 | Steve Grubb | server : free llama_batch on exit (#7212) | |
| 394 | bc4bba364fb96d908f2698e908648df5e6f55e02 | c12452c7aec8a02264afc00196a13caa591a13ac | 2024-05-08T21:55:49+01:00 | agray3 | Introduction of CUDA Graphs to LLama.cpp (#6766) | |
| 395 | b3a995b416e13ae3123a117a743e11d0ede0ca4c | bcdee0daa7c5e8e086b719e5eb4073b00df70e01 | 2024-05-06T18:36:06+03:00 | Georgi Gerganov | flake.lock: Update (#7079) | |
| 396 | 9c67c2773d4b706cf71d70ecf4aa180b62501960 | 952d03dbead16e4dbdd1d3458486340673cc2465 | 2024-04-30T12:16:08+03:00 | Georgi Gerganov | ggml : add Flash Attention (#5021) | |
| 397 | b8c1476e44cc1f3a1811613f65251cf779067636 | 5539e6fdd1b97e0c37c54d34df67f334fc344a26 | 2024-04-29T14:40:14-04:00 | Clint Herron | Extending grammar integration tests (#6644) | |
| 398 | 6e472f58e40cd4acf6023e15c75a2700535c5f0b | 4dba7e8114d84241c842b986e008af8b88d1a019 | 2024-04-28T00:18:27Z | github-actions[bot] | flake.lock: Update | |
| 399 | 7d641c26ac73956a54b204cabefe85c764823678 | 5790c8dac1a4f0aa80b4efee3b962d8c04c829e8 | 2024-04-26T09:26:59+02:00 | Pierrick Hymbert | ci: fix concurrency for pull_request_target (#6917) | |
| 400 | 28103f4832e301a9c84d44ff0df9d75d46ab6c76 | c0d1b3e03e27634ac2871761f5033cf9324d472d | 2024-04-24T11:08:36+02:00 | Johannes Gäßler | Server: fix seed for multiple slots (#6835) | |
| 401 | e9b4a1bf68c18beff4e33f23ea62c1245b296915 | 5cf5e7d490dfdd2e70bface2d35dfd14aa44b4fb | 2024-04-21T00:17:47Z | github-actions[bot] | flake.lock: Update | |
| 402 | 8cc91dc63c0df397d644a581b2cbeea74eb51ae0 | dbceec87c0221ec952e69448df6a71f1372a7487 | 2024-04-16T14:55:30-04:00 | Justine Tunney | ggml : add llamafile sgemm (#6414) | |
| 403 | f184dd920852d6d372b754f871ee06cfe6f977ad | 422c2aff1c9735853c9d8f5162104e41a364adc4 | 2024-04-14T16:55:30+03:00 | Georgi Gerganov | flake.lock: Update (#6669) | |
| 404 | b804b1ef77351d2a11be945462c6c251710476cb | 8228b66dbc16290c5cbd70e80ab47c068e2569d8 | 2024-04-11T14:51:07+02:00 | Pierrick Hymbert | eval-callback: Example how to use eval callback for debugging (#6576) | |
| 405 | 5dc9dd7152dedc6046b646855585bd070c91e8c8 | e11a8999b5690f810c2c99c14347f0834e68c524 | 2024-04-09T09:16:13+01:00 | Carolinabanana | llama : add Command R Plus support (#6491) | |
| 406 | beea6e1b16e783a0886e78dec01002a8c00db24d | 87fb5b4234d4b9c56ac94cf7aa229c8fd7defdb0 | 2024-04-08T20:43:30+08:00 | Jan Boon | llama : save and restore kv cache for single seq id (#6341) | |
| 407 | b909236c0bf0b6e872af95df9490492ecec310ac | e0717e751e12af13f4eedaae8bbbd608e40d7e54 | 2024-04-07T21:25:30+03:00 | Georgi Gerganov | flake.lock: Update (#6517) | |
| 408 | 8120efee1d9931b514aeb5a047209d576f23286c | a74401f0e5ebb15fa4d8b6619d1baa6ea9179123 | 2024-04-04T16:59:04+02:00 | Pierrick Hymbert | ci: bench fix concurrency for workflow trigger dispatch with sha1 (#6478) | |
| 409 | 7a2c92637ae265654a68f62e6a7610b358255d3f | 4bcd6b959ca3991084ad1d8464caf2a734e29b1d | 2024-04-04T11:57:58+02:00 | Pierrick Hymbert | ci: bench: add more ftype, fix triggers and bot comment (#6466) | |
| 410 | 08a0c0206075556e82aca0feafad530dcc5f1426 | 52604860f93063ef98863921da697576af1c7665 | 2024-04-03T15:07:05+02:00 | slaren | ggml : mul_mat_id use the same tensor for all the experts (#6387) | |
| 411 | f87f7b898651339fe173ddf016ca826163e899d8 | 33a52448061cfd2ea44da9e6cb30b2ec22e2f6d0 | 2024-04-01T19:05:57+03:00 | Georgi Gerganov | flake.lock: Update (#6402) | |
| 412 | b75c38166cf0c66793a32d5c3d6cb69929dd083d | bfe7dafc9cf96b9a09ead347fed9a547930fc631 | 2024-03-29T08:15:00+01:00 | Pedro Cuenca | convert : allow conversion of Mistral HF models (#6144) | |
| 413 | 6902cb7f2e3479f364ee177118200fb7e4e9fc92 | d2d8f389960a106b66313ff1621bdb1aaaaaa285 | 2024-03-28T16:50:48+08:00 | Eric Zhang | server : stop gracefully on SIGTERM (#6348) | |
| 414 | 557410b8f06380560155ac7fcb8316d71ddc9837 | 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 | 2024-03-26T10:46:41-04:00 | compilade | llama : greatly reduce output buffer memory usage (#6122) | |
| 415 | 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 | e097633f63fdd26d492844f7eff056e4083fd9eb | 2024-03-26T15:21:27+01:00 | Kawrakow | IQ1_M: 1.75 bpw quantization (#6302) | |
| 416 | 43139cc528909c3de8c144ed174e09a1f7912a80 | 2f34b865b62b1d2b5eb8a27885e4de220deeacbd | 2024-03-25T17:22:27+02:00 | Georgi Gerganov | flake.lock: Update (#6266) | |
| 417 | f482bb2e4920e544651fb832f2e0bcb4d2ff69ab | 1997577d5e121568ae39f538021733ccd4278c23 | 2024-03-23T18:07:00+01:00 | Pierrick Hymbert | common: llama_load_model_from_url split support (#6192) | |
| 418 | 1997577d5e121568ae39f538021733ccd4278c23 | 476b0251b27fb64c575507024a671e639d675594 | 2024-03-23T18:00:38+01:00 | Pierrick Hymbert | server: docs: `--threads` and `--threads`, `--ubatch-size`, `--log-disable` (#6254) | |
| 419 | ee804f6223777019cf921e0d99cc24669313ab98 | 80bd33bc2c4be352697dc8473339f25e1085d117 | 2024-03-23T02:15:06+09:00 | Minsoo Cheong | ci: apply concurrency limit for github workflows (#6243) | |
| 420 | be07a03217376c53b1d95e5f658adbbbb2831555 | d0a71233fbf8ade8ef06ad8e6b81d1d7b254895f | 2024-03-22T06:41:24+08:00 | Jan Boon | server : update readme doc from `slot_id` to `id_slot` (#6213) | |
| 421 | 2d15886bb092c3b780c676b5cc57ff3337af9c83 | d199ca79f279e84ebe27caafe0aa59c461d88969 | 2024-03-17T06:37:44Z | github-actions[bot] | flake.lock: Update | |
| 422 | dc0f6125487dcfbff913360f9d877bc0ccf6aa57 | c47cf414efafb8f60596edc7edb5a2d68065e992 | 2024-03-18T01:12:22+08:00 | GainLee | ggml:fix finding transfer queue family index error (#6094) | |
| 423 | 12247f4c69a173b9482f68aaa174ec37fc909ccf | 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc | 2024-03-15T16:41:22-04:00 | Andrew Canis | llama : add Command-R support (#6033) | |
| 424 | f30ea47a87ed4446ad55adb265755dc9102956a2 | d8fd0ccf6ac8b07791ffd1575eed436930854ae3 | 2024-03-13T18:54:21+01:00 | slaren | llama : add pipeline parallelism support (#6017) | |
| 425 | 8030da7afea2d89f997aeadbd14183d399a017b9 | 184215e783dfad76aded2c68244c327a5c507df5 | 2024-03-12T14:27:20+02:00 | Georgi Gerganov | ggml : reuse quantum structs across backends (#5943) | |
| 426 | 05b06210c954491cf0f12034b0a62bd4d69ce78b | 83796e62bc9f6caae6228168e359890f51e60fee | 2024-03-11T17:49:47+02:00 | Georgi Gerganov | llama : more consistent names of count variables (#5994) | |
| 427 | caa106d4e05a0ab94225c220b81f9e2cd522339b | 3202361c5b1ba15e695b31209567ef42c22c5c32 | 2024-03-11T10:56:41+01:00 | Xuan Son Nguyen | Server: format error to json (#5961) | |
| 428 | be858f620508385ad12d0e5e862010e666ca729c | ef3ced26a3817d92890b97b83acaeb018ade02d0 | 2024-03-11T07:51:49+01:00 | Kawrakow | Better 1.5 bit quantization (#5971) | |
| 429 | fa8a809a9119411bc9c3f00026550d0343f4d9b7 | bcebd7dbf62fd7b293d5ed089023e4e733269c71 | 2024-03-10T18:17:47+01:00 | Pierrick Hymbert | server: ci: windows build and tests (#5968) | |
| 430 | c78541479cf835dd9eb568ccd9a2083198a7203d | 621e86b331f8b0e71f79fd82a4ae1cd54c3e4396 | 2024-03-10T16:43:08+02:00 | Georgi Gerganov | nix: update flake.lock (#5969) | |
| 431 | d894f352bf433157232dc8dc54eacd50014e898e | 098dbaab449f5309a54871ba7e5acef72ae696de | 2024-03-09T19:55:54+01:00 | slaren | perplexity : support using multiple sequences to allow larger batch sizes (#5946) | |
| 432 | c2101a2e909ac7c08976d414e64e96c90ee5fa9e | 515f7d0d4fce41c752fc253acf30707c3be2531e | 2024-03-08T17:31:00-05:00 | compilade | llama : support Mamba Selective State Space Models (#5328) | |
| 433 | 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 | ceca1aef0738b57951cd12c603c3477e75312dec | 2024-03-07T11:41:53+02:00 | Georgi Gerganov | server : refactor (#5882) | |
| 434 | 21b08674331e1ea1b599f17c5ca91f0ed173be31 | 6a87ac3a52668e117d97bcea07b529c93188b303 | 2024-03-05T16:08:35+08:00 | Neo Zhang Jianyu | [SYCL] fix mul_mat fault in CI/unit-test (#5862) | |
| 435 | 67be2ce1015d070b3b2cd488bcb041eefb61de72 | 231ae28f078c3148d097b301f2145f1e3e816cc1 | 2024-03-03T14:26:18+01:00 | slaren | cuda : fix data race in soft max (#5853) | |
| 436 | 8ef969afcec1645d2d9c3ab1fc82263bba968989 | fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 | 2024-03-03T08:48:36+01:00 | Pierrick Hymbert | server : init http requests thread pool with --parallel if set (#5836) | |
| 437 | fa974646e1a2024fc7dc9e6f27cf1f2f5d4a3763 | 9731134296af3a6839cd682e51d9c2109a871de5 | 2024-03-03T06:11:31+02:00 | Georgi Gerganov | flake.lock: Update (#5842) | |
| 438 | bbde6eb2561153aabbdfac5001c690fe00cad639 | ef2cd694c4155fbf25bae61c5178c47eb3676dba | 2024-03-02T17:00:51+02:00 | Kawrakow | ggml : IQ3_S improvements (#5829) | |
| 439 | c29af7e2252d288f2ea58a7d437c1cb7c0abf160 | 38d16b142624bdd7c41d9955752b7f7b59c5e048 | 2024-03-02T01:00:46+05:30 | Sourab Mangrulkar | llama : add StarCoder2 support (#5795) | |
| 440 | 5cb02b4a012bb16c6c699c0c62c05ffa653eee0f | 6ea0f010ff6967034528d9e0b8330b9b0f0b7c13 | 2024-03-01T10:08:08+01:00 | Pierrick Hymbert | server: allow to override threads server pool with --threads-http (#5794) | |
| 441 | 5f706718566e3a5147916dc381f3b99de0ffad47 | a693bea1e6762a17b78b6ddf4611e54136941ea2 | 2024-02-24T11:27:36-05:00 | UEXTM.com | Introduce backend GUIDs (ggml/743) | |
| 442 | a693bea1e6762a17b78b6ddf4611e54136941ea2 | adcb12a9bad87bc96f2f158c95892b3d04aa7ffb | 2024-02-28T09:55:37+01:00 | Xuan Son Nguyen | server : hit Ctrl+C twice to exit (#5734) | |
| 443 | 7c4263d4261d6ee6f0539d53eb9e1b4d120ba8af | cb49e0f8c906e5da49e9f6d64a57742a9a241c6a | 2024-02-28T10:37:02+02:00 | Kawrakow | ggml : make i-quants work with super-blocks of 64 (CPU,Metal) (#5760) | |
| 444 | 0becb22ac05b6542bd9d5f2235691aa1d3d4d307 | c24a2a6e6005e5d424301525a42ba45a4a362d30 | 2024-02-27T16:34:24+02:00 | Kawrakow | IQ4_XS: a 4.25 bpw quantization (#5747) | |
| 445 | c39373398803c669056304090050fe3f44b41bf9 | e3965cf35aac00d4e24998c8a3d0093ae1d98bd3 | 2024-02-25T00:17:11Z | github-actions[bot] | flake.lock: Update | |
| 446 | 930b1780269a69948d106e2d1b838ab7661f679a | d52d7819b8ced70c642a88a59da8c78208dc58ec | 2024-02-25T13:50:32+01:00 | Pierrick Hymbert | server: logs - unified format and --log-format option (#5700) | |
| 447 | d52d7819b8ced70c642a88a59da8c78208dc58ec | 12894088170f62e4cad4f8d6a3043c185b414bab | 2024-02-25T13:49:43+01:00 | Pierrick Hymbert | server: concurrency fix + monitoring - add /metrics prometheus compatible endpoint (#5708) | |
| 448 | 9e359a4f47c1b2dceb99e29706c9f7403d32ab5e | 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 | 2024-02-24T19:16:04+01:00 | Pierrick Hymbert | server: continue to update other slots on embedding concurrent request (#5699) | |
| 449 | 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 | 525213d2f5da1eaf4b922b6b792cb52b2c613368 | 2024-02-24T16:23:52+02:00 | Kawrakow | IQ3_S: a much better alternative to Q3_K (#5676) | |
| 450 | 525213d2f5da1eaf4b922b6b792cb52b2c613368 | fd43d66f46ee3b5345fb8a74a252d86ccd34a409 | 2024-02-24T12:28:55+01:00 | Pierrick Hymbert | server: init functional tests (#5566) | |
| 451 | 1ecea255ebb70750b52688393f37a63606b90e3f | a00a35cef93e057eace8351a667d14d152a91ebc | 2024-02-21T15:47:48+01:00 | Pierrick Hymbert | server: health: fix race condition on slots data using tasks queue (#5634) | |
| 452 | a14679cc30c785e75d38028bae6ec39c6209ddef | 6560bed3f066c876682464762cad90f1e28e3f1b | 2024-02-21T11:39:52+02:00 | Kawrakow | IQ4_NL: 4-bit non-linear quants with blocks of 32 (#5590) | |
| 453 | c0a8c6db371cb3e4379900867b948879f5842201 | b9111bd209c7b11b0592450a6ed2e0ca545b2c84 | 2024-02-20T08:48:19+01:00 | Pierrick Hymbert | server : health endpoint configurable failure on no slot (#5594) | |
| 454 | f0d1fafc029a056cd765bdae58dcaa12312e9879 | a0c2dad9d43456c677e205c6240a5f8afb0121ac | 2024-02-18T23:38:32-08:00 | bmwl | ggml : android and old glibc NUMA incompatibility bugfixes (#5557) | |
| 455 | c145f8a132b2fe1d1e65987faddbd9a40bef7a12 | 689a091bbe0537ee9abff3e15a1d74f5f3561165 | 2024-02-18T18:39:57+01:00 | Pierrick Hymbert | server : slots monitoring endpoint (#5550) | |
| 456 | e75c6279d1c8e7abb82a331f5de7124eed402de2 | 36376abe05a12a8cb3af548a4af9b8d0e2e69597 | 2024-02-18T17:31:28+01:00 | Pierrick Hymbert | server : enhanced health endpoint (#5548) | |
| 457 | 66c1968f7a2e895675425e875b6589f1233a1b52 | 1dcc3fde004787e6fc4d84c9de0bb34cd2901a3e | 2024-02-18T08:23:16-08:00 | Daniel Hiltgen | server : graceful server shutdown (#5244) | |
| 458 | c8e0d7efeb7634ecc2e9832e879ab9fca4510e71 | 8f1be0d42f23016cb6819dbae01126699c4bd9bc | 2024-02-18T00:17:07Z | github-actions[bot] | flake.lock: Update | |
| 459 | f486f6e1e5e9d01603d9325ab3e05f1edb362a95 | 60ed04cf82dc91ade725dd7ad53f0ee81f76eccf | 2024-02-16T01:31:07-08:00 | bmwl | ggml : add numa options (#5377) | |
| 460 | 0d4177126b0556e202efb85bf3f768be81076400 | 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f | 2024-02-15T09:01:57+01:00 | Elbios | llava : fix memory management bug (#5491) | |
| 461 | cf45252a7cfcb998bade46a886e20477cecc538a | 03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc | 2024-02-13T15:14:22+02:00 | Georgi Gerganov | tests : multi-thread the tokenizer tests (#5474) | |
| 462 | 97a336507ed9b971d72262bec7e2b8b7016a054a | c88c74f967028ae3d5ebade40ae586d20a961abc | 2024-02-11T00:17:31Z | github-actions[bot] | flake.lock: Update | |
| 463 | f026f8120f97090d34a52b3dc023c82e0ede3f7d | cd9aea63b577a83def84dbd6dcd90a6fa02af745 | 2024-02-10T02:53:28-08:00 | Ian Bull | metal : use autoreleasepool to avoid memory leaks (#5437) | |
| 464 | 4b7b38bef5addbd31f453871d79647fbae6bec8a | e00d2a62dd1441e3b089570ec06d05c18800d368 | 2024-02-10T05:30:19+11:00 | Neuman Vong | vulkan: Set limit for task concurrency (#5427) | |
| 465 | e5ca3937c685d6e012ac4db40555d6ec100ff03c | e4124c24775f2cb5b3d7acc93bf9dc5471c172ef | 2024-02-09T10:48:06Z | Paul Tsochantaris | llama : do not cap thread count when MoE on CPU (#5419) | |
| 466 | 4ffc7a17d4e80c5f3f905139cb570ed9b6934fcb | 906cff55c2848fda091d888a1585915ec0c9ea9e | 2024-02-06T08:16:23Z | Niall Coates | server : various fixes for the prompt field in /completion (#5300) | |
| 467 | 6fdfa2ecc684000a25a4ad91823bc82a6652b645 | a2d60c9158435ae9a6f14632f07f1acf7a3becef | 2024-02-05T10:46:06+02:00 | Kawrakow | iq2_xxs: tune quantization (#5320) | |
| 468 | 9392ebd49ea5ae236a55b47cbf6a13247e8a3b8c | 5ed26e1fc9fab4ce96ecf2d84183fe45bdcab0d4 | 2024-02-04T00:17:24Z | github-actions[bot] | flake.lock: Update | |
| 469 | e920ed393d989ed35625ddaf182ebb52cda07fcd | 52bb63c7082c859c3f1dfc527227e6a95b299c7c | 2024-02-03T18:15:00+01:00 | 0cc4m | Vulkan Intel Fixes, Optimizations and Debugging Flags (#5301) | |
| 470 | 15606309a05ccf7fadbaad5538cb7c32acb1e06b | b2b9f025e7821e78bd501d75d01838c26de07a57 | 2024-01-31T21:10:15+08:00 | JidongZhang-THU | llava : add MobileVLM support (#5132) | |
| 471 | dabcc5b471348e4ae03ddacc41e19ad75fb2f041 | f8e9140cb46eebaa867e1184a9946e4840eec772 | 2024-01-31T13:43:03+01:00 | slaren | ggml : limit n_threads to the max n_tasks (#5238) | |
| 472 | 2307523d322af762ae06648b29ec5a9eb1c73032 | 0f648573dde61c510560f68244f70ece7e60d8c1 | 2024-01-28T18:03:59+01:00 | 0cc4m | ggml : add Vulkan backend (#2059) | |
| 473 | 0f648573dde61c510560f68244f70ece7e60d8c1 | b764b8f1d079ba44d912801ce6d29bd0d94d51cf | 2024-01-28T21:26:23+05:30 | Abhilash Majumder | ggml : add unified SYCL backend for Intel GPUs (#2690) | |
| 474 | b764b8f1d079ba44d912801ce6d29bd0d94d51cf | 9241c3a2ace544aef708334e54bbdddb90208ee8 | 2024-01-28T16:54:54+02:00 | Georgi Gerganov | flake.lock: Update (#5162) | |
| 475 | b2b2bf988c098851b4f3831f0cf38394bff75121 | af4980bfedfd8df43b9e4cd1442895e85fee37bc | 2024-01-28T09:35:14+01:00 | Johannes Gäßler | Tests for min_p, sampling queue (#5147) | |
| 476 | 7032f4f6349c17a8352f9f93f7d2122f45469e59 | 5f1925a8cef81eb9b372faaae34b0dd76d5361d4 | 2024-01-26T11:17:59-06:00 | snadampal | ggml : update softmax n_task calculation (#5126) | |
| 477 | 48c857aa10aea73210a4a72da3f1a6f99269e75d | 413e7b0559f922bd4de5e9eec548829d111651b1 | 2024-01-26T13:42:20+01:00 | Xuan Son Nguyen | server : refactored the task processing logic (#5065) | |
| 478 | 5eaf9964fc797d4585c214db32a463d557f3ed33 | d292f4f2047963f558dd516f1baaa71793e9acf2 | 2024-01-26T05:06:22+09:00 | l3utterfly | llama : dynamic temperature sampling (#4972) | |
| 479 | bf63d695b804b1c995c7ae4427a8a86936ea6d25 | 1387ea21178f9f154944013d4dd9764b54c69deb | 2024-01-22T03:17:05-07:00 | Michael Hueschen | nix: add cc to devShell LD_LIBRARY_PATH | |
| 480 | 780e24a22eb595b705cbe8284771e9ceff1c4dd2 | 3ce7e8f8e7ccfce07e5947ac5f1f3f4628cf68ea | 2024-01-22T21:15:08+08:00 | Reinforce-II | ggml : parallelize FP32 conversion when using BLAS (#5045) | |
| 481 | f7276f7500f7ea588836dd1fc6f126334c517878 | 15bceec2d73d4166340b46b27677c45ac1b4cdad | 2024-01-13T17:10:19Z | Someone Serge | workflows: nix-ci: rebuild on flake.lock updates | |
| 482 | 7dcbe39d36b76389f6c5cd3b151928472b7e22ff | 726c0fa9a2da976e9c5d5c51e185d9dd453fc9e5 | 2024-01-21T14:42:44+02:00 | Kawrakow | Add ability to evauate multiple choice tasks (#5047) | |
| 483 | 942c0107a7301434c0a5e7da46bc4cf2393aa556 | b43ebde3b0ccbc42d9dd782b32e2fd8eb35b43b5 | 2024-01-21T05:17:27+02:00 | Georgi Gerganov | flake.lock: Update (#5054) | |
| 484 | 7051aacfac0057fa5fac9ea46c55bffc3892d810 | 2b3b999cacc7ad1207c32fbdf3479a19c06e1a34 | 2024-01-19T11:39:11+02:00 | Kawrakow | winogrande: evaluate log-probs in parallel (#5036) | |
| 485 | 96d7f56d2918ffde1995dbb32392571deb76d7fc | 2d5419d08ab1131623e6a1d554607b7663435e87 | 2024-01-18T21:12:15+01:00 | slaren | llama : fix mlock with no-mmap with Metal (#5025) | |
| 486 | 3e945cc1e9c06d2001031360e4e303e9548fb02c | ad19812cda4062c9f154ef16315df41fbe6a770a | 2024-01-18T19:18:21+02:00 | Kawrakow | HellaSwag: speed up by parallelizing log-prob evaluation (#5020) | |
| 487 | ad19812cda4062c9f154ef16315df41fbe6a770a | 682986a08eb5cb04865d2e713449f17304d266d8 | 2024-01-18T15:33:01+02:00 | Georgi Gerganov | perplexity : faster HellaSwag via batching (#5017) | |
| 488 | 4feb4b33eeb1756e46084a4db9230b279af1a480 | 959ef0c0df725c013c7f712eaa7790b8e38a8e20 | 2024-01-16T18:41:42+01:00 | Maximilian Winter | examples : add complete parallel function calling example (#4974) | |
| 489 | c37b3474e61d609d43cccc3bde5d559e80e4f5d1 | 158f8c9e21302114bac3c646f80ea85b52ffa0bd | 2024-01-16T19:13:54+02:00 | Georgi Gerganov | flake.lock: update flake-parts, flake-parts/nixpkgs-lib, and nixpkgs (#4920) | |
| 490 | 158f8c9e21302114bac3c646f80ea85b52ffa0bd | 862f5e41ab1fdf12d6f59455aad3f5dd8258f805 | 2024-01-16T17:05:19Z | Paul Tsochantaris | metal : localized logic in `ggml_metal_graph_compute` (#4924) | |
| 491 | 3a48d558a69c88ac17efcaa5900cd9eb19596ac4 | 7c8d3abd1a17c28fc56b1a4814bc4b29f91d7454 | 2024-01-16T14:41:27+01:00 | Alex Azarov | metal : replace loop of dispatch_async with dispatch_apply (#4934) | |
| 492 | e0324285a569d0583cf2f4a07a2402221ee25f58 | 3e5ca7931c68152e4ec18d126e9c832dd84914c8 | 2024-01-16T12:04:32+01:00 | stduhpf | speculative : threading options (#4959) | |
| 493 | bb0c1392479398f9aba86d9ec98db0b95ede6e6d | 9408cfdad6b1c090a7e1419d4434edc260b7e47e | 2024-01-14T13:26:53+02:00 | Georgi Gerganov | llama : check LLAMA_TRACE env for extra logging (#4929) | |
| 494 | df845cc982e7e2ea7b9900e29d55b15338faa78d | 6b48ed089377330cdb362970a51c1c89b6d857a8 | 2024-01-13T17:29:43+01:00 | David Friehs | llama : minimize size used for state save/load (#4820) | |
| 495 | 356327feb3f66980ab687040495d722696d98970 | ee8243adaa9a9f51ff449213383874e49efe368f | 2024-01-13T09:20:46-05:00 | Ziad Ben Hadj-Alouane | server : fix deadlock that occurs in multi-prompt scenarios (#4905) | |
| 496 | e7e4df031b9e29d4b55a4e0b0295187f6b213db1 | 584d674be622fbf1578694ada6e62eebedbfd377 | 2024-01-12T20:07:38+01:00 | slaren | llama : ggml-backend integration (#4766) | |
| 497 | eab67950068e4b125007d027232c47d2a5831cd0 | d8d90aa343c22fe01429d3540e47ded87e9dcb9d | 2024-01-11T12:41:39-05:00 | Behnam M | server : add `LOG_INFO` when model is successfully loaded (#4881) | |
| 498 | 7a9f75c38b5e62fe27b8a5a3ed823b4a3714024b | 5c1980d8d4c4e0c0af77359f81cc44d90b3f250b | 2024-01-11T02:12:05-05:00 | Behnam M | server : update readme to document the new `/health` endpoint (#4866) | |
| 499 | cd108e641dbdedd8c5641c4cec1762f751f38136 | 57d016ba2d46a6e22517a31a75cebb48f9e234b6 | 2024-01-10T14:56:05-05:00 | Behnam M | server : add a `/health` endpoint (#4860) | |
| 500 | f2eb19bd8bc9f5730d6e05d7a52a9e19bf5ac099 | f3f62f0d835d559e80714bbeb05d03125574e3dd | 2024-01-03T03:43:19-05:00 | Justin Parker | server : throw an error when `slot unavailable` (#4741) | |
| 501 | 5d7002d4372ebf107cfaf46fcd90df27b204f330 | 26f3071d714f0b27ad7f021a46a66a1085480258 | 2024-01-02T04:38:15-06:00 | minarchist | server : add --override-kv parameter (#4710) | |
| 502 | edd1ab7bc34c10a780ee7f9a4499f7689cdad36d | 198ed7ebfc89b8f2b35a8b1655d57bfb57530c1a | 2023-12-31T17:42:22Z | Someone Serge | flake.lock: update | |
| 503 | 68eccbdc5b56f2a2450f9a8463f9934388cafabf | 97bbca6e8522d18041fcde6c3d0907a52ce36446 | 2023-12-29T06:42:26-08:00 | Philip Taron | flake.nix : rewrite (#4605) | |
| 504 | 441f51dca004debf8b275f1bdc08e0f1af7fd8f8 | 38b3de4658292582a8941a2be5c77b40ce6ac0f2 | 2023-12-29T19:23:27+09:00 | Tamotsu Takahashi | ci : build with CLBlast + ggml-opencl use GGML_API (whisper/1576) | |
| 505 | dc68f0054cd279cddddb0cae0c9ef4f9cbaa512a | de8e496437c59e7d1cc84109e3e49a3478aee25a | 2023-12-26T21:23:59+01:00 | slaren | cuda : fix vmm pool with multi GPU (#4620) | |
| 506 | d232aca5a73b290e218a2e48b91023d5e994203f | 31f27758faf4a4bd08101a57c7ec3a473f771f86 | 2023-12-21T21:07:46+01:00 | slaren | llama : initial ggml-backend integration (#4520) | |
| 507 | 880e352277fc017df4d5794f0c21c44e1eae2b84 | 66f35a2f48e1965a13835a523e677223dbf148be | 2023-12-21T18:07:34+01:00 | howlger | py : open merges file as 'utf-8' (#4566) | |
| 508 | 799a1cb13b0b1b560ab0ceff485caed68faa8f1f | fecac45658a99eddc4d6e36ba0310ca8f87a77f0 | 2023-12-13T13:04:25+01:00 | slaren | llama : add Mixtral support (#4406) | |
| 509 | da5eaef1f34d0a1f584cd4a092e7691ea46a9d91 | 5f6e0c0dff1e7a89331e6b25eca9a9fd71324069 | 2023-12-06T09:08:17+01:00 | stduhpf | speculative : support `--color` (#4343) | |
| 510 | 52c8bc3cf312e1caf02d37bfb9d9d865cbe33594 | e4b76bbe316ee50fb17d9ac29e654c0edf830eba | 2023-12-05T15:05:51+05:00 | MaggotHATE | sampling : custom samplers order (#4285) | |
| 511 | 23b5e12eb5a76489b4c3ee22213a081da68b1809 | d208995c6da66f252d4054c1c5a90eb8ccb7a2f7 | 2023-12-04T17:04:21+01:00 | Daniel Bevenius | simple : update error message for KV cache check (#4324) | |
| 512 | 880f57973b8e0091d0f9f50eb5ab4cd4e31582ca | 8d6d9f033b8101f929e445cf45b39e1557ca7934 | 2023-12-01T18:42:11+02:00 | Georgi Gerganov | llama : fix integer overflow during quantization (#4284) | |
| 513 | 8d6d9f033b8101f929e445cf45b39e1557ca7934 | ef47ec18da469423c276b683dd9b5741cee7023e | 2023-12-01T10:41:56+01:00 | Daniel Bevenius | py : add requirements file for convert-hf-to-gguf.py (#4277) | |
| 514 | ef47ec18da469423c276b683dd9b5741cee7023e | 1d144112c0fbbb4ecc07dbcf4f05a380148bd6de | 2023-12-01T10:51:24+02:00 | Georgi Gerganov | ggml : add ggml_soft_max_ext (#4256) | |
| 515 | f43f09366dfd018e4568e23a232aaa8c4f7cfc78 | d2809a3ba2780e00fce5a6149a7eda09f1c0e906 | 2023-11-30T17:25:04-05:00 | Ziad Ben Hadj-Alouane | server : add single-client multi-prompt support (#4232) | |
| 516 | e2bd725f4b39bc5c6234858d158e01248f5ab5bd | 1f5cd83275fabb43f2ae92c30033b384a3eb37b4 | 2023-11-30T20:50:40Z | rhjdvsgsgks | py : fix oai proxy (#3972) | |
| 517 | 8406b0924bf323f37d536dee8b8165c1f3d9d11d | b38a16dfcff88d547f78f52d1bea31b84a05aff7 | 2023-11-28T10:32:03+02:00 | Georgi Gerganov | ggml : re-enable BLAS for CPU when src0 != F32 + remove redundant full offload checks in llama.cpp (#4240) | |
| 518 | 9d5949f04b1f8b76184818abbd99938c2020803f | ff8238f71d56245f4a6dbea693f4ebd81263464d | 2023-11-23T12:34:20+01:00 | Daniel Bevenius | examples : fix typo in parallel example doc comment (#4181) | |
| 519 | f23c0359a32871947169a044eb1dc4dbffd0f405 | 40a34fe8d034bd484efd79ccbb95059ca6308dcb | 2023-11-20T11:35:47+01:00 | Galunid | ci : add flake8 to github actions (python linting) (#4129) | |
| 520 | 532dd74e38c29e16ea1cfc4e7eedb4f2fab3f3cd | e86fc56f7521ca4b18d1d9939e82abd40c2f1c01 | 2023-11-11T22:04:58-08:00 | Richard Kiss | Fix some documentation typos/grammar mistakes (#4032) | |
| 521 | 48ade94538fa509465d71023e49d07aab0ec8cd5 | f28af0d81aa1010afa5de74cf627dcb04bea3157 | 2023-11-05T08:12:13+01:00 | slaren | cuda : revert CUDA pool stuff (#3944) | |
| 522 | d6069051de7165a4e06662c89257f5d2905bb156 | 4ff1046d75e64f0e556d8dcd930ea25c23eb8b18 | 2023-11-02T18:10:39+01:00 | Oleksii Maryshchenko | cuda : use CUDA memory pool with async memory allocation/deallocation when available (#3903) | |
| 523 | 0e40806c1cb3bdf9955ed807ffbe212be85b4c67 | a2758d08e44ce3624d233af4d23c6843e2e735b5 | 2023-11-01T14:42:01-03:00 | bandoti | common : allow caller to handle help/argument exceptions (#3715) | |
| 524 | ff3bad83e29e3009010cbc923bebd769055eaa7f | 82a6646e0221216c41edcdf99f5a44bb051391f5 | 2023-10-28T16:41:07+02:00 | Erik Scholz | flake : update flake.lock for newer transformers version + provide extra dev shell (#3797) | |
| 525 | 34b2a5e1ee4fe6295fb4420eb91131d743694c65 | 6961c4bd0b5176e10ab03b35394f1e9eab761792 | 2023-10-26T22:53:37+03:00 | Georgi Gerganov | server : do not release slot on image input (#3798) | |
| 526 | ad939626577cd25b462e8026cc543efb71528472 | 1717521cdb976a2219888b0e5cba36e210eee9df | 2023-10-24T16:10:43-04:00 | cebtenzzre | server : add parameter -tb N, --threads-batch N (#3584) (#3768) | |
| 527 | 1717521cdb976a2219888b0e5cba36e210eee9df | b2f7e04bd312eaf97eee0523aa09d950d585626b | 2023-10-24T23:08:20+03:00 | Georgi Gerganov | server : do not block system prompt update (#3767) | |
| 528 | 438c2ca83045a00ef244093d27e9ed41a8cb4ea9 | 9e70cc03229df19ca2d28ce23cc817198f897278 | 2023-10-22T22:53:08+03:00 | Georgi Gerganov | server : parallel decoding and multimodal (#3677) | |
| 529 | 0e89203b517c95ec6675eda75d200a60d1e8921d | c67fe68e417f766970fb1feaf2e66458aa24116a | 2023-10-18T16:21:57+03:00 | Georgi Gerganov | speculative : add tree-based sampling example (#3624) | |
| 530 | c67fe68e417f766970fb1feaf2e66458aa24116a | 1117d06607d2d885640ac501f05f0aae5494e2c5 | 2023-10-18T07:21:48-05:00 | Jhen-Jie Hong | metal : implement q5_0 and q5_1 kernels (#3648) | |
| 531 | 2a4bcbacead886996f175f33479d1d874a3e577f | 424b6381c4daeed62e6600e0402e72f39845b58d | 2023-10-13T12:33:16+02:00 | Daniel Bevenius | llama : remove n_threads from llama_decode_internal (#3614) | |
| 532 | a8bdd65525ae86dea905e9866ad369b53e30ac14 | 70c29da118cdb02bfcbd0376c32b5b2236e48e48 | 2023-10-11T15:42:22-04:00 | Michael Coppola | server : add parameter -tb N, --threads-batch N (#3584) | |
| 533 | a1202a31ed8c35705bd09fe91c3e7410c619bd70 | 94e502dfb79430870b42b8e8ee132b4aaa93e4a8 | 2023-10-08T12:21:19+02:00 | Johannes Rudolph | k-quants : fix comments about block sizing (#3499) | |
| 534 | 9ca79d5cbbc8d43f2bff951404b6a40ff1ee3788 | 0c731ca4039ccff86ffab90eaae4ca98037c4496 | 2023-10-06T10:10:13-06:00 | Kerfuffle | kv cache slot search improvements (#3493) | |
| 535 | a8777ad84e00cda0399e827cdf971e2c3fab1da2 | 97af49fa395df77e4c18af0e1655b2fee67c9686 | 2023-10-06T14:16:38+01:00 | pudepiedj | parallel : add option to load external prompt file (#3416) | |
| 536 | e2583cbc29cd7d6d1403f338842c07dfc0467e6c | e8b8d32e8663ffc55a02c9721af3a5190382cbb0 | 2023-10-05T15:57:03+04:00 | shibe2 | CLBlast: Fix handling of on-device tensor data | |
| 537 | 7f1a0fe709ea1a861da2f3759f58a28bf8953c12 | 16bc66d9479edd5ee12ec734973554d4493c5dfa | 2023-09-29T03:51:52+08:00 | Qu Zongfu | ggml : release the requested thread pool resource (#3292) | |
| 538 | 16bc66d9479edd5ee12ec734973554d4493c5dfa | 0512d66670de3f650c579519833c085014b0f200 | 2023-09-28T21:42:38+02:00 | slaren | llama.cpp : split llama_context_params into model and context params (#3301) | |
| 539 | 0512d66670de3f650c579519833c085014b0f200 | 0e76a8992c8200237bbc6471a53fb8796b3872f7 | 2023-09-28T19:31:04Z | Eve | ci : multithreaded builds (#3311) | |
| 540 | 0e76a8992c8200237bbc6471a53fb8796b3872f7 | 2db94d98eda56982d80238840b0652b4137a2a84 | 2023-09-28T20:40:11+02:00 | xaedes | train : finetune LORA (#2632) | |
| 541 | ec893798b7a2a803466cc8f063051499ec3d96f7 | 45855b3f1c7bdd0320aa632334d0b3e8965c26c4 | 2023-09-28T19:04:36+03:00 | Georgi Gerganov | llama : custom attention mask + parallel decoding + no context swaps (#3228) | |
| 542 | 8185710a80531e9ee0c0cb99d3a9c9af1019ab67 | 7eb41179edc56083ef4eb2df7967ac9ff38b34fb | 2023-09-21T10:43:53+02:00 | Johannes Gäßler | CUDA: use only 1 thread if fully offloaded (#2915) | |
| 543 | a51b68765799e75e17c7622f376bfbeb66f1bd70 | 76164fe2e65c058e9ee2c3afd0ad6b182ca57e25 | 2023-09-15T11:09:24+03:00 | Georgi Gerganov | metal : relax conditions on fast matrix multiplication kernel (#3168) | |
| 544 | 4c8643dd6ea1a163bc5979cb69c1e7ab0975bc93 | 35f73049af6c676a106a5a990a819ae0bc3fcd7d | 2023-09-15T00:32:10+08:00 | jameswu2014 | feature : support Baichuan serial models (#3009) | |
| 545 | cb6c44c5e045709b6bb5cc9bb8c9be107c771a78 | a21baeb12202a9020b48c53beaaf4b355228e8ba | 2023-09-08T14:09:21+02:00 | Przemysław Pawełczyk | build : do not use _GNU_SOURCE gratuitously (#2035) | |
| 546 | be8c9c245bd129ebabb80e0a7a8dd7daeb4d30af | be6beeb8d75294552c4918fce06d7b84eebf3d79 | 2023-09-07T15:45:01+02:00 | Kawrakow | metal : parallel RoPE on Metal (#3024) | |
| 547 | d59bd97065cd7ded6c4ecab54b1d5e0b1b11e318 | 35938ee3b0c16f1fbbf240dae21e0228864b938c | 2023-09-05T09:55:33+02:00 | Kawrakow | Guard against all weights in a super-block being zero (#3010) | |
| 548 | 35938ee3b0c16f1fbbf240dae21e0228864b938c | 921772104ba2219bfdc2b2980d05ebc0aa0c92a4 | 2023-09-05T10:46:39+03:00 | Georgi Gerganov | llama : update logic for number of threads when using BLAS | |
| 549 | e8d91589258f9204397a7ac5f9b3c857835c98f8 | bce1fef328941499dc0acb76cc7fd7ac90449c2f | 2023-09-01T11:15:57+03:00 | Kawrakow | metal: somewhat faster f16 x f32 matrix multiply kernel (#2951) | |
| 550 | 8341a25957b319a03d4a811176cd5ad7f2b0fbd4 | 849408957c687cde4ab32c147107f643fc55130b | 2023-08-30T08:29:32+02:00 | staviq | main : log file (#2748) | |
| 551 | 44c117f41ee01c5ac8fb86bba041f08d8b87b46d | 43033b7bb4858da4f591715b3babdf906c9b7cbc | 2023-08-28T21:51:47+02:00 | xaedes | train : mem usage and other improvements (#2439) | |
| 552 | 92b1bbd2ec43c82ec0530ba3c8758846c5790c75 | dd0dc366dab10e8df28d3924e7f313b5c695e908 | 2023-08-28T13:23:55+02:00 | Johannes Gäßler | CUDA: fix RoPE asserts, block sizes (#2833) | |
| 553 | f55538c3ccba9b926846ef862fa830cea08c433e | ebcee207b6058b7f695bb5c203ad87b1066a9790 | 2023-08-28T10:59:08+03:00 | Georgi Gerganov | metal : fix memory leak (#2762) | |
| 554 | c10704d01e21e3dbe4d6ca1026ebff85349dd239 | 230d46c723edf5999752e4cb67fd94edb19ef9c7 | 2023-08-27T18:55:41+03:00 | Georgi Gerganov | llama : fix MPI threads (close #2827) | |
| 555 | 789c8c945a2814e1487e18e68823d9926e3b1454 | c1ac54b77aaba10d029084d152be786102010eb2 | 2023-08-27T09:03:27+02:00 | slaren | ci : add LoRA test to CI (#2650) | |
| 556 | 730d9c681e339b76407659344e5a2cd50af7d7d5 | c7d92e6dfec3f54849f3a0ba373054d29f321ea2 | 2023-08-26T14:13:36-06:00 | Kerfuffle | convert.py : advanced option (#2753) | |
| 557 | 38b16dfca6e5032e6cfb90c1653bf1ba4cf647b4 | 8f8c28e89cb9531211783da697d6e7c445e2af1d | 2023-08-24T12:27:25-04:00 | Shouzheng Liu | metal : bug-fix when enable ggml-alloc (#2757) | |
| 558 | cf658adc832badaaa2ca119fe86070e5a830f8f6 | a192860cfec89a38d59a943623bf595b1fe4495b | 2023-08-23T23:08:04+03:00 | Georgi Gerganov | llm : add Falcon support (#2717) | |
| 559 | 6381d4e110bd0ec02843a60bbeb8b6fc37a9ace9 | dadbed99e65252d79f81101a392d0d6497b86caa | 2023-08-21T23:07:43+03:00 | Georgi Gerganov | gguf : new file format with flexible meta data (beta) (#2398) | |
| 560 | a872a2b28eaefc8d464eaa535c94deeb501666f9 | 0919a0f73d95cfb93a1646a1d1741a0615fe2c5e | 2023-08-17T03:35:53-04:00 | Shouzheng Liu | ggml-alloc : fix discrepency between measure&eval (#2639) | |
| 561 | fc8ef549e50087762a0b4f901cd74b2defcc6ae3 | bf83bff6742c0f1795b4c18695a13a34ac7adf62 | 2023-08-16T16:08:28-04:00 | Shouzheng Liu | metal : enable ggml-alloc (#2627) | |
| 562 | 9ca4abed893685692f90413e4d43153af12342d9 | e59fcb2bc129881f4a269fee748fb38bce0a64de | 2023-08-10T13:11:36-07:00 | DannyDaemonic | Handle `ENABLE_VIRTUAL_TERMINAL_PROCESSING` more gracefully on earlier versions of Windows. | |
| 563 | 93356bdb7a324a8f6570f99d02af392cd4c45796 | 60baff7c8584ec369e53469cad5f92e102b1efe4 | 2023-08-07T14:25:58+03:00 | Georgi Gerganov | ggml : mul mat tweaks (#2372) | |
| 564 | f6f9896ac3d2ff207e18f87dab85d126ceef5236 | 34a14b28ff7f3c98730339bacee035091b2a812a | 2023-08-07T10:52:57+03:00 | Georgi Gerganov | metal : fix out-of-bounds access + inc concurrency nodes (#2416) | |
| 565 | 5f631c26794b6371fcf2660e8d0c53494a5575f7 | 415e99fec27be5a2e4283f1937afd17eb33fbd66 | 2023-08-04T06:37:24-05:00 | Stephen Nichols | Fixing race condition in server and partial stream handling in frontend. (#2391) | |
| 566 | 1a941869cbef8e9cc351a6c6987e4ae3b0f021f7 | b5472ea0ada081a6e1c06998ebbc9a24aa2cd4a4 | 2023-07-27T11:00:54+03:00 | Georgi Gerganov | metal : disable graph concurrency optimization due to bug (#2413) | |
| 567 | 1aa18ef994a6a2b531434eb13251ef48e56d345b | 9a08eaf3c4010962d0126e9e5bfbe9af64b2ac90 | 2023-07-25T08:00:19-04:00 | Shouzheng Liu | metal : concurrently dispatch commands (#2358) | |
| 568 | 57921ca6db53e08eb90010fba99add85be28b5a1 | 3602ac4255fd4cd589821346290b464a64b955d1 | 2023-07-23T21:33:02+08:00 | wzy | common : n_threads == -1 uses std::thread::hardware_concurrency() (#2347) | |
| 569 | e76d630df17e235e6b9ef416c45996765d2e36fb | 1d0824b2476e7fda09751a0235c9e571b76d6f2c | 2023-07-23T15:09:47+03:00 | Georgi Gerganov | llama : grouped-query attention + LLaMAv2 70B support (#2276) | |
| 570 | 417a85a0010519224cf154eb85d383ffeafeeead | 294f424554c1599784ac9962462fc39ace92d8a5 | 2023-07-20T06:32:22-04:00 | Shouzheng Liu | metal: minor q4 optimization and reduce code size (#2248) | |
| 571 | a7e20edf2266169ccd97a4eb949a593d628fbd64 | 1d656d6360359cfdaaf5d64ed9690047b600dbcb | 2023-07-07T21:23:57+03:00 | Georgi Gerganov | ci : switch threads to 1 (#2138) | |
| 572 | 72421402834141df6cbdcf595fe46dbd11874dce | 3e08ae99ceb143d67f9273fda47541e9d98ff23f | 2023-07-07T18:36:37+03:00 | Georgi Gerganov | ggml : remove sched_yield() call in ggml_graph_compute_thread() (#2134) | |
| 573 | 7ee76e45afae7f9a7a53e93393accfb5b36684e1 | acc111caf93fc6681450924df9f99679c384c59e | 2023-07-04T10:05:27-04:00 | Tobias Lütke | Simple webchat for server (#1998) | |
| 574 | 9d23589d638dc74577d5ff880e6d4248b795f12e | 0be54f75a6c3e9a09ea71bdfcdabf9a996a0549b | 2023-06-27T19:06:33+02:00 | Erik Scholz | fix pthreads setaffinity usage on android (#2020) | |
| 575 | b853d456018b10820686362af41b2f2f75f1eec6 | 9225baef71407d799a6f7f563b77fd7f82791416 | 2023-06-26T13:57:59-04:00 | zrm | ggml : add NUMA support (#1556) | |
| 576 | 6769e944c727c63612dcafbef52009d21ae00fff | cbebf61ca7584e9709265395f0127ae7fc0f1882 | 2023-06-26T19:43:07+03:00 | Kawrakow | k-quants : support for super-block size of 64 (#2001) | |
| 577 | 2c9380dd2f77e41149340f3ecb09764d793b16db | 051e1b0e6a6e3aee7d989b47760980e6fda5861c | 2023-06-17T19:15:02+02:00 | Johannes Gäßler | Only one CUDA stream per device for async compute (#1898) | |
| 578 | 794db3e7b982fee37e3995db9c3a216a57ff65e3 | 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 | 2023-06-17T07:53:04-04:00 | Randall Fitzgerald | Server Example Refactor and Improvements (#1570) | |
| 579 | 4bfcc855abdb2c9fcc3c5a84747974521909fa41 | 6b8312e7979b852f6b6ac9d29cd51fda16c17948 | 2023-06-15T20:29:48+03:00 | Georgi Gerganov | metal : parallel command buffer encoding (#1860) | |
| 580 | e32089b2c20b1b87b22912f4a8b93fe01647d5b9 | 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 | 2023-06-13T21:04:40+02:00 | xaedes | train : improved training-from-scratch example (#1652) | |
| 581 | 74a6d922f12ccfe16b0c265f43be8978c6f25e98 | e4caa8da59c1c97dc23fa336f4d726984a20560f | 2023-06-12T22:39:21+03:00 | Kawrakow | Metal implementation for all k_quants (#1807) | |
| 582 | 4f0154b0bad775ac4651bf73b5c216eb43c45cdc | ef3171d16241c18581d4d08374f0b9e396ade6b7 | 2023-06-10T01:59:17-06:00 | Kerfuffle | llama : support requantizing models instead of only allowing quantization from 16/32bit (#1691) | |
| 583 | 245fc3c37da5ac5963f9f11a9f4f2ac08d96afc6 | 72ff5282bf0388c60821f504c4c8cc2b1f491aa6 | 2023-06-09T10:39:59+03:00 | Kawrakow | metal : faster q4_0 (#1775) | |
| 584 | 17366df842e358768c0df7024484fffecfc7865b | 44f906e8537fcec965e312d621c80556d6aa9bec | 2023-06-06T21:33:23+02:00 | Johannes Gäßler | Multi GPU support, CUDA refactor, CUDA scratch buffer (#1703) | |
| 585 | d5b111f53d14972669eb52055f9df2567663ad8b | 2d43387dafe9c60f15f57aa23ee0b37864b98b32 | 2023-06-07T01:00:01+08:00 | LostRuins | Clblast fixes + enhancements to save VRAM and offload more layers (#1675) | |
| 586 | ecb217db4fcfa3880300ad08531a5fb6bb142d45 | dcb2ed48268e421baf25adc00d602dad0f415564 | 2023-06-04T23:34:30+03:00 | Georgi Gerganov | llama : Metal inference (#1642) | |
| 587 | dcb2ed48268e421baf25adc00d602dad0f415564 | d8bd0013e8768aaa3dc9cfc1ff01499419d5348e | 2023-06-04T08:12:05+02:00 | 0cc4m | OpenCL: Fix duplication of layers in VRAM and RAM, add GPU mul kernel (#1653) | |
| 588 | 1fcdcc28b119a6608774d52de905931bd5f8a43d | ac7876ac20124a15a44fd6317721ff1aa2538806 | 2023-05-25T23:07:29+02:00 | Johannes Gäßler | cuda : performance optimizations (#1530) | |
| 589 | 79b2d5b69d80be0bf29312fb9a95854876b0a8a5 | 13c351ad7292c5b5ab35db25c7a4f993e75d9cfd | 2023-05-14T17:55:02+02:00 | xaedes | ggml : alternative fix for race condition bug in non-inplace ggml_compute_forward_diag_mask_f32 (#1454) | |
| 590 | 13c351ad7292c5b5ab35db25c7a4f993e75d9cfd | 60f8c361ca26328ef8523dfb08077fe2f1034490 | 2023-05-14T18:22:50+03:00 | Georgi Gerganov | ggml : various fixes (#1450) | |
| 591 | 66841fdb0eaf0cc210757cc7f683d0f4eebadc21 | 905d87b70aa189623d500a28602d7a3a755a4769 | 2023-05-13T16:48:03+03:00 | Georgi Gerganov | ggml : multi-thread mul and diag_mask ops (#1428) | |
| 592 | 905d87b70aa189623d500a28602d7a3a755a4769 | f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b | 2023-05-13T15:38:36+02:00 | Johannes Gäßler | ggml : GPU-accelerated token generation (#1412) | |
| 593 | f954edda935a70a14cf0cc45ecc7fe7d60cf3e4b | f048af0230ad5381bb20b9e3c1467ec6fc7debdf | 2023-05-13T14:56:40+02:00 | xaedes | ggml : implement backward pass for llama + small training-llama-from-scratch example (#1360) | |
| 594 | b9fd7eee57df101d4a3e3eabc9fd6c2cb13c9ca1 | b608b55a3ea8e4760c617418538465449175bdb8 | 2023-05-12T00:23:08+03:00 | Georgi Gerganov | ggml : remove bit shuffling (#1405) | |
| 595 | 58b367c2d757c0ea12aec672382462b42204c724 | ea3a0ad6b6b5ca4693b94acd4cb32e2803f66fae | 2023-05-01T18:11:07+02:00 | slaren | cuBLAS: refactor and optimize f16 mat mul performance (#1259) | |
| 596 | ea3a0ad6b6b5ca4693b94acd4cb32e2803f66fae | 2bdc09646d8c6cb74a6f573e9081586b4b83b9d1 | 2023-05-01T08:58:51-04:00 | xloem | llama : update stubs for systems without mmap and mlock (#1266) | |
| 597 | a5d30b1f53677cb50791fec41c43e93274347303 | 76a884920aa1d2fc0dc7a7ac12dfc5ec5816377c | 2023-04-30T14:41:35-04:00 | jon-chuang | common : better default number of threads (#934) | |
| 598 | 7296c961d9303010a2b98379f738da2a8a55aa1b | 78ec543733d10a1629f984fd0302fdaa4e87fe66 | 2023-04-28T16:57:16+02:00 | 0cc4m | ggml : add CLBlast support (#1164) | |
| 599 | 7a32fcb3b29f4db8aed8a85dc58eb958fb118153 | dd0eabc049fb1efc631cab8eb0a646808d704e18 | 2023-04-25T23:40:51+03:00 | Georgi Gerganov | ggml : add Q8_0 quantization format (rename the old one to Q8_1) (ARM NEON) (#1179) | |
| 600 | 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 | 25d7abbd1f73582b7e0fdc422a936e8541c0780b | 2023-04-21T21:59:17+02:00 | slaren | Improve cuBLAS performance by using a memory pool (#1094) | |
| 601 | 018f2279f5fe3ef743bd8254b23ea8f0efae7e73 | 9411288271ab548216902a029f42a0a38ebcedb7 | 2023-04-22T02:27:06+08:00 | 源文雨 | cmake : link threads publicly to ggml (#1042) | |
| 602 | 1bfc153e2f35ddd9d64b084e8d1a5e6fa57ad1c9 | 3d59769c3bb7e72c915646ddb1e239b1face19f5 | 2023-04-21T17:18:26+02:00 | Kawrakow | ggml : a faster version for Q4_1 x Q8_0 dot products (#1083) | |
| 603 | 38de86a7114c97ecf3644e3a60159f1ed893e1b0 | e0305ead3a072db9c08b35c9600c49273b38a4b5 | 2023-04-20T19:42:27+02:00 | Kawrakow | llama : multi-threaded quantization (#1075) | |
| 604 | f7d05095b404b5500b4a702ea16f67fc22446e49 | 884e7d7a2bfd7325b107442d6758983f5886ed3d | 2023-04-19T20:20:14+02:00 | Kawrakow | Q4_2 quantization with rmse-optimized scale and quants (#1062) | |
| 605 | 66674012389f9537140044290f8517bc4a5e0b74 | 77a73403ca8eaced2590559d0f9cebd2b3649d32 | 2023-04-19T00:53:24+02:00 | slaren | Multi-threaded ggml_cpy (#1035) | |
| 606 | 77a73403ca8eaced2590559d0f9cebd2b3649d32 | 50a8a2af97cb92e53e7a3195aa201c3d87da5415 | 2023-04-18T23:54:57+03:00 | Georgi Gerganov | ggml : add new Q4_2 quantization (ARM only) (#1046) | |
| 607 | 723dac55fa2ba7adc6e3fc8609781d1ad0378906 | 0f07cacb05f49704d35a39aa27cfd4b419eb6f8d | 2023-04-14T00:03:03-07:00 | comex | py : new conversion script (#545) | |
| 608 | a3a2a0eda8828b60436e9f69d9ac2c1060d03e7a | d990e3fffc5b0f5448e90a16c79a4f2675100af0 | 2023-04-13T18:36:40+03:00 | Georgi Gerganov | ggml : add GGML_DEFAULT_N_THREADS | |
| 609 | 95ea26f6e92d620a5437f576b80868aee7f808d6 | 82d146df9b43cf677e0dbce20b03cf864958a0cc | 2023-04-13T14:46:23+02:00 | SebastianApel | benchmark : add tool for timing q4_0 matrix multiplication (#653) | |
| 610 | 2663d2c6784ad7b77998c6874df25648d597f74b | a0caa34b162449b5c13b8d604573053300ff54a1 | 2023-04-11T06:19:54-07:00 | comex | Windows fixes (#890) | |
| 611 | f963b63afa0e057cfb9eba4d88407c6a0850a0d8 | aaf3b23debc1fe1a06733c8c6468fb84233cc44f | 2023-04-08T12:24:37-07:00 | comex | Rewrite loading code to try to satisfy everyone: | |
| 612 | eeaa7b0492fc79baab8bb1fe195d6c87159f2bd3 | 986b6ce9f99503c51ec5afd8a10baa32359434c6 | 2023-04-05T22:11:03+03:00 | Georgi Gerganov | ggml : multi-thread ggml_rope() (~3-4 times faster on M1) (#781) | |
| 613 | 6f23ba5ee235cbcb1eedd63b98422dd8d4392a78 | 78ca9838ee36660a776e97e3391b6fb5dcaacf7f | 2023-03-30T01:53:36-07:00 | Justine Tunney | Ensure --mlock works properly with mmap() support | |
| 614 | 78ca9838ee36660a776e97e3391b6fb5dcaacf7f | a017390358cdb23fffb30988dc84bb190d0403ca | 2023-03-29T13:51:37-07:00 | Justine Tunney | Make loading weights 10-100x faster | |
| 615 | 41318d708ed196ff727dce14d263a64b23c7333d | a6956b25a1c783e5e96fe06c9c00438f846ef047 | 2023-03-29T18:10:07+02:00 | Maël Kerbiriou | llama : use the same threshold for OpenBLAS and ggml thread limiting (#577) | |
| 616 | c1f885067c61191a07a1aedf684168dda62f3f71 | e0670260fb50a882b37074112b1881fb0820cf77 | 2023-03-28T15:56:03Z | Stephan Walter | ggml : introduce structs for the q4 data blocks (#356) | |
| 617 | ecbe466a364876927994e2f1ec14f4d82301d201 | 502a400192013d3e95ed87b777e8fa3bec45713c | 2023-03-25T19:47:21+02:00 | Georgi Gerganov | Retire the ggml_mul_mat() branch for transposed src0 (#500) | |
| 618 | 4640eff23d341a0273587800e17ff4a378132d60 | ab77d7631211b299cb734bea6ad1f74324154150 | 2023-03-25T17:03:10+02:00 | Georgi Gerganov | Don't interefe with BLAS for large prompts by running only 1 thread | |
| 619 | 563cdc391dde140f1084d1012234e8e6f57f881f | 8d4a855c241ecb0f3ddc03447fe56002ebf27a37 | 2023-03-24T08:19:05-07:00 | comex | Support calling mlock() on loaded model data on Linux and macOS (#453) | |
| 620 | 483bab2e3d4a868fe679d8bb32827d2a4df214dc | 404e1da38ec8025707031a8027da14dc1590f952 | 2023-03-23T23:22:01+02:00 | Georgi Gerganov | Avoid the transposed X branch in the Z = X * Y matrix multiplication (#439) | |
| 621 | ae44e23ee36c02da0e37ab508a4b473ace724f8e | 928480ef5b7b03d7a07e98286aebe3d8b24457d9 | 2023-03-22T07:47:15+02:00 | Georgi Gerganov | When seed <= 0 - use the clock to generate one | |
| 622 | 2e664f1ff413995506c9a54f3a8d5b8c64e37a91 | 8cf9f34eddc124d4ab28f4d2fe8e99d574510bde | 2023-03-21T07:35:42-07:00 | Casey Primozic | Add initial AVX512 support for dot product on Linux (#320) | |
| 623 | 7392f1cd2cef4dfed41f4db7c4160ab86c0dfcd9 | ad5fd5b60cfdfbfb22b0f2bc9e9f6c9692768f8d | 2023-03-19T12:38:44-06:00 | Suaj Carrot | Improved quantize script (#222) | |
| 624 | 4f546091102a418ffdc6230f872ac56e5cedb835 | e81b9c81c101f64531ef0fa1ee6b77d562635652 | 2023-03-17T21:46:46+02:00 | Georgi Gerganov | Default to 4 threads (#243) | |
| 625 | 367946c668757532deed929e1d78673c6ac6bcb8 | 6b0df5ccf360fe5c015f6607f0375bfc6849005e | 2023-03-17T17:47:35Z | Stephan Walter | Don't tell users to use a bad number of threads (#243) |